论衡:一个多 Agent 深度长文流水线
用 AI 写深度文章,最容易出三个毛病:编造引用、材料堆砌、重复他人观点。论衡(lunheng-article-pipeline)就是为解决这三个问题而生的一套多智能体写作流水线。它已经在 ClawHub 技能市场上连续 5 次 Security=CLEAN 扫描通过,跑通了 3 篇不同主题、不同规模的深度长文 + 1 次 v2.1.8 三方并行 dry-run 验证。这一篇,是一次完整的能力边界说明。
为什么需要流水线:直接对话 vs 论衡
理论上,直接和 AI 对话也能写出一篇深度文章——开头钩子、几个观点、配几个例子。但在 5000 字以上的深度文上,几乎必然撞到三面墙:
第一面墙:幻觉与溯源失联。 AI 不会主动告诉你「这条引用我没查到 URL」「这个数字是 2021 年的现在可能不准」。对话结束,这些错误就永远留在文里——你得到一篇「看起来完整但站不住脚」的文章。
第二面墙:审计缺位。 对话模式下,写作者和审计者是同一个 AI(甚至同一个人)。你让 AI 写完再让它自己审——它倾向于说「好的,我看了一遍没大问题」。这是角色冲突,不是质量问题。
第三面墙:执行层脆弱。 写到一半卡住 10 分钟、AI 直接消失、你也不知道它写到哪了——这种事故在长对话里几乎必然发生,但没有任何应对机制。
论衡的核心优势不是「更聪明的 AI」,而是「机制保证严谨」——把一篇深度文的写作拆成 7 个角色 + 5 个阶段,给每个角色加独立审计,给执行层加韧化机制,给外发项加主人控制。差异如下:
| 维度 | 直接对话写 | 论衡写 |
|---|---|---|
| 角色分工 | 1 个 AI 全包 | 7 个角色(主控 / T1-T7)各司其职 |
| 证据底座 | 自由发挥,易幻觉 | 三角验证(文献 + 数据 + 案例) |
| 引用规范 | 自由引用,无审计 | 三不原则 + G0-G11 十一项独立审计 |
| 引用编号对齐 | 经常错位 | 文末四节 + 双向 diff 机械化校验 |
| 人在环 | 写完才审(被动) | 四节点强制人工确认(主动) |
| 模型超时 | 没救,等死 | 30s 心跳 + 8 分钟硬卡 + 4 模型 fallback |
| 部分失败应对 | 整段重写 | 主控介入 6 步标准动作 |
| 能力边界 | 不清楚能做什么 | 5 类不适用场景明示 |
| 外发控制 | 默认全发(被动) | Phase 0 强同意关卡 4 选 1(主动) |
| 实战验证 | 不可复用 | 3 篇不同主题深度文 + v2.1.8 dry-run 三方并行验证(74 条证据 14 分钟跑通) |
| 安全审计 | 无 | ClawHub Security=CLEAN 连续 5 次(v2.1.8 verdict=clean) |
| 检索架构(v2.1.8) | 单次串行检索 | T1∥T2∥T6 三方真并行 + 互不干涉 + 0 条空卡协议 |
最本质的差异:直接对话靠「prompt 工程」,把所有责任压在主控一个角色身上——「能不能写好」取决于你 prompt 写得有多精;论衡靠「机制设计」,把责任拆给 7 个角色 + 11 项独立审计 + 4 道人工关卡——「能不能写好」取决于机制本身的设计。
一句话总结:对话写考验的是你的提问能力;论衡写考验的是你的把关能力。对话写 AI 帮你想,但 AI 也会帮你错;论衡写 AI 帮你写,但机制逼它站得住脚。
真人写论文 vs 论衡:不是替代,是辅助
真人写论文(受过学术训练的研究者)和论衡写论文,差异更大。先说清楚论衡不能替代真人的部分,再说清楚论衡能辅助真人的部分。
论衡不能替代真人的 5 件事
- 学术训练——方法论、理论框架、研究设计,论衡完全没有
- 一手研究——实验 / 调查 / 访谈 / 田野调查,5 类不适用场景明示
- 原创思考——多年学术直觉、跨学科联想、理论贡献,论衡无法涌现
- 学术身份——投稿署名 / 答辩陈述,论衡无法承担学术责任
- 学术圈互动——同行交流、会议反馈、审稿人挑战,论衡无法参与
真人写论文的核心是「学术训练 + 一手研究 + 深度思考」;论衡写论文的核心是「多角色分工 + 独立审计 + 主人把关」。两者不是替代关系。
论衡能辅助真人的场景
| 场景 | 真人自己做 | 论衡辅助 |
|---|---|---|
| 文献综述初稿 | 一篇篇读、记笔记、整合 | T1 文献检索员生成 [Lxx] 文献卡 + 三角验证 |
| 数据检索 + 制图 | 查数据库 + Excel 整理 | T2 数据检索员生成 [Dxx] 数据卡 + SVG 可视化 |
| 引用规范 | EndNote + 手动核对 | 文末四节 + 双向 diff 机械化校验 |
| 学术公众号深度文 | 自己写 2-3 天 | 论衡 2 小时完成 |
| 跨学科综述 | 自己啃多个领域 | T1/T2 并行检索(重量场景 T6 也并行),主控综合 |
| 反方论证 | 自己想 | T3 分析员强制反方规划 |
| 论文结构 | 自己拟大纲 | 生成大纲,主人修改(Phase 2.5 强节点) |
速度 / 成本对比
- 真人写一篇 8000 字深度文:数天(含文献阅读 + 整理 + 写作 + 校对,估算)
- 论衡写一篇 8000 字深度文:约 2 小时(含主人在环 4 节点时间)
- 真人引用准确性:约 90-95%(凭记忆 + EndNote 抽检,估算)
- 论衡引用准确性:强制 URL/DOI + 双向 diff 校验(事故后归零)
一句话
真人写论文靠学术训练;论衡写论文靠机制设计。 论衡不是更聪明的真人,是更严谨的协作伙伴——真人做研究、想概念,论衡做检索、整合、初稿、规范。
学术期刊投稿这种需要学术身份的工作,仍是真人做;公众号深度文章 / 行业报告 / 政策评论 / 跨学科综述这种「时效 + 严谨 + 结构化」的工作,论衡是优势。
一、它是什么:七角色 × 五阶段
论衡把一篇文章的生产,拆成 7 个 AI 角色 + 5 个阶段,各司其职、层层把关。
主线六角色
- 主控(Coordinator)——定题、拆解、派发、终检、状态机
- T1 文献检索员(Literature Scout)——检索真实文献,产出文献卡 [Lxx](标 A/B/C 可信度)
- T2 数据检索员(Data Scout)——检索有溯源的数据,产出数据卡 [Dxx](标 🟢🟡🔴 时效),冲突时强制并列呈现;顺带产出案例卡 [Cxx]
- T3 分析员(Analyst)——把素材变成论证结构,做论点-论据映射 + 反方论证规划
- T4 写手(Writer)——按大纲成文,引用标号、数字溯源、严守写手铁律 + 去 AI 味纪律
- T5 审计员(Auditor)——独立挑错,只审不改(G0-G11 十一项独立审计)
可选 / 终检
- T6 案例检索员(Case Scout)——重量场景独立 spawn,专门检索事件结构证据
- T7 终检交付——四节引用清单 + 双向 diff 校验 + 主人终审
五阶段推进
- Phase 0 定题(人)—— 主人确认主题、期刊模板、引用格式 → 写
01-任务简报.md+ 初始化status.md - Phase 1-3 流水线 —— T1/T2 并行 → T3 → Phase 2.5 大纲主人确认 → T4 → Phase 3.5 洞察补充
- Phase 4 审计 —— T5 R1 → 写手交修订说明 + 修订稿(≤2 轮)→ T5 R2
- Phase 4.5 配图 ——
image_generate封面 + SVG 矢量风插图 - Phase 5 终稿 —— 主人终审 + T7 终检交付(含文末四节引用清单)
写手只看主控派发的素材卡片;审计员只看已成型的稿件——这种「流水线上的物理隔离」,是后续所有审计和质控机制能成立的基础。
二、三角验证:每句话都有证据底座
论衡最核心的设计是「三角验证」——任何论点都必须能映射到三类证据:
- 文献卡 [Lxx] —— 理论 / 学术依据(这事有没有人研究过)
- 数据卡 [Dxx] —— 量级 / 趋势(这事多大、占比多少)
- 案例卡 [Cxx] —— 事件结构(这事具体怎么发生的)
三类卡片不够就标 GAP,不许编造;写手只能写卡片里真实存在的内容。
为什么有「案例卡」这一块?论衡最早只设计了文献 + 数据两类证据,遇到「这事具体怎么发生的」类论点(比如企业行为、突发公共事件)就只能编故事——这违反「不编造」原则。补上案例卡后,T6 案例检索员在重量场景下独立 spawn,专门检索事件结构证据;审计加 G2.5 案例核验防止「案例描述失真 / 伪造细节」。
三、三不原则 + G0-G11 十一项独立审计
三不原则(质量底线)
- 不编造 —— 引用带 URL/DOI,数据带来源年份,审计分级抽验;防「幻觉 / 假引用 / 假数据」
- 不堆砌 —— 强相关性铁律:每条材料必答「它支撑哪个论点」+ 反向淘汰自查;防「材料凑数 / 观点堆砌」
- 不重复 —— T1 先行者检索 + T3 差异点声明 + 审计 G7 原创性审计;防「重复 / 改写已公开文章」
G0-G11 十一项独立审计
审计员只挑错不修改,把「改稿」责任留给写手。任意一项不通过,主控就 spawn 写手交「修订说明 + 修订稿」,最多 2 轮。第 2 轮还不过主控直接接管修订。
- G0 全局设计一致性
- G1 任务边界符合度
- G2 来源真伪核验
- G2.5 案例描述核验
- G3 引用标号与文末对应
- G4 数据溯源 + 文末数据来源节
- G5 反方论证完整性
- G6 论据类型自标(观点来源 vs 理论贡献)
- G7 原创性审计
- G8 成品度审计(8 项:过程语言 / 角色元数据 / 临时编号 / 元话语 / 修订文件 / 占位符 / 结构对称 / 字数偏差)
- G9 时序合理性(4 项:总耗时 / 分阶段 ack / 心跳记录 / 文件时间戳)
- G10 核心模型一致性(五方主体三处表述一致审计)
- G11 数据时效失效告警(🟡 / 🔴 数据超过时效阈值自动报警)
审计员把这十一项当独立标尺——任意一项「红」都会在审计报告里标黄标红、写手必须逐项回应。这种「只挑错不背锅」的分工,是流水线和单兵 AI 最本质的区别。
四、人在环:四节点必须人工确认
AI 不是黑箱。论衡在四个关键节点强制人工介入:
- Phase 0 定题 —— 主人确认主题、期刊模板、引用格式
- Phase 2.5 大纲 —— 主人确认论证方向(改方向成本最低)
- Phase 3.5 洞察补充 —— 主人在审计前补一线经验 / 具体场景
- Phase 5 终稿 —— 主人终审
为什么要有 Phase 3.5?前面只有「定题 → 大纲 → 终稿」三节点,结果主人一线教学经验如果在终审后插入,会冲掉已经审计过的文末四节;在审计前插入,主人可以把自己对论文最有价值的「实战细节」嵌进正文相应位置。结果调整之后,「具体到刺痛感」的内容有了它该在的节点。
五、执行层韧化
内容质量的前提是流水线不能中途崩溃。论衡开发中遇到过一次关键事故——T3 分析员连续三个模型(deepseek-v4-pro / minimax-m3 / claude-opus-5)全部超时,主控亲自下场补大纲。这不是能力问题,是执行层根本没考虑模型会超时。
为此设计了三层韧化机制:
30 秒心跳 + 分阶段 ack
每个角色卡接收任务后必须 30 秒内 ack。按任务时长分 3 档(小任务 5 分钟 / 中等 15 分钟 / 大任务 30 分钟),超时按档位分级响应。
模型健康度预检
T 派发前主控先做「1-token ping」测活,30 秒无响应降级 fallback。agents.defaults.models.fallbacks 配 4 档:deepseek-v4-flash → deepseek-v4-pro → minimax-M3 → claude-opus-5。
8 分钟硬卡
单个 T 角色卡超过 8 分钟必须 kill:6 分钟警告 → 7 分钟 partial 产出抢救 → 8 分钟 kill 让位下一个 T。主控「介入机制」补 6 步标准动作(拍醒 → 查 sessions → 换模型重派 → 接受 partial → 写介入日志 → 重试上限 2 次)。
韧性化和审计是同一件事的两面——这次事故也直接催生了 G8 成品度审计和 G9 时序合理性审计。
六、文末四节引用清单
论衡最初只交付「参考文献」一节。结果教师场域孤岛定稿时,主人终审发现文末缺数据 / 案例两节来源清单:35 条 [Dxx] 和 8 条 [Cxx] 全部裸奔——写手只搬运了 [Lxx] 参考文献,主控终检没卡,审计 G4 只审引用编号不审 final 阶段。
「不修复不许发。」
现在文末固定四节:
- 数据来源([Dxx] 全部数据点带年份 / 单位 / 链接)
- 案例来源([Cxx] / [C-主xx] 全部案例带事件结构 + 各方说法链接)
- 参考文献([Lxx] 全部文献带 DOI / URL)
- 先行者文献(原创性保证引入,列出已检索到的同主题文章 + 本文差异点声明)
每节写完后必须做双向 diff 机械化校验——这是所有项目交付前的硬卡:
# 引用了但文末没列出的 = 漏
comm -23 <(grep -oP '\[L\d+\]' 初稿.md | sort -u) \
<(grep -oP '^\*\*\[L\d+\]' 参考文献.md | sort -u)
# 文末列了但正文没引用的 = 假引
comm -13 <(grep -oP '\[L\d+\]' 初稿.md | sort -u) \
<(grep -oP '^\*\*\[L\d+\]' 参考文献.md | sort -u)
双向 diff 通过才允许发布。这套机制之后,再没出现过「引用编号对不齐」类事故。
七、边界明示:5 类不适用场景
论衡是「论文 / 深度文章」写作流水线,擅长主动检索已发布证据 + 整合主人投喂的证据。
论衡能主动采集(T1 文献 / T2 数据 / T6 案例)
- ✅ 已发布的学术文献(PubMed / CNKI / Web of Science)
- ✅ 已发布的统计数据(教育部 / 统计局 / 行业协会)
- ✅ 已发布的案例与报道(媒体 / 法院判决 / 行业报告)
- ✅ 政府发布的统计 / 报告 / 调查 / 政策文件
论衡不能主动采集(需主人投喂)
- ❌ 一手原始数据采集 —— 实验 / 调查 / 访谈 / 田野调查
- ❌ 统计分析(SPSS / R / Python)—— 可引用结果,不执行计算
- ❌ 图表原始数据采集 —— 做可视化,但爬虫 / OCR / 语音转文字需主人专门工具
- ❌ 原创图片 / 视频生成 —— 有
image_generate(封面 / 插图),但不拍摄实物 / 录制视频 - ❌ 代码执行 ——
exec不在 15 项白名单内
判断口诀:问「这个证据是已发布的数据 / 文献 / 案例吗」——是,论衡主动采集;不是,主人投喂后再用。
这个边界是怎么来的?主人在评审教师场域孤岛论文时提出一句话:「实验数据和调查问卷部分没法做,除非主人投喂内容与数据。」论衡最初会尝试主动编一个看起来合理的实验方案——这违反「不编造」原则。现在改成「明确告知主人需要投喂 + 等待投喂 + 整合投喂」三步走。
论衡的能力定位调整也值得一提:之前曾用「证据的下游整合器」作为口号——这话有点绝对,论衡本身就是个主动采集系统,只是某些类型不能采集。现在的表述改成「能主动采集 vs 不能主动采集」二分法,更准确。
八、Phase 0 强同意关卡
论衡流水线下面任何一个阶段调用以下工具,会发数据到外部服务商——主控必须在 Phase 0 给主人「4 选 1」明示同意:
| 选项 | 适用 | 零外发项 |
|---|---|---|
| ① 全部同意(默认) | 公开主题 / 不介意外发 | 无 |
② 脱敏 + SVG 封面 + 本地 Ollama(gemma4:31b) |
未公开主题 / 客户内部 / 商业机密 | OpenClaw web / Tavily / OpenAI / Google / minimax-image / 主控推理 |
| ③ 部分同意 | 主人指定具体外发项 | 主人未勾选的项 |
| ④ 全部拒绝 | 极端敏感 | 全部 → 改纯本地(Ollama + SVG) |
主人选项 + 同意时间写入 01-任务简报.md 头部作为审计可追溯依据。
ClawHub Security 状态:到 ClawHub 技能市场以来连续四次 Security=CLEAN 扫描通过。这中间曾有一次盲区:scanner 页面 UI 显示 Moderate CLEAN,但其实 advisory findings 字段还藏了 6 项 MEDIUM / LOW——「UI 干净 ≠ 实际干净」这种情况直到被一位安全意识强的用户抓出来才注意到。修法很简单:所有 user-facing 警告一律放文件顶部(不再埋在 changelog / operational rules 里),扫描器一看就懂;扫描结果变成 6 项 findings 全部归零。
九、实战案例(3 篇 + 1 次 dry-run 验证)
v2.1.7 实战跑通 3 篇不同主题的深度长文。v2.1.8 升级后新增 1 次 dry-run 实战验证(中国短剧出海 ≥ 9 条案例)证明三方真并行架构可实战。
| 文章 | 版本 | 规模 | 关键产出 | 验证重点 |
|---|---|---|---|---|
| 品牌一致性 | v2.1.6 | ~7900 字 / 15 文献 + 54 数据点 | 证据包三件套,审计复核 8 项全修复 | 首篇测试流水线 |
| 原创性悖论 | v2.2 | ~9500 字 / 12 文献 + 34 数据 + 6 案例 | 4 轮修订,A- 评级 | T5 R2 通过案例 |
| 教师场域孤岛 | v2.1.4 | ~12000 字 / 18 文献 + 47 数据 + 9 案例 | T5 R2 通过,G10 一致性审计首发 | 文末四节闭环驱动案例 |
| 中国短剧出海 dry-run | v2.1.8 | ~10000 字规划 / 12 [L] + 46 [D] + 12 [C] = 74 条 | 三方真并行 14 分钟 + 12 论点三角验证 | v2.1.8 三方并行 + 0 条空卡 + 互不干涉架构实战验收 |
dry-run 含义:v2.1.8 架构跑真实论文项目能达到的下限标准——三方真并行 14 分钟 + 74 条证据 + 三角验证 12 论点。下次真实论文项目(重量场景)就是这套标准。
九·五、v2.1.8 架构升级详解:三检索员独立并行 + 0 条空卡协议 + 互不干涉铁律
v2.1.7 的六角色 + T6 案例员是「可选重量场景」机制——轻/中案例由 T2 数据员兼带出。这导致三个问题:
- 检索焦点混乱:T2 的 prompt 同时要管数据 + 案例,检索关键词被分散;
- 案例质量不稳定:轻量场景 T2 顺带出案例时,案例方法论被稀释(只有 30-40% 精力在案例);
- 失败传染:T2 案例检索失败会拖累数据检索。
v2.1.8 全面重构了检索层——任何量级(含 0 条)必 spawn T6 案例员,与 T1 文献员 + T2 数据员三方真并行,互不干涉。
1. 三方真并行:wall-clock 节省 38-50%
T1∥T2∥T6 三个独立 sessions_spawn 在同一 function_calls 块内并发启动——
- v2.1.7 串行:T1(8 分钟) + T2(12 分钟含案例)= 20 分钟
- v2.1.8 并行:max(T1=8 分钟, T2=8 分钟, T6=8 分钟) = 8 分钟
实战 dry-run 验证(B 场景:中国短剧出海 ≥ 9 条案例,2026-08-17 12:37):
| 检索员 | 模型 | runtime | 实际产出 |
|---|---|---|---|
| T1 文献 | deepseek-v4-flash | 1 分 57 秒 | 12 条 [L01-L12] |
| T2 数据 | deepseek-v4-flash | 3 分 00 秒 | 46 条 [D01-D46] |
| T6 案例 | deepseek-v4-flash | 3 分 00 秒 | 12 条 [C01-C12] |
| 三方并行总墙钟 | 14 分钟 | 74 条证据(含 4 条先行者) |
2. 0 条空卡协议:cases=0 场景的优雅处理
v2.1.7 对「主题本身就是方法论/框架性内容,不需要案例」的场景没有专门机制——T2 顺带出案例会强行出 [C01-C03],污染论文结构。
v2.1.8 引入0 条空卡协议:
- 触发条件:任务简报明确声明「主题为方法论 / 框架 / 不需要案例」
- T6 prompt 显式声明:「本次任务无案例需求,输出 [C-空] 卡」
- 空卡格式:
[C-空] 本次任务无案例需求
├ 主题:<任务简报主题>
├ 主题属性:方法论 / 框架 / 纯理论
├ 案例数量:0 条
├ 显式声明:本次任务根据任务简报判定无案例需求
├ T6 状态:spawn + 空卡 + 立即 Done
└ T0 合并层处理:标记「本次无案例需求」,不阻塞主流程
结果链:T0 主控合并层收到 [C-空] → status.md 标 本次无案例需求 → T3 分析员按三角验证 [L]+[D] 双档降级启动 → T5 审计 G2.5 案例专项审计自动跳过(案例数 = 0)。
3. 互不干涉铁律:技术实现
三方检索员严格隔离:
| 维度 | T1 文献 | T2 数据 | T6 案例 |
|---|---|---|---|
| 写入路径 | literature/文献卡.md |
data/数据卡.md |
cases/案例卡.md |
| 读取对方产物 | 可读 T2 [Dxx] | 可读 T1 [Lxx] | 可读 T1 [Lxx] + T2 [Dxx] |
| 失败隔离 | 失败不拖累 T2/T6 | 失败不拖累 T1/T6 | 失败不拖累 T1/T2 |
| 上下文隔离 | 独立 sessions | 独立 sessions | 独立 sessions |
硬约束:
– ❌ T6 不写 data/ 目录(属 T2 职责)
– ❌ T2 不写 cases/ 目录(属 T6 职责)
– ❌ T6 不做纯数据检索(纯量级数字归 T2)
– ✅ 三角验证由 T0 主控合并层统一处理
– ✅ 任一 T 失败,T0 标「[待补]」+ 三角降级,不阻塞其他 T
4. v2.1.7 → v2.1.8 升级对比
| 维度 | v2.1.7 | v2.1.8 |
|---|---|---|
| T6 触发 | 仅重量场景 | 任何量级必 spawn(含 0 条空卡协议) |
| T1/T2/T6 并行 | T1∥T2(两方) | T1∥T2∥T6(三方真并行) |
| T2 职责 | 数据 + 案例兼带 | 纯量级数据(案例完全移交 T6) |
| 三档决策 | 轻/中走 T2 / 重量走 T6 | 取消(任何量级都走 T6) |
| 失败隔离 | T2 失败拖累数据 + 案例 | 三方独立失败隔离 |
| 0 条场景 | T2 强行出案例 | T6 [C-空] 卡 + T0 标记「无案例需求」 |
| wall-clock | T1+T2 串行 ~20 分钟 | 三方并行 ~8-14 分钟(节省 38-50%) |
| 实战验证 | 3 篇真实论文 | 3 篇真实论文 + 1 次 v2.1.8 dry-run 验证(74 条证据三方真并行) |
| ClawHub scan | CLEAN(连续 4 次) | CLEAN(v2.1.8 verdict=clean) |
| 升级教训 | #43-#51 | #56 + #58 + #59 + #60(v2.1.8 架构教训) |
5. 升级 5 层真源同步(教训 #49 + #60)
v2.1.8 升级涉及5 层真源同步(不是 4 层):
- Git commit + tag:
952ce4c+v2.1.8(本地 + 远程一致) - paperwriter 真源 + ClawHub 副本:15 文件双端 md5 一致
- OpenClaw 配置层:论衡 description + model.fallbacks 4 档 + profile coding
- GitHub Web UI:description + 5 topics + 顶层 README
- OpenViking entity memory:论衡 v2.1.8 完整描述
- ClawHub skill ZIP 推送:
lunheng-article-pipeline@2.1.8(scan verdict=clean)
5 层真源 SOP 是 v2.1.8 升级核心教训:每次 release 必须显式列出所有 5 层同步触发点(cp / config.patch / GitHub API / memory_store / clawhub publish),各层独立触发不自动对齐。
6. 实战迁移建议
如果你已经在用 v2.1.7 跑真实论文项目,v2.1.8 升级是无缝迁移——
- ✅ run/ 目录实战项目不需要改动(历史归档,教训 #46)
- ✅ 论衡 v2.1.8 发布后,实战项目按新机制跑(cases=0 也走 T6 空卡协议)
- ✅ 三角验证表自动生成 [L]+[D]+[C] 三档(v2.1.7 是 [L]+[D] 双档 + 案例卡可选)
- ⚠️ 实战项目
01-任务简报.md需要显式声明cases 需求量(含 0 条场景) - ⚠️ 论衡 agent profile 标签从
full改为coding(跟 novelist 一致,仅标签,实际工具集不变)
第三篇是文末四节 + 双向 diff 校验机制的驱动案例——主人终审时发现文末缺数据 / 案例两节来源清单,「不修复不许发」。这次事故直接推动了现在的引用清单四节化设计。
怎么用
前置条件
需要能跑 OpenClaw 的环境(CLI 或 daemon),版本 ≥ 0.23.3。
方式一:从 ClawHub 一键安装(推荐)
openclaw skills install lunheng-article-pipeline
装好后自动注册到 OpenClaw workspace:
openclaw skills list | grep lunheng
方式二:从 GitHub 克隆本地安装
git clone https://github.com/zuoyunlai/lunheng-article-pipeline.git
cd lunheng-article-pipeline
openclaw skills add $(pwd)
验证安装
openclaw skills list | grep lunheng
# 应看到:lunheng-article-pipeline 1.0.x
开始使用
在 OpenClaw 主会话里直接对 AI 说:
用论衡写一篇关于 XXX 的深度长文(约 8000 字)
主控会按七角色流水线自动推进:定题(Phase 0)→ 文献检索 + 数据检索(T1 / T2 并行)→ 分析员(T3)→ Phase 2.5 主人大纲确认 → 写手(T4)→ Phase 3.5 主人洞察补充 → 审计(T5 R1)→ 写手修订 ≤2 轮 → 审计(T5 R2)→ 配图(Phase 4.5)→ 终检(Phase 5 主人终审 + T7 终检交付)。
使用者会在四个节点被叫醒确认:定题、大纲、洞察补充、终稿。
模型与配置
论衡默认按能力分层选模型(检索便宜快 / 分析写作强推理 / 审计顶配 / 主控稳定),可在 pipeline/README.md 的「模型配置与更换指南」章节里换成自己本机可用的任意 OpenClaw 兼容模型。
尾声:论衡的定位
论衡是「严谨落地器」——原创想法来自人机对话,它负责把想法变成站得住脚的文章。5 类不适用场景作为边界明示,「能主动采集 vs 不能主动采集」二分法作为能力定位,Phase 0 强同意关卡把外发项控制权完全交给主人。
防御性机制不是缺陷,是定位——保证严谨才是深度分析最值钱的东西。如果你也在用 AI 写深度内容,欢迎拿去用、提意见。具体行动:GitHub star / 提交 issue / 知乎或小红书讨论(搜索「论衡 lunheng」)。
- GitHub:github.com/zuoyunlai/lunheng-article-pipeline(MIT)
- ClawHub:OpenClaw 技能市场可一键安装
- 论衡定位:严谨落地器,非概念生成器






