跳到主要内容

论衡:一个多 Agent 深度长文流水线

zuoyunlai 15 min read
论衡:一个多 Agent 深度长文流水线

用 AI 写深度文章,最容易出三个毛病:编造引用材料堆砌重复他人观点。论衡(lunheng-article-pipeline)就是为解决这三个问题而生的一套多智能体写作流水线。它已经在 ClawHub 技能市场上连续 5 次 Security=CLEAN 扫描通过,跑通了 3 篇不同主题、不同规模的深度长文 + 1 次 v2.1.8 三方并行 dry-run 验证。这一篇,是一次完整的能力边界说明。

为什么需要流水线:直接对话 vs 论衡

理论上,直接和 AI 对话也能写出一篇深度文章——开头钩子、几个观点、配几个例子。但在 5000 字以上的深度文上,几乎必然撞到三面墙:

第一面墙:幻觉与溯源失联。 AI 不会主动告诉你「这条引用我没查到 URL」「这个数字是 2021 年的现在可能不准」。对话结束,这些错误就永远留在文里——你得到一篇「看起来完整但站不住脚」的文章。

第二面墙:审计缺位。 对话模式下,写作者和审计者是同一个 AI(甚至同一个人)。你让 AI 写完再让它自己审——它倾向于说「好的,我看了一遍没大问题」。这是角色冲突,不是质量问题。

第三面墙:执行层脆弱。 写到一半卡住 10 分钟、AI 直接消失、你也不知道它写到哪了——这种事故在长对话里几乎必然发生,但没有任何应对机制。

论衡的核心优势不是「更聪明的 AI」,而是「机制保证严谨」——把一篇深度文的写作拆成 7 个角色 + 5 个阶段,给每个角色加独立审计,给执行层加韧化机制,给外发项加主人控制。差异如下:

维度 直接对话写 论衡写
角色分工 1 个 AI 全包 7 个角色(主控 / T1-T7)各司其职
证据底座 自由发挥,易幻觉 三角验证(文献 + 数据 + 案例)
引用规范 自由引用,无审计 三不原则 + G0-G11 十一项独立审计
引用编号对齐 经常错位 文末四节 + 双向 diff 机械化校验
人在环 写完才审(被动) 四节点强制人工确认(主动)
模型超时 没救,等死 30s 心跳 + 8 分钟硬卡 + 4 模型 fallback
部分失败应对 整段重写 主控介入 6 步标准动作
能力边界 不清楚能做什么 5 类不适用场景明示
外发控制 默认全发(被动) Phase 0 强同意关卡 4 选 1(主动)
实战验证 不可复用 3 篇不同主题深度文 + v2.1.8 dry-run 三方并行验证(74 条证据 14 分钟跑通)
安全审计 ClawHub Security=CLEAN 连续 5 次(v2.1.8 verdict=clean)
检索架构(v2.1.8) 单次串行检索 T1∥T2∥T6 三方真并行 + 互不干涉 + 0 条空卡协议

最本质的差异:直接对话靠「prompt 工程」,把所有责任压在主控一个角色身上——「能不能写好」取决于你 prompt 写得有多精;论衡靠「机制设计」,把责任拆给 7 个角色 + 11 项独立审计 + 4 道人工关卡——「能不能写好」取决于机制本身的设计。

一句话总结:对话写考验的是你的提问能力;论衡写考验的是你的把关能力。对话写 AI 帮你想,但 AI 也会帮你错;论衡写 AI 帮你写,但机制逼它站得住脚。

真人写论文 vs 论衡:不是替代,是辅助

真人写论文(受过学术训练的研究者)和论衡写论文,差异更大。先说清楚论衡不能替代真人的部分,再说清楚论衡辅助真人的部分。

论衡不能替代真人的 5 件事

  • 学术训练——方法论、理论框架、研究设计,论衡完全没有
  • 一手研究——实验 / 调查 / 访谈 / 田野调查,5 类不适用场景明示
  • 原创思考——多年学术直觉、跨学科联想、理论贡献,论衡无法涌现
  • 学术身份——投稿署名 / 答辩陈述,论衡无法承担学术责任
  • 学术圈互动——同行交流、会议反馈、审稿人挑战,论衡无法参与

真人写论文的核心是「学术训练 + 一手研究 + 深度思考」;论衡写论文的核心是「多角色分工 + 独立审计 + 主人把关」。两者不是替代关系。

论衡能辅助真人的场景

场景 真人自己做 论衡辅助
文献综述初稿 一篇篇读、记笔记、整合 T1 文献检索员生成 [Lxx] 文献卡 + 三角验证
数据检索 + 制图 查数据库 + Excel 整理 T2 数据检索员生成 [Dxx] 数据卡 + SVG 可视化
引用规范 EndNote + 手动核对 文末四节 + 双向 diff 机械化校验
学术公众号深度文 自己写 2-3 天 论衡 2 小时完成
跨学科综述 自己啃多个领域 T1/T2 并行检索(重量场景 T6 也并行),主控综合
反方论证 自己想 T3 分析员强制反方规划
论文结构 自己拟大纲 生成大纲,主人修改(Phase 2.5 强节点)

速度 / 成本对比

  • 真人写一篇 8000 字深度文:数天(含文献阅读 + 整理 + 写作 + 校对,估算)
  • 论衡写一篇 8000 字深度文:约 2 小时(含主人在环 4 节点时间)
  • 真人引用准确性:约 90-95%(凭记忆 + EndNote 抽检,估算)
  • 论衡引用准确性:强制 URL/DOI + 双向 diff 校验(事故后归零)

一句话

真人写论文靠学术训练;论衡写论文靠机制设计。 论衡不是更聪明的真人,是更严谨的协作伙伴——真人做研究、想概念,论衡做检索、整合、初稿、规范。

学术期刊投稿这种需要学术身份的工作,仍是真人做;公众号深度文章 / 行业报告 / 政策评论 / 跨学科综述这种「时效 + 严谨 + 结构化」的工作,论衡是优势。

一、它是什么:七角色 × 五阶段

论衡把一篇文章的生产,拆成 7 个 AI 角色 + 5 个阶段,各司其职、层层把关。

主线六角色

  • 主控(Coordinator)——定题、拆解、派发、终检、状态机
  • T1 文献检索员(Literature Scout)——检索真实文献,产出文献卡 [Lxx](标 A/B/C 可信度)
  • T2 数据检索员(Data Scout)——检索有溯源的数据,产出数据卡 [Dxx](标 🟢🟡🔴 时效),冲突时强制并列呈现;顺带产出案例卡 [Cxx]
  • T3 分析员(Analyst)——把素材变成论证结构,做论点-论据映射 + 反方论证规划
  • T4 写手(Writer)——按大纲成文,引用标号、数字溯源、严守写手铁律 + 去 AI 味纪律
  • T5 审计员(Auditor)——独立挑错,只审不改(G0-G11 十一项独立审计)

可选 / 终检

  • T6 案例检索员(Case Scout)——重量场景独立 spawn,专门检索事件结构证据
  • T7 终检交付——四节引用清单 + 双向 diff 校验 + 主人终审

五阶段推进

  1. Phase 0 定题(人)—— 主人确认主题、期刊模板、引用格式 → 写 01-任务简报.md + 初始化 status.md
  2. Phase 1-3 流水线 —— T1/T2 并行 → T3 → Phase 2.5 大纲主人确认 → T4 → Phase 3.5 洞察补充
  3. Phase 4 审计 —— T5 R1 → 写手交修订说明 + 修订稿(≤2 轮)→ T5 R2
  4. Phase 4.5 配图 —— image_generate 封面 + SVG 矢量风插图
  5. Phase 5 终稿 —— 主人终审 + T7 终检交付(含文末四节引用清单)

写手只看主控派发的素材卡片;审计员只看已成型的稿件——这种「流水线上的物理隔离」,是后续所有审计和质控机制能成立的基础。

二、三角验证:每句话都有证据底座

论衡最核心的设计是「三角验证」——任何论点都必须能映射到三类证据:

  • 文献卡 [Lxx] —— 理论 / 学术依据(这事有没有人研究过)
  • 数据卡 [Dxx] —— 量级 / 趋势(这事多大、占比多少)
  • 案例卡 [Cxx] —— 事件结构(这事具体怎么发生的)

三类卡片不够就标 GAP,不许编造;写手只能写卡片里真实存在的内容。

为什么有「案例卡」这一块?论衡最早只设计了文献 + 数据两类证据,遇到「这事具体怎么发生的」类论点(比如企业行为、突发公共事件)就只能编故事——这违反「不编造」原则。补上案例卡后,T6 案例检索员在重量场景下独立 spawn,专门检索事件结构证据;审计加 G2.5 案例核验防止「案例描述失真 / 伪造细节」。

三、三不原则 + G0-G11 十一项独立审计

三不原则(质量底线)

  • 不编造 —— 引用带 URL/DOI,数据带来源年份,审计分级抽验;防「幻觉 / 假引用 / 假数据」
  • 不堆砌 —— 强相关性铁律:每条材料必答「它支撑哪个论点」+ 反向淘汰自查;防「材料凑数 / 观点堆砌」
  • 不重复 —— T1 先行者检索 + T3 差异点声明 + 审计 G7 原创性审计;防「重复 / 改写已公开文章」

G0-G11 十一项独立审计

审计员只挑错不修改,把「改稿」责任留给写手。任意一项不通过,主控就 spawn 写手交「修订说明 + 修订稿」,最多 2 轮。第 2 轮还不过主控直接接管修订。

  • G0 全局设计一致性
  • G1 任务边界符合度
  • G2 来源真伪核验
  • G2.5 案例描述核验
  • G3 引用标号与文末对应
  • G4 数据溯源 + 文末数据来源节
  • G5 反方论证完整性
  • G6 论据类型自标(观点来源 vs 理论贡献)
  • G7 原创性审计
  • G8 成品度审计(8 项:过程语言 / 角色元数据 / 临时编号 / 元话语 / 修订文件 / 占位符 / 结构对称 / 字数偏差)
  • G9 时序合理性(4 项:总耗时 / 分阶段 ack / 心跳记录 / 文件时间戳)
  • G10 核心模型一致性(五方主体三处表述一致审计)
  • G11 数据时效失效告警(🟡 / 🔴 数据超过时效阈值自动报警)

审计员把这十一项当独立标尺——任意一项「红」都会在审计报告里标黄标红、写手必须逐项回应。这种「只挑错不背锅」的分工,是流水线和单兵 AI 最本质的区别。

四、人在环:四节点必须人工确认

AI 不是黑箱。论衡在四个关键节点强制人工介入:

  • Phase 0 定题 —— 主人确认主题、期刊模板、引用格式
  • Phase 2.5 大纲 —— 主人确认论证方向(改方向成本最低)
  • Phase 3.5 洞察补充 —— 主人在审计前补一线经验 / 具体场景
  • Phase 5 终稿 —— 主人终审

为什么要有 Phase 3.5?前面只有「定题 → 大纲 → 终稿」三节点,结果主人一线教学经验如果在终审后插入,会冲掉已经审计过的文末四节;在审计前插入,主人可以把自己对论文最有价值的「实战细节」嵌进正文相应位置。结果调整之后,「具体到刺痛感」的内容有了它该在的节点。

五、执行层韧化

内容质量的前提是流水线不能中途崩溃。论衡开发中遇到过一次关键事故——T3 分析员连续三个模型(deepseek-v4-pro / minimax-m3 / claude-opus-5)全部超时,主控亲自下场补大纲。这不是能力问题,是执行层根本没考虑模型会超时

为此设计了三层韧化机制:

30 秒心跳 + 分阶段 ack

每个角色卡接收任务后必须 30 秒内 ack。按任务时长分 3 档(小任务 5 分钟 / 中等 15 分钟 / 大任务 30 分钟),超时按档位分级响应。

模型健康度预检

T 派发前主控先做「1-token ping」测活,30 秒无响应降级 fallback。agents.defaults.models.fallbacks 配 4 档:deepseek-v4-flash → deepseek-v4-pro → minimax-M3 → claude-opus-5。

8 分钟硬卡

单个 T 角色卡超过 8 分钟必须 kill:6 分钟警告 → 7 分钟 partial 产出抢救 → 8 分钟 kill 让位下一个 T。主控「介入机制」补 6 步标准动作(拍醒 → 查 sessions → 换模型重派 → 接受 partial → 写介入日志 → 重试上限 2 次)。

韧性化和审计是同一件事的两面——这次事故也直接催生了 G8 成品度审计和 G9 时序合理性审计。

六、文末四节引用清单

论衡最初只交付「参考文献」一节。结果教师场域孤岛定稿时,主人终审发现文末缺数据 / 案例两节来源清单:35 条 [Dxx] 和 8 条 [Cxx] 全部裸奔——写手只搬运了 [Lxx] 参考文献,主控终检没卡,审计 G4 只审引用编号不审 final 阶段。

「不修复不许发。」

现在文末固定四节:

  1. 数据来源([Dxx] 全部数据点带年份 / 单位 / 链接)
  2. 案例来源([Cxx] / [C-主xx] 全部案例带事件结构 + 各方说法链接)
  3. 参考文献([Lxx] 全部文献带 DOI / URL)
  4. 先行者文献(原创性保证引入,列出已检索到的同主题文章 + 本文差异点声明)

每节写完后必须做双向 diff 机械化校验——这是所有项目交付前的硬卡:

# 引用了但文末没列出的 = 漏
comm -23 <(grep -oP '\[L\d+\]' 初稿.md | sort -u) \
          <(grep -oP '^\*\*\[L\d+\]' 参考文献.md | sort -u)
# 文末列了但正文没引用的 = 假引
comm -13 <(grep -oP '\[L\d+\]' 初稿.md | sort -u) \
          <(grep -oP '^\*\*\[L\d+\]' 参考文献.md | sort -u)

双向 diff 通过才允许发布。这套机制之后,再没出现过「引用编号对不齐」类事故。

七、边界明示:5 类不适用场景

论衡是「论文 / 深度文章」写作流水线,擅长主动检索已发布证据 + 整合主人投喂的证据

论衡能主动采集(T1 文献 / T2 数据 / T6 案例)

  • ✅ 已发布的学术文献(PubMed / CNKI / Web of Science)
  • ✅ 已发布的统计数据(教育部 / 统计局 / 行业协会)
  • ✅ 已发布的案例与报道(媒体 / 法院判决 / 行业报告)
  • ✅ 政府发布的统计 / 报告 / 调查 / 政策文件

论衡不能主动采集(需主人投喂)

  • 一手原始数据采集 —— 实验 / 调查 / 访谈 / 田野调查
  • 统计分析(SPSS / R / Python)—— 可引用结果,不执行计算
  • 图表原始数据采集 —— 做可视化,但爬虫 / OCR / 语音转文字需主人专门工具
  • 原创图片 / 视频生成 —— 有 image_generate(封面 / 插图),但不拍摄实物 / 录制视频
  • 代码执行 —— exec 不在 15 项白名单内

判断口诀:问「这个证据是已发布的数据 / 文献 / 案例吗」——是,论衡主动采集;不是,主人投喂后再用。

这个边界是怎么来的?主人在评审教师场域孤岛论文时提出一句话:「实验数据和调查问卷部分没法做,除非主人投喂内容与数据。」论衡最初会尝试主动编一个看起来合理的实验方案——这违反「不编造」原则。现在改成「明确告知主人需要投喂 + 等待投喂 + 整合投喂」三步走。

论衡的能力定位调整也值得一提:之前曾用「证据的下游整合器」作为口号——这话有点绝对,论衡本身就是个主动采集系统,只是某些类型不能采集。现在的表述改成「能主动采集 vs 不能主动采集」二分法,更准确。

八、Phase 0 强同意关卡

论衡流水线下面任何一个阶段调用以下工具,发数据到外部服务商——主控必须在 Phase 0 给主人「4 选 1」明示同意:

选项 适用 零外发项
① 全部同意(默认) 公开主题 / 不介意外发
② 脱敏 + SVG 封面 + 本地 Ollama(gemma4:31b 未公开主题 / 客户内部 / 商业机密 OpenClaw web / Tavily / OpenAI / Google / minimax-image / 主控推理
③ 部分同意 主人指定具体外发项 主人未勾选的项
④ 全部拒绝 极端敏感 全部 → 改纯本地(Ollama + SVG)

主人选项 + 同意时间写入 01-任务简报.md 头部作为审计可追溯依据。

ClawHub Security 状态:到 ClawHub 技能市场以来连续四次 Security=CLEAN 扫描通过。这中间曾有一次盲区:scanner 页面 UI 显示 Moderate CLEAN,但其实 advisory findings 字段还藏了 6 项 MEDIUM / LOW——「UI 干净 ≠ 实际干净」这种情况直到被一位安全意识强的用户抓出来才注意到。修法很简单:所有 user-facing 警告一律放文件顶部(不再埋在 changelog / operational rules 里),扫描器一看就懂;扫描结果变成 6 项 findings 全部归零。

九、实战案例(3 篇 + 1 次 dry-run 验证)

v2.1.7 实战跑通 3 篇不同主题的深度长文。v2.1.8 升级后新增 1 次 dry-run 实战验证(中国短剧出海 ≥ 9 条案例)证明三方真并行架构可实战。

文章 版本 规模 关键产出 验证重点
品牌一致性 v2.1.6 ~7900 字 / 15 文献 + 54 数据点 证据包三件套,审计复核 8 项全修复 首篇测试流水线
原创性悖论 v2.2 ~9500 字 / 12 文献 + 34 数据 + 6 案例 4 轮修订,A- 评级 T5 R2 通过案例
教师场域孤岛 v2.1.4 ~12000 字 / 18 文献 + 47 数据 + 9 案例 T5 R2 通过,G10 一致性审计首发 文末四节闭环驱动案例
中国短剧出海 dry-run v2.1.8 ~10000 字规划 / 12 [L] + 46 [D] + 12 [C] = 74 条 三方真并行 14 分钟 + 12 论点三角验证 v2.1.8 三方并行 + 0 条空卡 + 互不干涉架构实战验收

dry-run 含义:v2.1.8 架构跑真实论文项目能达到的下限标准——三方真并行 14 分钟 + 74 条证据 + 三角验证 12 论点。下次真实论文项目(重量场景)就是这套标准。


九·五、v2.1.8 架构升级详解:三检索员独立并行 + 0 条空卡协议 + 互不干涉铁律

v2.1.7 的六角色 + T6 案例员是「可选重量场景」机制——轻/中案例由 T2 数据员兼带出。这导致三个问题:

  1. 检索焦点混乱:T2 的 prompt 同时要管数据 + 案例,检索关键词被分散;
  2. 案例质量不稳定:轻量场景 T2 顺带出案例时,案例方法论被稀释(只有 30-40% 精力在案例);
  3. 失败传染:T2 案例检索失败会拖累数据检索。

v2.1.8 全面重构了检索层——任何量级(含 0 条)必 spawn T6 案例员,与 T1 文献员 + T2 数据员三方真并行,互不干涉

1. 三方真并行:wall-clock 节省 38-50%

T1∥T2∥T6 三个独立 sessions_spawn 在同一 function_calls 块内并发启动——

  • v2.1.7 串行:T1(8 分钟) + T2(12 分钟含案例)= 20 分钟
  • v2.1.8 并行:max(T1=8 分钟, T2=8 分钟, T6=8 分钟) = 8 分钟

实战 dry-run 验证(B 场景:中国短剧出海 ≥ 9 条案例,2026-08-17 12:37):

检索员 模型 runtime 实际产出
T1 文献 deepseek-v4-flash 1 分 57 秒 12 条 [L01-L12]
T2 数据 deepseek-v4-flash 3 分 00 秒 46 条 [D01-D46]
T6 案例 deepseek-v4-flash 3 分 00 秒 12 条 [C01-C12]
三方并行总墙钟 14 分钟 74 条证据(含 4 条先行者)

2. 0 条空卡协议:cases=0 场景的优雅处理

v2.1.7 对「主题本身就是方法论/框架性内容,不需要案例」的场景没有专门机制——T2 顺带出案例会强行出 [C01-C03],污染论文结构。

v2.1.8 引入0 条空卡协议

  • 触发条件:任务简报明确声明「主题为方法论 / 框架 / 不需要案例」
  • T6 prompt 显式声明:「本次任务无案例需求,输出 [C-空] 卡」
  • 空卡格式
[C-空] 本次任务无案例需求
├ 主题:<任务简报主题>
├ 主题属性:方法论 / 框架 / 纯理论
├ 案例数量:0 条
├ 显式声明:本次任务根据任务简报判定无案例需求
├ T6 状态:spawn + 空卡 + 立即 Done
└ T0 合并层处理:标记「本次无案例需求」,不阻塞主流程

结果链:T0 主控合并层收到 [C-空] → status.md 标 本次无案例需求 → T3 分析员按三角验证 [L]+[D] 双档降级启动 → T5 审计 G2.5 案例专项审计自动跳过(案例数 = 0)。

3. 互不干涉铁律:技术实现

三方检索员严格隔离

维度 T1 文献 T2 数据 T6 案例
写入路径 literature/文献卡.md data/数据卡.md cases/案例卡.md
读取对方产物 可读 T2 [Dxx] 可读 T1 [Lxx] 可读 T1 [Lxx] + T2 [Dxx]
失败隔离 失败不拖累 T2/T6 失败不拖累 T1/T6 失败不拖累 T1/T2
上下文隔离 独立 sessions 独立 sessions 独立 sessions

硬约束
– ❌ T6 不写 data/ 目录(属 T2 职责)
– ❌ T2 不写 cases/ 目录(属 T6 职责)
– ❌ T6 不做纯数据检索(纯量级数字归 T2)
– ✅ 三角验证由 T0 主控合并层统一处理
– ✅ 任一 T 失败,T0 标「[待补]」+ 三角降级,不阻塞其他 T

4. v2.1.7 → v2.1.8 升级对比

维度 v2.1.7 v2.1.8
T6 触发 仅重量场景 任何量级必 spawn(含 0 条空卡协议)
T1/T2/T6 并行 T1∥T2(两方) T1∥T2∥T6(三方真并行)
T2 职责 数据 + 案例兼带 纯量级数据(案例完全移交 T6)
三档决策 轻/中走 T2 / 重量走 T6 取消(任何量级都走 T6)
失败隔离 T2 失败拖累数据 + 案例 三方独立失败隔离
0 条场景 T2 强行出案例 T6 [C-空] 卡 + T0 标记「无案例需求」
wall-clock T1+T2 串行 ~20 分钟 三方并行 ~8-14 分钟(节省 38-50%)
实战验证 3 篇真实论文 3 篇真实论文 + 1 次 v2.1.8 dry-run 验证(74 条证据三方真并行)
ClawHub scan CLEAN(连续 4 次) CLEAN(v2.1.8 verdict=clean)
升级教训 #43-#51 #56 + #58 + #59 + #60(v2.1.8 架构教训)

5. 升级 5 层真源同步(教训 #49 + #60)

v2.1.8 升级涉及5 层真源同步(不是 4 层):

  1. Git commit + tag952ce4c + v2.1.8(本地 + 远程一致)
  2. paperwriter 真源 + ClawHub 副本:15 文件双端 md5 一致
  3. OpenClaw 配置层:论衡 description + model.fallbacks 4 档 + profile coding
  4. GitHub Web UI:description + 5 topics + 顶层 README
  5. OpenViking entity memory:论衡 v2.1.8 完整描述
  6. ClawHub skill ZIP 推送lunheng-article-pipeline@2.1.8(scan verdict=clean)

5 层真源 SOP 是 v2.1.8 升级核心教训:每次 release 必须显式列出所有 5 层同步触发点(cp / config.patch / GitHub API / memory_store / clawhub publish),各层独立触发不自动对齐

6. 实战迁移建议

如果你已经在用 v2.1.7 跑真实论文项目,v2.1.8 升级是无缝迁移——

  • ✅ run/ 目录实战项目不需要改动(历史归档,教训 #46)
  • ✅ 论衡 v2.1.8 发布后,实战项目按新机制跑(cases=0 也走 T6 空卡协议)
  • ✅ 三角验证表自动生成 [L]+[D]+[C] 三档(v2.1.7 是 [L]+[D] 双档 + 案例卡可选)
  • ⚠️ 实战项目 01-任务简报.md 需要显式声明 cases 需求量(含 0 条场景)
  • ⚠️ 论衡 agent profile 标签从 full 改为 coding(跟 novelist 一致,仅标签,实际工具集不变)

第三篇是文末四节 + 双向 diff 校验机制的驱动案例——主人终审时发现文末缺数据 / 案例两节来源清单,「不修复不许发」。这次事故直接推动了现在的引用清单四节化设计。

怎么用

前置条件

需要能跑 OpenClaw 的环境(CLI 或 daemon),版本 ≥ 0.23.3。

方式一:从 ClawHub 一键安装(推荐)

openclaw skills install lunheng-article-pipeline

装好后自动注册到 OpenClaw workspace:

openclaw skills list | grep lunheng

方式二:从 GitHub 克隆本地安装

git clone https://github.com/zuoyunlai/lunheng-article-pipeline.git
cd lunheng-article-pipeline
openclaw skills add $(pwd)

验证安装

openclaw skills list | grep lunheng
# 应看到:lunheng-article-pipeline 1.0.x

开始使用

在 OpenClaw 主会话里直接对 AI 说:

用论衡写一篇关于 XXX 的深度长文(约 8000 字)

主控会按七角色流水线自动推进:定题(Phase 0)→ 文献检索 + 数据检索(T1 / T2 并行)→ 分析员(T3)→ Phase 2.5 主人大纲确认 → 写手(T4)→ Phase 3.5 主人洞察补充 → 审计(T5 R1)→ 写手修订 ≤2 轮 → 审计(T5 R2)→ 配图(Phase 4.5)→ 终检(Phase 5 主人终审 + T7 终检交付)。

使用者会在四个节点被叫醒确认:定题、大纲、洞察补充、终稿。

模型与配置

论衡默认按能力分层选模型(检索便宜快 / 分析写作强推理 / 审计顶配 / 主控稳定),可在 pipeline/README.md 的「模型配置与更换指南」章节里换成自己本机可用的任意 OpenClaw 兼容模型。

尾声:论衡的定位

论衡是「严谨落地器」——原创想法来自人机对话,它负责把想法变成站得住脚的文章。5 类不适用场景作为边界明示,「能主动采集 vs 不能主动采集」二分法作为能力定位,Phase 0 强同意关卡把外发项控制权完全交给主人。

防御性机制不是缺陷,是定位——保证严谨才是深度分析最值钱的东西。如果你也在用 AI 写深度内容,欢迎拿去用、提意见。具体行动:GitHub star / 提交 issue / 知乎或小红书讨论(搜索「论衡 lunheng」)。

Article rating Be the first to rate
💬
分享

扫码分享到微信

打开微信,扫一扫