6.4 KiB
组织防幻觉改造方案
日期:2026-03-16 状态:提案 背景:T-0007 暴露出当前组织“执行强、求真弱”的系统性缺陷
1. 目标
本方案不试图“消灭模型幻觉”,而是把幻觉从“可直接驱动项目的输入”降级为“待验证草稿”。
核心目标:
- 防止错误前提进入执行链
- 防止多 agent 协作放大错误
- 让未经验证信息无法伪装成事实
- 让 AI 产出默认可疑、可追溯、可拦截
2. 核心诊断
T-0007 的问题不是单个 agent 失误,而是组织机制允许:
- 假设直接进入设计
- 设计直接进入实现
- 实现直接进入“完成感”
- 审计只审逻辑,不审事实
因此必须把“真实性治理”前置到组织最上游。
3. 新治理原则(宪法级)
P1. Facts First
未经验证的信息,不得驱动架构、实现、预算、上线决策。
P2. Claim ≠ Fact
任何 agent 的判断、猜测、经验、总结,默认都不是事实,除非附带来源验证。
P3. Truth Before Design
先做事实核验,再做方案设计;顺序不得颠倒。
P4. Small Closed Loops
默认采用最小闭环验证,不默认上复杂组织协作。
P5. AI Output Is Draft
AI 产出默认是候选草稿,不是可直接相信的结论。
4. 组织层改造
4.1 新增 Truth Gate(真相闸门)
在 Oracle 之前增加一个固定环节:
Intake → Truth Gate → Oracle → Helix → Sentinel → Vector → Execution
Truth Gate 的任务:
- 枚举真实资源
- 验证外部依赖
- 标记 verified / claimed / assumed
- 产出 Resource Manifest
没有通过 Truth Gate 的项目:
- 不得立项
- 不得拆任务
- 不得进入设计
4.2 角色职责调整
Val
新增职责:
- 明确要求“先验真,再设计”
- 对未附来源的关键前提直接打回
- 不再把“文档完整”视为“项目可信”
Oracle
从“复杂度评估”升级为:
- 复杂度评估
- 证据充分性检查
新增输出:
truth_status: pass | fail | partialevidence_gaps: []
Helix
限制职责:
- 只能基于 verified facts 设计
- 若输入含 assumed 信息,必须显式标注风险
Sentinel
从“安全/逻辑审计”扩展为双层审计:
- Truth Audit(前提真实性)
- Design Audit(设计合理性)
Vector
新增职责:
- 未见 Truth Gate 产物,不得派单
- 对 evidence gap 未关闭的项目,直接挂起
Atlas
新增为组织真相底座:
- 维护 verified manifests
- 记录 failure patterns
- 维护 preventive rules
- 区分 verified / claimed / assumed
Anvil / Lab / Quanta / Bastion / Forge / Prism
统一新增约束:
- 不得自行扩写资源边界
- 不得把假设模型/API/权限写进产物
- 产物中每个关键依赖都需可追溯
5. 三类信息分层(强制)
所有项目输入必须分层:
A. Verified
已通过工具、源码、配置、实际调用验证。 可用于:设计、实现、测试、上线。
B. Claimed
由用户/agent/文档声明,但未核验。 可用于:候选方向,不可用于最终决策。
C. Assumed
推测、经验判断、猜测。 只能用于提出问题,不可进入执行链。
标准格式:
fact_item:
value: "sub2api/gpt-5.4 available"
status: verified
source: "~/.openclaw/openclaw.json"
verified_at: "2026-03-16T18:00:00+08:00"
6. 新项目标准流程
Stage 0: Resource Manifest
必须先产出:
- 可用模型清单
- 可用 API / 权限 / 订阅清单
- 配置位置
- 调用方式
- 限制条件
若缺失:停止。
Stage 1: Problem Proof
必须回答:
- 当前问题是否真实存在?
- 现有方案哪里不够?
- 指标是什么?
- 不做会怎样?
若无法量化:默认不立项。
Stage 2: Minimal Solution
优先设计:
- 最小闭环
- 最少角色
- 最少新代码
- 最少新机制
Stage 3: Expansion Only After Evidence
只有在最小方案跑通且证明不足后,才允许扩展为多 agent / 多模块 / 多阶段工程。
7. 立项闸门(强制清单)
任何中大型项目立项前必须满足:
- Resource Manifest 已生成
- 所有关键依赖已标记 verified/claimed/assumed
- 当前问题已量化
- 已提出最小方案
- 已说明为何不能用更简单方案
- Sentinel Truth Audit 通过
- Val 批准进入设计
缺一项,不立项。
8. 输出可信度标签
以后所有 agent 输出都必须带一个可信度标签:
VERIFIED_OUTPUT
- 关键事实均有来源
- 可用于执行/决策
DRAFT_OUTPUT
- 包含未验证内容
- 仅供讨论,不可直接执行
SPECULATIVE_OUTPUT
- 主要是推测/建议
- 只能作为脑暴输入
默认:所有输出都是 DRAFT_OUTPUT,除非明确证明为 VERIFIED_OUTPUT。
9. 多 agent 使用边界
允许多 agent 的任务
- 已有清晰资源边界
- 已有 verified inputs
- 需要并行探索多个明确子问题
- 失败成本低,可快速回滚
禁止多 agent 的任务
- 核心前提未验证
- 资源边界不清
- 涉及关键架构判断
- 涉及外部系统但权限不明
- 仍处于“问题是否存在”阶段
规则:
前提不清时,宁可单 agent 慢一点,也不要多 agent 一起做梦。
10. T-0007 提炼出的 5 条硬规则
- 先列真实模型池,再设计路由系统
- 不允许把未订阅模型写入能力矩阵
- 不允许基于 assumed 资源写代码 fallback
- 审计必须先审事实,再审设计
- 一旦基础假设错误,立即停工归档,不做沉没成本修补
11. 落地改造建议(分三步)
Step 1:立即生效
- 启用 facts 分层
- 所有新项目强制 Resource Manifest
- Val/Oracle/Sentinel 加入 truth check
Step 2:一周内完成
- 更新 Constitution v3 → v4
- 为 Atlas 新建 manifest / failure_patterns / preventive_rules 目录
- 为标准项目模板增加 truth gate 区块
Step 3:后续优化
- 增加自动校验脚本(扫描不存在的模型/API/路径)
- 增加“资源清单对照检查”工具
- 增加高风险项目的双重 truth audit
12. 推荐决策
建议立即执行:
- 暂停新复杂项目的多 agent 扩张
- 先把 Truth Gate 和 Resource Manifest 制度化
- 将当前组织从“产能导向”调整为“可信度优先”
一句话:
不是先让组织更强,而是先让组织不胡说。