Files
val-blog/tmp_constitution_bundle/org/ANTI_HALLUCINATION_REFORM_PLAN.md
T

6.4 KiB

组织防幻觉改造方案

日期:2026-03-16 状态:提案 背景:T-0007 暴露出当前组织“执行强、求真弱”的系统性缺陷


1. 目标

本方案不试图“消灭模型幻觉”,而是把幻觉从“可直接驱动项目的输入”降级为“待验证草稿”。

核心目标:

  1. 防止错误前提进入执行链
  2. 防止多 agent 协作放大错误
  3. 让未经验证信息无法伪装成事实
  4. 让 AI 产出默认可疑、可追溯、可拦截

2. 核心诊断

T-0007 的问题不是单个 agent 失误,而是组织机制允许:

  • 假设直接进入设计
  • 设计直接进入实现
  • 实现直接进入“完成感”
  • 审计只审逻辑,不审事实

因此必须把“真实性治理”前置到组织最上游。


3. 新治理原则(宪法级)

P1. Facts First

未经验证的信息,不得驱动架构、实现、预算、上线决策。

P2. Claim ≠ Fact

任何 agent 的判断、猜测、经验、总结,默认都不是事实,除非附带来源验证。

P3. Truth Before Design

先做事实核验,再做方案设计;顺序不得颠倒。

P4. Small Closed Loops

默认采用最小闭环验证,不默认上复杂组织协作。

P5. AI Output Is Draft

AI 产出默认是候选草稿,不是可直接相信的结论。


4. 组织层改造

4.1 新增 Truth Gate(真相闸门)

在 Oracle 之前增加一个固定环节:

Intake → Truth Gate → Oracle → Helix → Sentinel → Vector → Execution

Truth Gate 的任务:

  • 枚举真实资源
  • 验证外部依赖
  • 标记 verified / claimed / assumed
  • 产出 Resource Manifest

没有通过 Truth Gate 的项目:

  • 不得立项
  • 不得拆任务
  • 不得进入设计

4.2 角色职责调整

Val

新增职责:

  • 明确要求“先验真,再设计”
  • 对未附来源的关键前提直接打回
  • 不再把“文档完整”视为“项目可信”

Oracle

从“复杂度评估”升级为:

  • 复杂度评估
  • 证据充分性检查

新增输出:

  • truth_status: pass | fail | partial
  • evidence_gaps: []

Helix

限制职责:

  • 只能基于 verified facts 设计
  • 若输入含 assumed 信息,必须显式标注风险

Sentinel

从“安全/逻辑审计”扩展为双层审计:

  1. Truth Audit(前提真实性)
  2. Design Audit(设计合理性)

Vector

新增职责:

  • 未见 Truth Gate 产物,不得派单
  • 对 evidence gap 未关闭的项目,直接挂起

Atlas

新增为组织真相底座:

  • 维护 verified manifests
  • 记录 failure patterns
  • 维护 preventive rules
  • 区分 verified / claimed / assumed

Anvil / Lab / Quanta / Bastion / Forge / Prism

统一新增约束:

  • 不得自行扩写资源边界
  • 不得把假设模型/API/权限写进产物
  • 产物中每个关键依赖都需可追溯

5. 三类信息分层(强制)

所有项目输入必须分层:

A. Verified

已通过工具、源码、配置、实际调用验证。 可用于:设计、实现、测试、上线。

B. Claimed

由用户/agent/文档声明,但未核验。 可用于:候选方向,不可用于最终决策。

C. Assumed

推测、经验判断、猜测。 只能用于提出问题,不可进入执行链。

标准格式:

fact_item:
  value: "sub2api/gpt-5.4 available"
  status: verified
  source: "~/.openclaw/openclaw.json"
  verified_at: "2026-03-16T18:00:00+08:00"

6. 新项目标准流程

Stage 0: Resource Manifest

必须先产出:

  • 可用模型清单
  • 可用 API / 权限 / 订阅清单
  • 配置位置
  • 调用方式
  • 限制条件

若缺失:停止。

Stage 1: Problem Proof

必须回答:

  • 当前问题是否真实存在?
  • 现有方案哪里不够?
  • 指标是什么?
  • 不做会怎样?

若无法量化:默认不立项。

Stage 2: Minimal Solution

优先设计:

  • 最小闭环
  • 最少角色
  • 最少新代码
  • 最少新机制

Stage 3: Expansion Only After Evidence

只有在最小方案跑通且证明不足后,才允许扩展为多 agent / 多模块 / 多阶段工程。


7. 立项闸门(强制清单)

任何中大型项目立项前必须满足:

  • Resource Manifest 已生成
  • 所有关键依赖已标记 verified/claimed/assumed
  • 当前问题已量化
  • 已提出最小方案
  • 已说明为何不能用更简单方案
  • Sentinel Truth Audit 通过
  • Val 批准进入设计

缺一项,不立项。


8. 输出可信度标签

以后所有 agent 输出都必须带一个可信度标签:

VERIFIED_OUTPUT

  • 关键事实均有来源
  • 可用于执行/决策

DRAFT_OUTPUT

  • 包含未验证内容
  • 仅供讨论,不可直接执行

SPECULATIVE_OUTPUT

  • 主要是推测/建议
  • 只能作为脑暴输入

默认:所有输出都是 DRAFT_OUTPUT,除非明确证明为 VERIFIED_OUTPUT。


9. 多 agent 使用边界

允许多 agent 的任务

  • 已有清晰资源边界
  • 已有 verified inputs
  • 需要并行探索多个明确子问题
  • 失败成本低,可快速回滚

禁止多 agent 的任务

  • 核心前提未验证
  • 资源边界不清
  • 涉及关键架构判断
  • 涉及外部系统但权限不明
  • 仍处于“问题是否存在”阶段

规则:

前提不清时,宁可单 agent 慢一点,也不要多 agent 一起做梦。


10. T-0007 提炼出的 5 条硬规则

  1. 先列真实模型池,再设计路由系统
  2. 不允许把未订阅模型写入能力矩阵
  3. 不允许基于 assumed 资源写代码 fallback
  4. 审计必须先审事实,再审设计
  5. 一旦基础假设错误,立即停工归档,不做沉没成本修补

11. 落地改造建议(分三步)

Step 1:立即生效

  • 启用 facts 分层
  • 所有新项目强制 Resource Manifest
  • Val/Oracle/Sentinel 加入 truth check

Step 2:一周内完成

  • 更新 Constitution v3 → v4
  • 为 Atlas 新建 manifest / failure_patterns / preventive_rules 目录
  • 为标准项目模板增加 truth gate 区块

Step 3:后续优化

  • 增加自动校验脚本(扫描不存在的模型/API/路径)
  • 增加“资源清单对照检查”工具
  • 增加高风险项目的双重 truth audit

12. 推荐决策

建议立即执行:

  1. 暂停新复杂项目的多 agent 扩张
  2. 先把 Truth Gate 和 Resource Manifest 制度化
  3. 将当前组织从“产能导向”调整为“可信度优先”

一句话:

不是先让组织更强,而是先让组织不胡说。