三条工作线(平台主线 · 批注能力线 · 方法论线)的碎片合并成一张图:已建成什么、正在做什么、接下来做什么、哪些等你拍板。实时真相固定在仓库三处——docs/09(所有已拍板决策 D1–D37)、docs/14(工程待办)、docs/19(判断系统 PRD)——本页是给人读的快照汇总,v2(按"更详细、更通俗"反馈重写了第二节)。
| 能力 | 状态 | 说明 |
|---|---|---|
| 核心闭环(12 步) | 在运行 | 用户报反馈 → AI 分诊 → 独立工作副本修复 → 自动验证 → 另一 AI 评判 → 开 PR → 独立评审 → 门禁(高危改动出决策卡)→ 串行合并 → 发布门 → 回访复验 |
| 五道防线 | 在运行 | 隔离工作副本 / 测试硬门槛 / 防"删测试蒙混"守卫 / 排队合并+合并前重验 / GitHub 独立评审 |
| 三个面 | 在运行 | 协作面(东京服务器:工作台+各项目反馈站,永远在线)· 执行面(云端 Codex + 本机监听器)· 评审面(GitHub 三平台 CI 矩阵 + AI 审查,551 测试全绿含 Windows) |
| 公开文档站 | 已上线 | supermind-ai.cn/vibeloop(四篇脱敏说明书,一键更新管线) |
| 批注能力(09-03 批次,D31–D37 已拍板) | 部分上线 | TMS Demo 就地批注双图层已试点上线;轮次只读回看+旧轮锁;空名册默认你、同构选项一键批量;AI 思考可视化架构已定(qwen-flash 摘要器 0.71 秒) |
| 控制塔 v1 | 实现中 | 设计定稿(docs/16):现状总览+审计时间线+系统健康,纯只读 |
| 被管理项目 | 运行 | AI 视频剪辑;第一期还含 vibehub(具体仓库待确认,D28) |
9 月初,一位外部顾问看了 TMS 项目的数据模型,一口气指出 5 个问题——而我们当时已经有 553 个自动测试、81 个冒烟检查,全部是绿的。这引出一个必须回答的问题:自动检查全过,为什么还会漏?AI 开发里到底哪些判断必须靠人、哪些其实可以交给 AI?
为了回答它,这轮做了九个专题的调研(性能、稳定性、行业经验、多个 AI 协作、中文技术军规、怎么向人提问、怎么筛选专家、金融行业规范、数据库大表方案),并且让两个不同厂商的 AI 在互相看不到对方的情况下各写一份结论、再合并——防止一家 AI 的盲区变成整个结论的盲区。答案直接变成了 VibeLoop 的升级设计,也就是"判断系统 PRD"(仓库 docs/19)。
现在的 VibeLoop 把关卡设在"代码要合并进主干"的时刻,好比出版社在印刷前才审稿。但调研发现,最贵的错误在写代码之前就已经定型了——数据库结构怎么设计、对客户承诺什么、业务规则怎么定。等到最后合并时才请人出场,改动成本已经很高,人实际上很难说"不",只能当橡皮图章。
所以升级方向是:在"要做一个改不回来的决定"的那一刻就把人请进来,而不是在最后盖章的时候。这就是"管承诺"的意思——平台要管住的是"谁、凭什么证据、有什么授权,做出了哪个难以回头的决定"。
| 子设计 | 解决什么问题 | 方案(人话版) |
|---|---|---|
| 1. 什么事该叫人(判断路由) | 现在按"动了哪些文件"决定要不要人审——不敏感文件里的重大决定会漏掉,敏感文件里的小改动又白白打扰人 | 改成按事情的性质判断:这个决定改不改得回来?拖到什么时候就再也没有无痛修改的机会?出错了影响多大?三个问题合起来决定要不要叫人、多急 |
| 2. 决策卡分两种 | 有实验发现:把 AI 的推荐答案和问题一起给人看,人的判断反而变差(先入为主) | 改不回来的大事:先让人自己判,提交之后才能看 AI 的分析;改得回来的小事:保留推荐、一键通过。两种卡给的背景信息一样多,只是决定的负担不同 |
| 3. 判断变资产(评估资产管线) | 现在专家拍完板就完了,下次遇到同类问题还得再问一遍——平台最贵的输入被用一次就扔 | 每次拍板自动存档三样:选了什么、当时预计会发生什么(日后可以核对准不准)、基于什么前提(前提变了要重新问)。同类判断攒多了提炼成规则,最后能变成自动检查。关键设计:档案要能替专家挡掉重复提问,让被问的人自己受益——三十年前有人做过类似系统,就死在"记录的人不受益"上 |
| 4. 顾问怎么找、怎么评 | 怎么知道一位顾问靠不靠谱?怎么发现"不懂装懂"? | 用真实的小任务筛人(人事研究里效度最高的办法);记分规则奖励诚实说"这块我不懂";有申诉通道。两条红线:不搞少数服从多数(唯一提出问题的人往往最有价值——顾问抓 5 条缺陷正是如此);AI 不许反驳专家,只能补充证据加提问(研究显示经验越丰富的人越反感被 AI 质疑) |
| 5. 评审面加一家 | 现在只有一个 AI 做独立评审——它和写代码的 AI 可能共享同一个盲区 | 加一个不同厂商的 AI,各自独立审、互相看不到对方结论,最后逐条处理每个发现并记账(这个月独有发现几个)。持续没价值就自动降低调用频率,不白烧钱 |
这套方法今天就在 TMS 项目上首跑了:账号权限设计的定稿评审用新协议执行——两个厂商的 AI 各自盲审(一个专看"时间维/生命周期"、一个专看"不该发生的事")加主会话合并。结果:
| # | 试点 | 改动 | 怎么算成功 |
|---|---|---|---|
| ① | 评审面加第二家族盲写+记账(推荐先行) | 最小:评审编排加一支不同厂商的 AI,输出先封存再合并,记录独有发现 | 首月独有发现 >0;=0 则自动降低调用频率 |
| ② | 决策卡分型采集 | 卡片分两型:不可逆的先盲判(不显示 AI 推荐)、可逆的保留推荐一键过;两型上下文密度相同 | 盲判卡改选率或预测采集率出现差异,且顾问没被拖慢到流失 |
| ③ | 门禁前移 shadow | 分诊/设计期产出"判断对象"短记录,与现有门禁并行、不替代 | 30 天内命中 ≥1 个现有门禁漏掉的不可逆承诺 |
| # | 事项 | 需要你说什么 |
|---|---|---|
| 1 | 拍板 三件先试开工授权与顺序 | "按 ①→②→③ 开工"或你的调整;①改动最小可当天起 |
| 2 | 拍板 盲判卡不显示 AI 推荐 | 这会改变你自己批卡的体验(高后果卡先自己判、提交后才能看 AI 分析)——认不认这个试点 |
| # | 事项 | 说明 |
|---|---|---|
| 3 | 跨项目评估资产的脱敏边界 | 哪类判例允许出项目复用(当前设计:分公开/项目私有两档字段,默认私有) |
| 4 | 顾问受益回路的计酬部分 | 非金钱部分(资产替顾问挡重复问题+队列减负可见化)我直接做;是否按复用计酬、怎么计,归你定 |
| 5 | AI 对话通道对客户高管的默认值 | D33 已定"管理员可配置",默认开还是关待你定 |
| 6 | 三件旧欠账 | 看门狗飞书 webhook(等你给机器人地址)· gh-uvl 部署密钥收权(需你或 gh api)· D28 vibehub 具体仓库确认 |
另有两件在 TMS 线、会通过开发会话的对客信息包来找你:鉴权开关(AUTH_ENFORCE)开启时机(影响客户点链接直进演示的体验);结算单据的会计档案留存年限(转问客户财务/法务)。