让写代码的 AI 先交测试证据,过不了门就不能往下改,不再口头叮嘱
用户可能手动检查或使用其他工具,但公开材料未明确说明。
AI 写代码时缺乏测试验证,导致代码质量不可控,需要人工口头叮嘱。
AI 应用的生意判断
让写代码的 AI 先交测试证据,过不了门就不能往下改,不再口头叮嘱
01
从用户的一天开始 · 公开事实 + 可观察行为 · 2026-08-29
让写代码的 AI 先交测试证据,过不了门就不能往下改,不再口头叮嘱
用户可能手动检查或使用其他工具,但公开材料未明确说明。
AI 写代码时缺乏测试验证,导致代码质量不可控,需要人工口头叮嘱。
趋势是「模型说做完了」不再算数。不要做通用质量平台,先给改代码、出报表这种改错会出事的环节加证据门:拿不出对照就不放行。收费未披露。
公开仓库有 220 个收藏和 8 个复刻,说明开发者关注,但持续使用和付费尚未核验。
① 证据门在 enforce 模式下被真实项目用的案例——gate 默认开还是关、误拦率多少; ② 配套包(evidence-gate/router)是否脱离本仓库被其他项目采用——生态采用才是真证据; ③ 作者是否把 app.ts 拆分并给出独立文档——单体 2.2k 行意味着维护风险
值得拆解。公开仓库有 220 个收藏和 8 个复刻,说明开发者关注,但持续使用和付费尚未核验。
如果你的 agent 产品要对结果负责(写代码、改文档、做报表),照抄"证据门"的最小版本:模型交作业时必须附带可验证证据(测试输出、文件 diff、数据源引用),拿不出证据就标记为"未完成"。这比让模型自评"我做完了"可靠一个数量级。先跑观察模式记录误判率,再决定 enforce。
未披露。 Apache-2.0,npm 免费分发,无定价、无托管、无赞助。 ① 证据门在 enforce 模式下被真实项目用的案例——gate 默认开还是关、误拦率多少; ② 配套包(evidence-gate/router)是否脱离本仓库被其他项目采用——生态采用才是真证据; ③ 作者是否把 app.ts 拆分并给出独立文档——单体 2.2k 行意味着维护风险
让写代码的 AI 先交测试证据,过不了门就不能往下改,不再口头叮嘱
公开仓库有 220 个收藏和 8 个复刻,说明开发者关注,但持续使用和付费尚未核验。
追踪官方文档或 issue,确认用户对测试门控的实际需求。
产品主张帮助用户完成:“让写代码的 AI 先交测试证据,过不了门就不能往下改,不再口头叮嘱”。具体痛点强度与不采用代价尚未由用户证据核验。
价值闸门未通过,共识闸门未进入。
价值闸门未通过,模式闸门未进入。
价值闸门未通过,求真闸门未进入。
02
市场对照
尚未完成中英文市场对照。待覆盖范围和可核验证据补齐后再给出结论。
03
先给出判断与下一步,再保留完整证据和反例。
给 DSH 装一个终端 UI 之外,把"先写测试再写代码"和"证据门"塞进 agent 工作流的插件——agent 得先证明自己干了什么,才能继续下一步。
个人开发者 huiliyi37(GitHub 同名)。渲染核心来自作者自研的"天枢 Tianshu-Tui"(Apache-2.0)。仓库 2026-08-13 建,Apache-2.0,36 个提交;作者称与 harness 侧协同开发累计 250+ 提交(8/10-8/13)。当前 0.1.1-rc.6。
判断:这不像"顺手做个插件",更像一个独立 agent 项目(Tianshu)的作者把自己的东西移植到 DSH 上借势。证据:它的 TDD 和证据门依赖的是一整套自家包(dsh-evidence-gate、dsh-agent-router、dsh-fs-snapshot、dsh-memory……),README 里一半是自家生态的展示位。
/fork 探索分支、/rewind 回退(会话截断 + 可选文件回退)、/export 导出 Markdown 转录、/steer 中轮转向它明确不做:UI 是纯展示层——不注册任何 prompt、工具、上下文面,agent 状态全部来自会话事件流,用户输入成为普通日志消息。作者把"展示"和"控制"拆得很干净,这也意味着它的 TDD/证据门价值全靠配套的自家包实现,插件本体只是个壳。
替代的是"希望 agent 会测试"这个隐性假设。以往用 Claude Code/Aider 这类 agent 写代码,质量流程靠人:你口头叮嘱"写完跑下测试",agent 大概率是写完全部代码最后象征性跑一次,红了再修,甚至不跑。TDD 纪律严格的人(先红后绿再重构)只能靠自己在 IDE 里手动执行——agent 帮不上忙,反而添乱。
tianshu 把这套"人肉 TDD 纪律"变成 agent 的强制流程:测试先写(RED),证据门验证通过(GREEN)才放行下一步,失败有路由、有探针建议、有 L2 终审。它替代的是"工程师在 agent 工作流里手动维持的质量闸门"。
未披露。 Apache-2.0,npm 免费分发,无定价、无托管、无赞助。
判断:作者真正在卖的(如果算卖的话)是一整套"可信 harness"方法论和它背后的包族。插件是入口,包族是资产。这种"开源入口 + 全家桶"的打法在个人开发者里常见,后续变现要么是付费的托管版本,要么干脆不变现。
| 维度 | 结论 |
|---|---|
| 创始人-产品匹配度 | 作者自研 Tianshu 在先,说明痛点是自己的;但"个人项目借 DSH 势"的动机也明显 |
| 产品洞察力 | "把测试纪律从人的意志变成 agent 的强制流程"这个方向是真的,证据门思路可迁移 |
| 技术实现质量 | 提交密集、配套包多,但 36 提交里相当部分是自家生态展示,独立可验证的部分有限 |
| 市场时机 | TDD 对 agent 的价值争议很大——多数人希望 agent 快,不希望它被流程拖慢,受众小 |
方向对,但它是这个生态里最"自说自话"的一个。
证据门(先证明再放行)是能让 agent 输出变可靠的真机制,尤其对"agent 改代码必须可回滚"的场景。但它的兑现依赖一整套只有作者自己在维护的包,而且 README 的叙事是"我自己的 harness 全家桶搬到了 DSH"——对生态用户来说,这是六种插件里迁移成本最高、最不敢依赖的一个。
可迁移的规律:给 agent 加质量闸门,别加"信任"闸门。 证据门要求的是可验证的产出(测试通过、文件 diff),而不是模型自述"我做完了"。任何对外卖 agent 干活的产品,把"模型说做完了"改成"必须附带可复现的证据",都能立竿见影地降低扯皮。
它和 dsh-TUI 的关系:两个都是 DSH 的终端 UI,但定位完全不同——dsh-TUI 是"把 Claude Code 体验搬到 DSH"(体验补位,面向 CLI 极客,619 星),tianshu 是"把质量流程嵌进终端"(流程改造,面向要证据的人,103 星)。受众、卖点、star 都差一个量级。
① 证据门在 enforce 模式下被真实项目用的案例——gate 默认开还是关、误拦率多少 ② 配套包(evidence-gate/router)是否脱离本仓库被其他项目采用——生态采用才是真证据 ③ 作者是否把 app.ts 拆分并给出独立文档——单体 2.2k 行意味着维护风险
产品逻辑:如果你的 agent 产品要对结果负责(写代码、改文档、做报表),照抄"证据门"的最小版本:模型交作业时必须附带可验证证据(测试输出、文件 diff、数据源引用),拿不出证据就标记为"未完成"。这比让模型自评"我做完了"可靠一个数量级。先跑观察模式记录误判率,再决定 enforce。
定价结构:无。未披露。
有待观察。 证据门机制值得任何做 agent 产品的人抄走,但这个插件本体(渲染层 + 个人全家桶)还没有独立价值证明。机制记下来,插件本身可以不装。
05
产品官网缺失或当前链接只是线索时,从这些检索入口继续核验。