x-octo 首页 AI 应用的生意判断
EN

VOL.2026.08.13 今日判断 约 6 分钟

AI 开始像员工一样被记录、审批和复盘

2026 年 8 月 13 日 · 星期四

当日扫描 169 条,去重后 155 个产品,剔除新闻报道 14 条,入选 2 个深度分析。

2
个值得看
4
个在给 agent 装监管
60
个当场淘汰
01

今天值得研究的 2 个

01

qm

重点研究开源关注 13257

Y Combinator 自己在用的多人 agent 平台,每个员工一个隔离工作区,在频道里又能一起使唤同一个它。

替代的旧行为很清楚——以前公司要么每人各开一个账号(记忆不共享、权限不可控), 要么 IT 部署一个共享 bot(所有人一份记忆,谁都不敢给它真权限)。中间这条路以前得自己拿胶带粘。

为什么值得看:15 天拿到 13257 star、1547 fork,fork 占比 11.7%——这个比例说明是真有人在部署。 它示范的是一条路径:一件事每家公司都在自己粘,你把胶带做成产品并开源,拿到的不是用户是标准。

02

numbat

持续观察开源关注 917

Perplexity 做的 agent 端点监控:它在这台电脑上干了什么、要不要当场拦、事后怎么复原。

替代的旧行为——企业管员工电脑用了二十年 EDR,管的是人和进程。 agent 的动作发生在别人的进程里、走别人的 API,EDR 只看得到"某个终端在联网"。

为什么值得看:出厂规则全部只观察不拦截。这个克制是对的—— 安全工具最常见的死法是第一版就敢拦,拦错一次,整个组织再也不会打开它。 任何高风险自动化的正确上线顺序都是先只看不动,这条规律哪个行业都成立。

02

其余入选

13 项

13 个

产品 一句话 结论
Approving 把 coding agent 的活变成可审批、可回滚的交付流程 agent 越自动,审批这一环越能单独做成产品
human-review 像批注 Google 文档一样给 AI 的产出留意见 反馈的形态决定采纳率
Aakit 把 coding agent 悄悄做的假设列出来,标出哪条崩了 AI 出错不在代码在假设
ai-short-drama AI 短剧的故事骨架、剧集连续性、可续跑的成片流程 连续性才是短剧工业化的卡点
ShenNongMi 中医知识图谱问答,两万节点撑住会自我纠错的查询 垂直知识图谱是模型抹平不掉的壁垒
Click 给 ChatGPT 和 Claude 喂实时研究资料 卖上下文比卖模型的生意稳
Discovered Materials 用 AI agent 找新材料的实验室 agent 进实验室,壁垒在数据和设备
sv-number MCP 给 agent 开电话号码,两百多国,验证码自动读回 agent 要办事就得有身份
CodeBurn 看清 AI 写代码的钱花在哪 新支出出现就会有人做账
Decant 看清 token 花在哪 和 CodeBurn 撞同一需求,说明是普遍痛点
Dograh 开源的语音 agent 平台,对标 VAPI 开源对标已验证的闭源产品,省市场教育
LongHorizon-Harness 让 agent 连续操作电脑几小时不丢任务状态 分水岭是能连续干多久,不是单步准不准
DeterminFlow 面向生产的 AI 工作流运行时,能校验能恢复 把"可恢复"做卖点,说明已进不能丢单的场景
03

今天的一个趋势

4 条

agent 开始被当成需要管的员工

今天入选的 15 个里,有 4 个在做同一件事的不同侧面:

  • numbat 记录 agent 在端点上的每个动作,能拦,能事后重建取证
  • Approving 把 agent 的交付卡在审批环节,可回滚
  • human-review 让人用批注的方式给 agent 的产出留意见
  • Aakit 把 agent 悄悄做的假设一条条摊开,标出哪条是错的

监控、审批、反馈、追责——这是企业管员工用了二十年的四件套, 一件没改地搬到了 agent 身上。

前一阵所有人还在给 agent 造工具(沙箱、记忆、电话号码),造的是能力。 今天这批造的是约束。这个转向通常只在一种情况下发生: 东西已经真的在干活了,干出问题了,而且问题贵到有人愿意花钱防。

顺带一个反向信号:CodeBurn 和 Decant 今天同时出现,做的都是"看清 AI 花了多少钱"。 成本工具和监管工具一起冒出来,指向同一件事——agent 已经从玩具变成开销。

04

大厂动作

5 条
  • Y Combinator 开源了自己在用的 agent 平台 qm,MIT 协议
  • Perplexity 开源 numbat,进 agent 端点安全
  • AWS 放出 context-ontology-accelerator,用本体论给 agent 的决策做一致性约束
  • Vercel Labs 出了一套营销 agent 团队模板
  • 高德(AMAP-ML) 开源 LongHorizon-Harness,做长时程的电脑操作

五家的方向不一样,但都在同一层:不做 agent 本身,做 agent 的地基。