x-octo 首页 AI 应用的生意判断
EN

AI 应用的生意判断

Bullet

持续观察

不换模型,专把写代码助手的等待压下去,少来回就能快一截

开始收费 早期 AI + 开发社区热度 93
团队 / 作者
Garry Tan
本站首次收录
2026-08-06
本站最近更新
2026-08-14

01

它为什么会被需要

从用户的一天开始 · 公开事实 + 工作流推理 · 2026-08-28

使用场景

不换模型,专把写代码助手的等待压下去,少来回就能快一截

公开材料尚未说明用户目前如何完成这项工作、它实际替代了什么。

它试图减少完成这项任务时的摩擦;公开用户材料尚未说明不解决的具体代价、发生频率或后果。

xOcto 的判断

这是把量化交易的延迟观搬到编码 agent 上:不优化模型,优化管线。

趋势是写代码助手的瓶颈从模型变到等待。切入做每天要跑几十轮改代码的团队:卖的是省下来的空等,不是更聪明的模型。现为内测免费,收费未披露。

使用理由

为什么用户会选择它

它承诺用更直接的方式完成这项任务:不换模型,专把写代码助手的等待压下去,少来回就能快一截;具体采用动机与持续使用情况尚未核验。

还不能轻易下结论的地方

真正值得继续追问的矛盾

① MCP 支持和 skills 保留什么时候落地——没有生态位就是一次性工具; ② 定价什么时候出现、按什么计费——商业模式决定它是不是一门真生意; ③ 基准能不能搬到更难的任务上(Terminal-Bench、CursorBench)——创始人自己说在测

如果你正在做这项工作

继续观察。它承诺用更直接的方式完成这项任务:不换模型,专把写代码助手的等待压下去,少来回就能快一截;具体采用动机与持续使用情况尚未核验。

怎样切入 / 可以借走什么

任何效率类产品都该问"最贵的一环在哪"。Bullet 的回答是往返次数,而不是模型 速度。做一个 agent 产品或效率工具前,先数一遍你的管线里有多少次串行等待——这是最容易被 改掉的成本。

证据与风险

未披露。 目前 private beta,免费,无订阅。支持 macOS 和 Linux。 ① MCP 支持和 skills 保留什么时候落地——没有生态位就是一次性工具; ② 定价什么时候出现、按什么计费——商业模式决定它是不是一门真生意; ③ 基准能不能搬到更难的任务上(Terminal-Bench、CursorBench)——创始人自己说在测

我们凭什么这样判断
公开事实

不换模型,专把写代码助手的等待压下去,少来回就能快一截

工作流推理

它承诺用更直接的方式完成这项任务:不换模型,专把写代码助手的等待压下去,少来回就能快一截;具体采用动机与持续使用情况尚未核验。

会改变判断的未知

公开补证:查找官方定价、客户案例或部署文档,确认谁付钱、不使用的代价及可确定交付的结果。

01 · 价值 证据不足

产品主张帮助用户完成:“不换模型,专把写代码助手的等待压下去,少来回就能快一截”。具体痛点强度与不采用代价尚未由用户证据核验。

02 · 共识 证据不足

已有采用或关注仍应记录,但不能替代痛点证据;未见持续使用、部署、复购或公开用户反馈,不能据此判断是否形成共识。

03 · 模式 证据不足

付费主体、定价与单位经济尚未核验;这是商业证据缺口,不反推问题不存在。

04 · 求真 证据不足

交付能否稳定发生、以及人工与安全边界,尚缺可复现的公开证据。

02

中英文生态与跨国机会

市场对照

尚未完成中英文市场对照。待覆盖范围和可核验证据补齐后再给出结论。

03

60 秒生意判断

先给出判断与下一步,再保留完整证据和反例。

一句话定位

不换模型、不堆上下文,专攻"模型外面那层循环"的速度:把一次 agent 运行的等待时间压下去。 核心理念是模型速度不如减少往返次数。

做这个东西的人

Adi 和 Alex,Yale CS 出身,刚从 AppLovin 和 Citadel 出来,YC S26。Bullet 是他们六次转型之后 的产物——之前做过 AI 对冲基金、浏览器 use agent、合成金融数据、移动 IDE,全失败了。

判断:这个背景要拆成两半。减分的一半:六次 pivot 说明他们擅长撞墙。加分的一半:优化延迟、 控制成本正是量化交易系统的基本功,和这个产品要解决的东西高度同源。

它到底能做哪几件事

  • 模型路由 → 简单步骤走快模型,任务配得上时才升级到大模型,不需要手动选模型
  • 定向代码搜索 → 不做整仓 embedding,用带 fallback 的搜索只拉相关文件,上下文更小
  • 上下文卫生 → 工具输出限长、过期截图消失、不重复读文件
  • 并行工具调用 → 独立的搜索/读取/命令并行跑,依赖的编辑和验证保持串行;自称内部测量 16% 更少往返、27% 更低成本
  • 复用现有订阅 → 用 Claude Code/Codex 订阅、任意 API key,或本地模型
  • CLI → npm install -g @trybullet/cli,macOS 和 Linux

它明确不做:不训练自己的模型,不是 Claude Code 的替代品,是包在现有模型和订阅外面 的一层更紧的循环。

它在替代什么旧行为

以前用 Claude Code 或 Codex 的典型等待流程:把整个仓库塞进上下文(或塞进压缩版)、 任务挨个串行执行、每个工具调用都在排队。一个 100 轮的 agent 任务,绝大多数轮次是无聊的—— 读文件、查路径、跑测试——本该秒回的动作被拖到前沿模型的延迟里。

Bullet 替代的是"最强模型从头跟到尾、串行、全仓上下文"这个默认方式。它赌的是: 一个真实的路由器,比一个更大的模型更能同时省下墙钟时间和成本。

商业模式

未披露。 目前 private beta,免费,无订阅。支持 macOS 和 Linux。

判断:没有定价页说明还在验证阶段。这个品类的收费点多半在"按运行次数/席位"而不是按 token—— token 成本已经在用户自己的订阅和 key 里了。

硬数字

  • HN Launch HN:93 points / 68 comments(2026-08 上旬)
  • SWE-bench Verified:479/500(95.8%)一次通过,平均 119s/任务,自称比 mini-SWE-agent + Fable/Sol 快 35-67%;宣传口径是"比 Claude Code/Codex 快 30-60%"
  • 内部测量:16% 更少往返、27% 更低成本
  • 团队人数、用户数、收入:未披露

基准可信度存疑:95.8% 是在"未启用路由"的对比评测里拿到的(创始人为了同模型 harness 公平对比),而 SWE-bench Verified 已被指出饱和。HN 用户 soulofmischief 直言"这基准结果 基本无意义"。

四维评估

维度 结论
创始人-产品匹配度 高——他们自己天天被慢 agent 咬,痛点是亲历的;AppLovin/Citadel 的延迟优化经验对口
产品洞察力 "模型速度不如减少往返次数"是这一代 agent 最重要但最少人做的洞察
技术实现质量 有真实用户反馈(一人说自己已切到 Bullet 主力使用),迭代快,但 MCP 支持还没上
市场时机 好——所有人都在等模型更快,没人修循环本身;但 Cerebras 等硬件侧也在攻同一问题

判断

这是把量化交易的延迟观搬到编码 agent 上:不优化模型,优化管线。

最可迁移的规律是"路由是当前 agent 里最便宜的加速手段"。绝大多数 harness 的默认做法是把 所有请求发给最强模型——省事,不会有人怪你。但一个 100 轮的 agent 运行绝大多数轮次是无聊的, 用前沿模型的价格和延迟去跑目录列表,是整个行业最贵的习惯。

HN 评论里最有价值的反对意见:一是基准饱和,95.8% 在成熟基准上说明不了什么,而且路由 没进评测;二是路由和搜索在开源侧(OpenCode + codebase-memory-mcp)也能拼出来。两条都指向 同一个结论:Bullet 的护城河现在很浅——它卖的是执行质量,不是模型也不是生态。

但"卖执行质量"本身是成立的品类。 评论里有真实用户说已经主力使用,另一个用户说 "速度感知明显、集成浏览器好用、Linux 支持加分"。Git 提交作者标注和隐私提示两个具体问题, 创始人都在修。

下一步看什么

① MCP 支持和 skills 保留什么时候落地——没有生态位就是一次性工具 ② 定价什么时候出现、按什么计费——商业模式决定它是不是一门真生意 ③ 基准能不能搬到更难的任务上(Terminal-Bench、CursorBench)——创始人自己说在测

可借鉴的做法

产品逻辑:任何效率类产品都该问"最贵的一环在哪"。Bullet 的回答是往返次数,而不是模型 速度。做一个 agent 产品或效率工具前,先数一遍你的管线里有多少次串行等待——这是最容易被 改掉的成本。

定价结构:无。未披露。

结论

值得跟进。 方向对、有真实用户、创始人回应诚恳,但护城河浅、基准争议未消、还没定价。 它最大的意义是验证了"优化循环而不是优化模型"这个方向,而这对任何做 AI 效率产品的读者 都是直接可用的判断。

05

从产品名直接追到一手材料

产品官网缺失或当前链接只是线索时,从这些检索入口继续核验。