一个 frustrating 的起点
Bullet 的创始人 Adi 和 Alex 在YC S26 demo day 上讲了这样一个故事。
他们毕业后进了一家金融公司,每天的工作就是优化股票定价的计算速度。某天,他们想做一个 AI 对冲基金,写了六个代码库——结果全部废了。
最让他们崩溃的,是 Claude Code 和 Codex 这两个人人追捧的 AI 编程代理。
每天花几个小时等代码生成,结果大部分输出是垃圾。Adi 甚至去下载了"Claude Code 的鞭子"(一个讽刺性的工具,用来惩罚慢响应)。
“我们花了几个月时间,等六套代码库的无用输出。”
后来他们想通了:既然 AI 编程代理不够快,那就自己做一个更快的。
于是 Bullet 诞生了。
Bullet 能做什么
Bullet 是一个 AI 编程代理(Coding Agent),和 Claude Code、Codex 的定位类似——你给它一个任务描述,它会自动读取代码、写代码、运行测试、修复 bug。
差别在于速度和上下文管理。
官方数据:在 SWE-bench Verified 基准测试上,Bullet 一次尝试就解决了 479/500 个问题(95.8%),平均每个任务 119 秒。比 mini-SWE-agent + Fable/Sol 的组合快 35-67%。
这个数字很有意思。因为 SWE-bench 是一个公认的硬基准,用来评估 AI 编程代理真实解决 GitHub issue 的能力。95.8% 的一击成功率,在目前看来是顶级水平。
为什么快?五个设计决策
Bullet 团队在 HN 的帖子中详细解释了他们的核心技术思路。我把它们提炼成五个关键设计:
1. 模型路由(Model Routing)
不是所有任务都需要最贵的模型。
比如一个简单的问题,你用 Sonnet 就能解决,为什么要调用 Fable?
Bullet 内置了一个路由层,根据任务的复杂度和类型,自动选择最合适的模型。简单任务用小模型,复杂任务才上大模型。
这个策略直接降低了成本,也减少了等待时间。
2. 精准上下文搜索
团队认为"把整个仓库 embedding 进去"是个错误的做法。
“太蠢了”,他们的原话。
同样,把整个上下文塞进对话窗口也是浪费。Bullet 做的是:
- 用更快的 grep 方式搜索代码
- 用更好的 grep 方式搜索上下文
- 只把相关部分加载进来
效果是:模型看到的上下文更精准,响应更快,出错概率更低。
3. 激进的上下文清理
这是 Bullet 最核心的差异点。
传统 coding agent 的问题是:工具输出太多,上下文越来越脏。截图过期了还在,重复读取的文件还在,无用的日志还在。
Bullet 的做法是:
- 工具输出有上限,超出截断
- 过期的截图自动消失
- 不重复读取已加载的文件
- 垃圾信息永远不淹没模型
团队测量了这个策略的效果:减少了 16% 的往返次数,降低了 27% 的成本。
4. 并行执行 + 串行验证
这是速度提升的关键。
独立的操作(搜索、读取、命令执行)全部并行跑。依赖性的操作(编辑、验证)才串行执行。
一个典型的流程是:
- 批量并行调查(同时搜索多个相关区域)
- 做一次精准的编辑
- 做一次聚焦的验证
- 循环
这种"批处理调查 → 精准修改 → 验证"的模式,避免了传统 agent 反复试探的低效。
5. 追求极致速度
Bullet 团队把速度当作一个核心指标,不是副产品。
他们的名字就叫 Bullet(子弹),寓意就是快。代码里到处能看到对延迟的优化——从网络请求到模型调用的每个环节。
和 Claude Code 比怎么样
客观地说,Claude Code 在功能丰富度和生态集成上还是领先。
但如果你主要关心的是速度,Bullet 确实有自己的优势。
几个真实的差异点:
- Claude Code 每次对话会加载整个上下文窗口,Bullet 做了智能裁剪
- Claude Code 的工具调用是串行的,Bullet 做并行批处理
- Claude Code 没有模型路由,Bullet 根据任务自动选模型
当然,Bullet 是 YC S26 的项目,目前还在早期。功能和稳定性都不如已经成熟很久的 Claude Code。
但它解决了一个真实痛点:等太久了。
怎么试用
官网是 codewithbullet.com。
官方还留了一个彩蛋——网站底部藏了一个代码,解开能看到秘密页面。他们声称整个秘密页面都是 Bullet 自己写的。
有意思的测试方式。
值得跟踪吗
如果你经常用 Claude Code 或者 Codex,并且对等待时间敏感,Bullet 值得试试。
即使最终不长期使用,他们关于 context hygiene 和 parallel execution 的思路,对整个 AI 编程代理领域都有参考价值。
YC S26 的项目,能拿到 SWE-bench 95.8% 的一击成功率,说明团队确实下了一番功夫。
你日常用哪个 AI 编程代理?等答案的时候有没有焦虑过?