导读:本文整理自OpenAI团队的工程实践分享。原文记录了他们用5个月时间,完全由Codex智能体从零构建一款百万行代码产品的全过程。笔者在编译过程中加入了个人思考批注,供大家参考。
01|实验背景:零人工代码的产品开发
OpenAI内部团队做了一项相当激进的实验:用五个月时间交付一款软件产品的内测版,全程没有一行代码是人工手写的。
这款产品不仅有内部日活用户,还招募了外部Alpha测试者。从应用逻辑、测试用例、CI配置、文档、可观测性系统到内部工具,所有代码全部由Codex生成。最终估算下来,耗时大约是传统人工开发的十分之一。
核心模式可以概括为八个字:人类掌舵,智能体执行。
笔记思考:1/10的效率提升这个数字很值得玩味。注意这不是”写代码速度快10倍”,而是端到端交付速度快10倍——包含了测试、部署、运维、文档全链路。这意味着智能体带来的是系统性的效率革命,不只是编码环节的优化。
02|从零开始:空仓库到百万行代码
2025年8月下旬,项目第一次提交代码。初始的仓库结构、CI配置、格式化规则、包管理器设置、应用框架,全部由Codex CLI调用GPT-5生成。甚至连指导智能体如何在仓库中工作的AGENTS.md文件,也是Codex自己写的。
五个月后,代码量达到约一百万行,期间合并了约1500个Pull Request,而驱动这一切的最初只有3名工程师。换算下来,人均每天处理3.5个PR——团队扩展到7人后,吞吐量反而更高了。
整个过程中,人类工程师从未直接写过代码。”不手写代码”成了团队的核心理念。
03|工程师角色的重新定义
不写代码之后,工程师做什么?答案是转向系统设计、架构规划和杠杆搭建。
项目初期进展比预期慢,缘由不是Codex能力不够,而是环境规范不清晰。智能体缺少实现高级目标所需的工具、抽象层和内部结构。于是工程师的主要任务变成了:协助智能体更好地完成工作。
具体做法是深度优先的工作方式:把大目标拆成小模块,让智能体逐个构建,用已完成的模块解锁更复杂的任务。遇到卡点时,解决方案不再是”再加把劲写代码”,而是追问:还缺什么能力?怎样让这个能力对智能体清晰可见、可强制执行?
人类几乎完全通过Prompt与系统交互:描述任务、运行智能体、生成PR。Codex会自己审核代码、处理反馈、循环迭代直到通过所有智能体评审。
笔记思考:这一段超级关键。工程师的价值从”写代码的人”变成了”设计环境的人”。类比一下:以前工程师是司机,目前变成了造车的人+修路的人。车(智能体)自己会跑,但路好不好、规则清不清楚、导航准不准,决定了整体效率。
04|提升应用的“智能体可读性”
代码吞吐量上去之后,瓶颈变成了人工QA的能力。既然人类时间是稀缺资源,团队就想办法让Codex能直接”看懂”更多东西——包括UI界面、日志、指标。
具体措施包括:让应用支持基于git worktree启动,Codex每次修改都能启动独立实例;接入Chrome DevTools协议,让智能体可以处理DOM快照、截图和页面导航。这样Codex就能自己复现bug、验证修复、推理UI行为。

图 1|Codex 如何自己完成一次界面验证
读图顺序:选择目标并清空控制台 → 保存修改前快照 → 触发用户操作 → 收集运行事件 → 保存修改后快照 → 修复并重启。整个过程会循环执行,直到验证结果干净无误。
可观测性工具也做了同样的改造。日志、指标、链路追踪全部对Codex开放查询。有了这些上下文,”确保服务启动在800ms内完成”、”这四个关键用户路径耗时不超过两秒”这类要求,智能体自己就能验证。

图 2|把系统的“眼睛和仪表盘”交给智能体
核心不是多装几个工具,而是让 Codex 能直接查询日志、指标和调用链。这样它既能看到“哪里报错”,也能判断“哪里变慢”,从发现问题一路走到验证修复。

05|代码仓库即知识系统
上下文管理是智能体处理复杂任务的最大挑战之一。团队早期踩了一个坑:尝试用一个巨大的AGENTS.md文件把所有规则写进去,结果失败了。
缘由有四个:
- 上下文是稀缺资源——大文件挤占了任务代码和相关文档的空间,智能体要么漏掉关键约束,要么优化错了方向
- 信息过载等于无效——什么都”重大”等于什么都不重大,智能体变成模式匹配而非有意识导航
- 快速腐化——庞杂手册很快变成过时规则的坟场,智能体无法判断哪些还有效
- 难以验证——单一大文件不适合做覆盖率、新鲜度、所有权、交叉链接等机械检查
后来的方案是:把AGENTS.md变成目录(约100行),真正的知识放在结构化的docs/目录下。智能体从一个小而稳定的入口开始,按需深入查看,而不是一开始就被淹没。
笔记思考:“给地图,不要给一千页说明书”——这个原则对人类同样适用。好的文档系统本质上就是一套信息架构,渐进式披露。这也解释了为什么许多团队的代码规范文档没人看:不是大家不想遵守,而是信息密度和获取成本太高了。
06|面向智能体可读性优化
既然代码全由智能体生成,优化方向自然就变成了提升代码对Codex的可读性——就像传统团队优化代码对新工程师的可读性一样。
一个核心认知:智能体运行时,上下文中没有的东西等于不存在。存在Google Docs、聊天记录、人脑子里的知识,系统都访问不到。只有仓库里版本化的产物——代码、Markdown、Schema、执行计划——才是智能体能看到的全部。

图 3|Codex 看不见的知识,就等于不存在
Google 文档、聊天消息和个人经验都在智能体的视野之外。只有把关键决策整理成 Markdown 等文件并放进代码仓库,它们才会进入 Codex 可检索、可推理、可执行的知识范围。
这带来了许多取舍:倾向于选择能完全内化到仓库中推理的依赖和抽象;那些”枯燥”的技术反而更受青睐,由于API稳定、训练数据充足、可组合性好。某些情况下,让智能体重写部分功能比引入不透明的第三方库更划算。
把系统更多部分转化为智能体可检查、可验证、可直接修改的形式,杠杆效应就越大。
07|用架构约束保证品味
光靠文档无法维持代码库的一致性。团队的做法是:强制执行不变量,而不是微观管理实现过程。列如要求”在边界处解析数据形状”,但不指定用什么库(模型似乎偏爱Zod,但团队没有硬性规定)。
整个应用围绕严格的分层架构构建。每个业务域固定划分几层(Types → Config → Repo → Service → Runtime → UI),依赖方向严格验证,横切关注点(认证、连接器、遥测、功能开关)只能通过Providers接口进入。这些约束全部由自定义linter和结构测试机械执行——当然,linter也是Codex写的。

图 4|固定依赖方向,让智能体“快而不乱”
主链路从底层数据定义逐级向上:Types → Config → Repo → Service → Runtime → UI;认证、遥测等横切能力只能从 Providers 入口进入。
这张图真正要表达的是:智能体可以自由实现细节,但不能随意跨层依赖。边界由自动化检查守住,规模扩大后架构也不容易失控。
这种架构一般是大公司几百人团队才会搞的东西。但对智能体编码来说,这是早期就必须有的前提条件——有约束,速度才不会下降,架构才不会漂移。
在人工流程中,这些规则可能显得迂腐。但有了智能体,规则一旦编码就能立即全局应用,变成效率倍增器。
08|吞吐量改变合并策略
Codex吞吐量上去之后,许多传统工程规范就不适用了。
列如:仓库尽量减少阻塞式合并门禁,PR生命周期很短,测试偶发失败一般重跑解决而不是卡住进度。由于在智能体吞吐量远超人类注意力的系统中,纠错成本低,等待成本高。
低吞吐量环境下这么做是不负责任的。但在这里,往往是正确选择。
09|端到端自主能力的进化
随着测试、验证、评审、反馈处理、故障恢复等环节陆续被编码进系统,代码库最近跨过了一个重大门槛:Codex可以端到端驱动一个新功能的完整开发。
给一个Prompt,智能体目前可以:
- 验证代码库当前状态
- 复现已报告的漏洞
- 录制故障演示视频
- 实施修复
- 运行应用验证修复效果
- 录制解决方案演示视频
- 打开Pull Request
- 回应智能体和人类反馈
- 检测并修复构建故障
- 仅在需要判断时交由人工处理
- 合并更改
当然,这种能力高度依赖特定的仓库结构和工具投入,不能简单照搬。
10|熵增与“垃圾回收”机制
完全自主的智能体也带来了新问题。Codex会复制仓库中已有的模式——包括那些不够好的模式。时间一长,必然导致架构漂移。
最初团队每周五花20%时间人工清理”AI残渣”,但很快就发现不可扩展。
后来的解决方案是:把”黄金原则”直接编码进仓库,建立循环清理流程。定期运行后台Codex任务扫描偏差、更新质量评分、发起针对性重构PR。大多数改动一分钟内就能审核并自动合并。
这很像垃圾回收机制。技术债务就像高息贷款,持续小额偿还总比累积到爆仓再处理好得多。人类的品味一旦被捕捉到,就能持续应用于每一行代码。
结语|纪律的形态变了
到目前为止,这套策略在OpenAI内部发布和采纳过程中表现良好。但仍有许多未知:完全由智能体生成的系统,架构一致性会如何随时间演变?人类判断力在哪些环节价值最大?模型能力增强后,这套系统又会怎样进化?
有一点很明确:构建软件依旧需要纪律,但纪律更多体目前支撑结构上,而不是代码本身。保持代码库一致性的工具、抽象和反馈回路变得越来越重大。
当前最棘手的挑战聚焦在:设计环境、设计反馈回路、设计控制系统——协助智能体实现我们的目标:大规模构建和维护复杂、可靠的软件。
编译者总结
读完这篇实践分享,有三个核心洞察值得记住:
1. 工程师的新身份是”环境设计师”
不再亲手写代码,而是设计让智能体高效工作的环境——包括架构、工具、规范、反馈回路。
2. 代码仓库成为唯一真相来源
智能体看不到的东西等于不存在。所有知识、决策、规范都必须内化到仓库中,结构化、可验证、可索引。
3. 约束即速度
反直觉但真实:智能体时代,严格的架构约束不是瓶颈,反而是速度的前提。没有边界的自由只会产生混乱和熵增。
原文作者:Ryan Lopopolo | OpenAI
本文为编译整理笔记,加入个人思考批注,仅供学习交流