Codex模型别乱拉满
Codex模型别乱拉满
Sol负责判断,Luna负责执行,Ultra默认关闭。
GPT-5.6 的关键不是全部拉满,而是按角色分配模型。
01 / 先说结论:默认配置应该收敛
GPT-5.6 发布后,Codex 同时出现了 Sol、Terra、Luna 三个模型,以及 Low、Medium、High、Extra High、Max、Ultra 六档推理强度。选择空间变多了,但日常工作不需要把每个旋钮都打开。
更稳妥的默认配置是:主 Agent 使用 GPT-5.6 Sol + High,简单任务切到 Medium,真正困难的任务切到 Extra High,Max 和 Ultra 默认关闭。子 Agent 则交给 LazyCodex 做角色分工。
02 / 为什么不提议默认使用 Ultra
原帖作者记录了一次额度事故:一次配置排查任务使用 Terra Ultra,运行超过一个小时仍未完整解决,5 小时用量归零,最后留下 17 个已经结束的子 Agent,周额度只剩 40%。这是原帖作者的个人经历,不代表所有账户都会复现。
引用帖 Theo 提到,如果把 GPT-5.6 Sol 设置为 Ultra,它创建的子 Agent 也会继承 Ultra。更麻烦的是,子 Agent 还可能继续派生新的子 Agent,调用量会递归放大。
主 Agent:Sol Ultra
├── 子 Agent A:Sol Ultra
│ └── 子 Agent A1:Sol Ultra
├── 子 Agent B:Sol Ultra
└── 子 Agent C:Sol Ultra
所以 Ultra 更适合受控压力测试,或明确知道额度上限、能够限制子任务规模的场景。把它作为日常默认档,潜在消耗风险可能大于能力收益。
03 / 六档推理强度怎么选
推理强度决定当前调用愿意投入多少计算,但不会把小模型临时变成大模型。可以按任务复杂度做简单分层:
- Low:明确、机械、速度优先的小任务
- Medium:日常轻任务,速度和质量均衡
- High:大多数复杂知识工作和编程任务
- Extra High:复杂规划、疑难问题、交付前深度处理
- Max:超大型项目或高代价决策的临时加码
- Ultra:高强度 Multi-Agent 场景,默认不提议常开
原帖引用的 DeepSWE 数据显示,Sol High 达到 69%,平均每个任务成本 3.47 美元;Sol Medium 达到 61%,平均成本 1.86 美元。
04 / Sol、Terra、Luna不是画质档
根据原帖引用的公开资料,Sol 是旗舰型号,Terra 关注能力、速度和成本平衡,Luna 更偏速度和成本效率。模型大小决定基础能力和能力上限,推理强度决定当前调用投入多少计算,这两个旋钮不能混为一谈。
原帖引用 Artificial Analysis 的能力与成本曲线,指出 Luna 和 Sol 在各档位都位于 Terra 的更优位置。
05 / 最实用的分工:Sol负责判断,Luna负责跑腿
理解全局目标、拆解任务、处理冲突和最终把关,更适合交给 Sol。搜索文件、查资料、读文档、跑测试和收集证据,更适合交给 Luna。
- Explorer、Librarian、QA Executor:GPT-5.6 Luna,High
- Executor、Metis:GPT-5.6 Sol,High
- Plan、Momus、代码审查角色:GPT-5.6 Sol,Extra High
这套分工的核心是:让快速模型扩大并行度,让更强的模型聚焦处理不可外包的判断。
06 / LazyCodex解决的是资源分配
原帖作者推荐 LazyCodex,是由于 Codex 明明拥有子 Agent 能力,却不必定会主动把任务拆开。LazyCodex 的价值,是把角色和模型显式绑定。
实际安装前,提议先阅读仓库当前版本的安装说明,并备份现有配置。角色名称、配置目录和模型标识不能只凭旧版本经验判断。
07 / 一套可以直接照抄的配置
默认主模型:GPT-5.6 Sol
默认推理:High
轻量任务:GPT-5.6 Sol,Medium
困难任务:GPT-5.6 Sol,Extra High
并行搜索与执行:GPT-5.6 Luna,High
Max:需要时临时开启
Ultra:默认关闭
真正需要判断的只有一个问题:当前任务有多复杂?计算资源应该围绕风险分配,而不是围绕模型名称分配。
08 / 最后判断
GPT-5.6 带来的变化,不只是模型变强,而是 Codex 开始把 Multi-Agent 作为正式工作方式的一部分。更稳妥的路线是:Sol 做主控,Luna 做执行,High 做默认,Medium 和 Extra High 按任务切换,Max 和 Ultra 只在明确受控的场景里使用。
不要把额度烧在所有 Agent 都能做的事情上,把最强模型留给真正需要判断的地方。