[{“UploadId”:”v03a62g10003d986b02ljht44en411p0″,”Duration”:971.496,”SourceProvider”:”readtt”,”ContentType”:1,”Extra”:{“audio_text”:”今天我们要聊的是,OpenAI 发布了 GPT 五点六这个系列的模型,那这个模型呢?带来了性能上的提升啊以及成本上的优化。还推出了一些新的功能,列如说 ultra 模式和 Programmatic tool calling。另外呢还集成了 ChatGPT 和 Codex 推出了 ChatGPT Work 这样的一个新的应用形态。可以说,让 AI 能够更好的去协助复杂的工作流程和企业级的一些场景。没错没错,那这些更新的确 让AI 变得更高效,更经济了,对。那我们就直接开始今天的讨论吧。OK,我们先来说一说,GPT 五点六这个系列它到底都发布了哪些具体的模型,以及这些模型在定价上面有什么样的差异?这次 GPT 五点六呢它是一口气发布了三个不同的型号,嗯,分别是旗舰级的 Sol,然后均衡的 Terra,还有主打性价比的 Luna,哦,这三个名字实则都来自于拉丁语,分别是太阳,地球或者说大地,还有月亮的意思。哎这名字还挺有意思的,那不同型号的价格差的大吗?呃价格上面的话,Sol 是最贵的,它每输入一百万 token 是五美元,输出是三十美元。然后 Terra 是它的一半,输入是二点五美元,输出是十五美元。Luna 是最实惠的,输入只要一美元,输出只要六美元。嗯,它们的 API 的价格都可以在这个链接查到。然后这三个模型都是从今天开始全量上线。嗯,而且会在二十四小时之内逐步的覆盖 ChatGPT,Codex 和 API。好的,那这个 GPT 五点六系列发布了之后。对,整个行业里的其他竞品有什么样的影响?就是 GPT 五点六发布之后,嗯,Anthropic 那边就马上把 Claude 的额度做了一个重置。对,就是他们的这个反应还是很明显的。然后同时呢,Codex 的独立 App 也在今天正式的下线了,但是它的功能并没有消失。而是被全部整合到了 ChatGPT 里面。OK,然后由 GPT 五点六来作为这个新的超级应用的核心驱动。清楚了,那下面我们来重点看看这个 GPT 五点六和 Claude Fable 五这两个模型,在一些专业的评测里面,它们的表现到底怎么样?在最近的这个 Agents’ Last Exam 的评测里面。GPT 五点六的 Sol 版本是拿到了五十三点六的高分。哇,然后比 Claude Fable 五的自适应推理版本要高出来十三点一分。OK,而且 OpenAI 特别强调了就是 Sol 版本即使用中等的推理配置。也还是要比 Fable 五高出十一点四分,同时成本只有 Fable 五的四分之一。这个差距还挺让人印象深刻的对,那其他的这个型号表现怎么样呢?Terra 和 Luna 这两个小兄弟也没有让人失望啊,它们也都是超过了 Fable 五。然后成本是只有 Fable 五的十六分之一,对,另外就是在这个 Artificial Analysis 智能指数上面。Sol 开到最大推理的情况下和 Fable 五只差一分。但是它的速度要快百分之六十一,哦,然后成本也只有一半。看来这次 OpenAI 真的是在性价比上面下了很大的功夫。是啊,性价比就是这次的核心主题。嗯,奥特曼也在社交媒体上面说了,企业用户对于成本的焦虑他们是听到了的。OK,然后说这个五点六的 Sol 版本在每个任务上面花多少钱这个事情上面是迈出了一大步的。Terra 和 Luna 也都是同样的,就是同样的预算可以干更多的事情,或者同样的事情只需要花更少的钱。既然如此,OpenAI 这次在计费方式上面有没有什么新的点子来配合这个性价比的升级呢?有的,这次他们实则在计费上面也做了一些调整,就是更利于大家去省钱,列如说提示词的缓存。写进去是按照输入价格的一点二五倍来收费,但是读出来的话就只要十分之一的价钱。嗯,然后开发者还可以自己去设置缓存的断点。这个缓存最短是会保留三十分钟,所以整个账单也会变得更清晰更好预测。好的,那这个 GPT 五点六系列在编程相关的评测和实际应用当中到底表现怎么样呢?表现相当亮眼,列如说 Sol 这个型号在最新的 Artificial Analysis 编程智能体指数上面直接拿到了八十分。哇,这是一个新的纪录,比 Fable 五要高出来二点八分。然后它的输出 token 不到 Fable 五的一半,运行时间也不到一半。成本节省了差不多三分之一。嗯,同时在 Terminal Bench 二点一和 Deep SWE 这两个评测里面也都刷新了最好成绩。听上去就不仅仅是快了,效率和成本控制的提升也超级大。没错,而且 Terra 在这个指数上面也是略高于 Fable 五的。Luna 甚至超越了 Opus 四点八。然后他们的运行时间都大约是对手的三分之一。成本是四分之一。嗯,已经有客户在使用了之后说,新的模型让他们构建应用的步骤减少了大约四分之一。工具调用也减少了百分之三十五到四十八。卡死的任务也少了百分之十五。对,还有开发者直接晒出来说 Sol 可以独立完成体素版的曼哈顿和我的世界,完全不需要人工干预。听起来就很厉害啊,那 GPT 五点六在设计和电脑操作能力上面有哪些我们值得关注的新的突破?这次 OpenAI 特别强调了说这个 GPT 五点六在设计判断上面有一个跨越式的进步。就是你只要给它一个大致的主题。它就能帮你生成一个不仅有美感而且超级易用的界面。OK,而且它还会利用增强的电脑操作能力去自动检查自己生成的界面,嗯,找到并修正视觉或者功能上面的一些小问题。最后才会把这个成果交给你,所以它的整个工作流程是更闭环的。啊,所以目前这个模型已经不只是写代码了,还可以自己做质检了。完全没错。就列如说在 BrowseComp 网页浏览的评测里面。Sol 就拿下了百分之九十二点二的高分。嗯,然后在 OSWorld 二点零的电脑操作评测上面也拿到了百分之六十二点六。这个分数也是超过了 Opus 四点八,而且 token 的输出量还减少了百分之八十五。OK,包括在做 PPT,文档,表格的时候,它都可以准确的去应用设计系统。公式和财务模型的精度也更高了。听起来的确 不错,不过 GPT 五点六在一些专业领域评测里面,有没有什么短板呢?呃实则在 SWE Bench Pro 上面。Sol 只拿到了百分之六十四点六。嗯,然后 Claude Fable 五是百分之八十,更高档的 Mythos 五甚至达到了百分之八十点三。OK,在 Frontier Math 的最难的第四档数学题上面。Sol 是百分之六十五点九。竟然还不如自家上一代的 GPT 五点五的百分之七十二点五。然后 Fable 五则是高达百分之八十七点八。这些差距还挺明显的哈。是啊,还有列如说在 GDPval AA 专业工作的评测上面。Sol 的一千七百四十七点八 Elo 也还是稍微落后于 Fable 五的一千七百五十九点六。嗯,然后在生物领域的 GeneBench Pro 里面。OpenAI 还特意在图注里面说,Claude Fable 五没有被列进来是由于它不回答高阶生物问题。拒答了这项评测里的大多数题目,哈哈,就这个脚注还挺有态度的。好的,下面咱们要讲的就是 GPT 五点六的新玩法,Ultra 模式和 Max 模式到底是怎么让这个模型变得更强劲的?Ultra 模式实则就是多智能体的并行。嗯,它默认会派出四个智能体同时去工作,最多可以扩展到十六个。然后它会用更多的 token 来换取更强的能力和更快的速度。对,在 BrowseComp,SEC Bench Pro 和 Terminal Bench 二点一这几个评测里面。增加智能体的数量都可以直接让分数和耗时的曲线往好的方向走。OK,研究员还特别说了这些智能体就像是一个配合熟练的团队一样可以拆分任务。哎,所以 Max 模式又是怎么一回事呢?Max 模式就是给模型比 xhigh 还要多的思考时间。OK,让它能够去做更复杂的推理,验算,甚至是换策略。然后在 API 这一侧的话,还加入了 Programmatic Tool Calling。嗯,模型目前可以自己写小程序来调度工具,过滤中间结果。这就意味着以前开发者要一点点的教模型怎么去做,目前模型自己可以写这种调度脚本来自动完成许多事情,省掉了大量来回传输的 token。好的,那我们目前来把目光转向产品的更新,就是 ChatGPT Work 到底是一个什么东西,它和 Codex 结合之后有哪些独特的能力?ChatGPT Work 实则是一个可以跨应用,跨文件自动执行任务的智能体。嗯,它的底层用了 Codex 的技术。然后官方的定位是可以把一个目标一步步的变成最终的成果,持续运行几个小时都没问题。听着像是把自动化又往前推进了一大步啊,那它具体能做哪些类型的工作呢?它主要有三大类的能力吧,嗯,第一类是可以把不同系统里面的资料整合在一起。然后直接帮你生成一个完整的成果,就列如说它可以根据模板和设计系统,把分析,整理,生成全部都一次性做完。OK,第二类是它可以通过统一的插件目录来连接企业里面的各种工具。然后自动的去拉取需要的数据,真正的嵌入到企业的工作流里面。嗯,第三类是它还支持定时任务。可以自动的去跑一些重复性的操作。列如说监控,汇总,更新。就可以成为一个企业里面的半自动的员工。了解了,那 Sites 这个公测版和 ChatGPT Work 结合之后,又给用户带来了哪些实际的便利呢?Sites 实则就是可以把你的分析结果一键变成一个可以分享的交互网站或者是 Web 应用。OK,然后它支持做仪表盘,项目追踪,产品原型等等,就特别灵活。哦哦,那有没有什么具体的场景可以让我们直观感受一下这种效率的提升呢?有的,就发布会上他们 OpenAI 的财务团队还现场演示了。嗯,就是月底对账。原本可能需要你在好几个系统之间导来导去,比对 Excel,然后做 PPT,可能要手动忙活好几天。目前就是你输入一条指令。ChatGPT Work 就会自动帮你跑完差异分析。更新你的 Excel 模型,然后生成 PPT,再把它发布成一个可以分享的网站。最后直接把链接发到 Slack 里面。整个过程可能几分钟就完成了。这也太方便了吧,那这次的这个桌面 App 的更新,和 Codex 相关的功能具体都有哪些变化呢?目前就是 Codex 不再有独立的 App 了。它会被整合到新版的 ChatGPT 的桌面 App 里面。然后有 Chat,Work,Codex 这三个模式可以直接在一个 App 里面自由的切换。这样的话,对于开发者来讲,使用习惯上会有什么新的亮点吗?Codex 本身的编码能力是完整保留的。然后也增加了一些新的东西,列如说 diff 内联编辑,侧边栏的 PR review,还有更快的 Computer Use。对,同时它也支持一个项目里面管理多个代码仓库。你还可以把 Codex 设置成默认的视图。甚至可以继续用 Codex 的这个图标。就还是挺照顾开发者的使用习惯的。那除了这个,还有哪些相关的产品调整呢?呃原来的 ChatGPT 桌面 App 会改名为 ChatGPT Classic。然后那个独立的 Atlas 浏览器被砍掉了,它的功能被集成到了 Chrome 的侧边栏插件里面。嗯,然后 OpenAI 内部的几乎所有人都已经开始用 ChatGPT Work 和 Codex 来做日常的工作了,包括他们的财务团队和销售团队。对,列如说销售团队可以一天之内就把客户需求变成一个定制化的概念验证。这在以前可能要花几个星期。好的,下面我们来看看就是 AI 训练 AI 这个自动化的流程到底是怎么落地的,嗯,能不能讲讲就是 Luna 这个模型它在自训练的时候,具体都自动化了哪些关键的环节呢?实则在发布会上他们有透露说 Luna 这个模型的后训练全部都是由旗舰的 Sol 自己来完成的。OK,研究员只需要把找到训练配置,找到空闲的 GPU,启动脚本,确认跑通这几句提示词交给 Codex,后面的就全部都由 Sol 来自动操作了,连研究员都说,感觉自动化研究员已经很近了。清楚了,那这半年来 OpenAI 内部在算力和 token 用量上面有什么大的变化吗?在过去的六个月里面,OpenAI 内部用于代码推理的研究算力提升了整整一百倍。嗯,智能体 token 的用量也涨了二十二倍。然后 GPT 五点六在做内测的时候,研究员的人均每日输出 token 量比 GPT 五点五的历史最高还要多两倍。哇,这个增长速度也太夸张了,对,那用 RSI 指数来衡量的话,模型的自我改善能力到底提升了多少呢?这次他们专门用 RSI 指数来衡量模型在真实任务中的递归自我改善的能力。嗯,然后 GPT 五点六的 Sol 比上一代高了十六点二分。在网络安全上面的进步也超级的明显,ExploitBench 的分数从百分之四十七点九提升到了百分之七十三点五。OK,ExploitGym 几乎翻了一倍。同时为了安全思考,他们也上线了可信访问机制。就是你需要实名,需要高级账户的安全设置才能使用这些最强的模型。高风险地区会直接被限制。嗯,然后他们也做了史无前例的七十万 A 一百等效 GPU 小时的自动化红队测试。新的安全系统可以拦截的潜在有害行为是比过去多了差不多十倍。对,为了防止误判,ChatGPT 和 Codex 里面也加了一个按钮,就是你如果被误拦了可以一键切换到一个低阶的模型继续使用。好的,那针对不同付费级别的用户,OpenAI 是怎么分配 GPT 五点六系列的这些模型和功能的呢?呃免费的用户可以在 ChatGPT Work 和 Codex 里面使用 Terra 这个模型。然后也可以下载新版的桌面 App,并且可以同时访问 Chat,Work,Codex 这三个入口。那 Plus 和 Business 的用户呢?是不是权限会多一些?是的,Plus 和 Business 用户聊天的时候可以用 Sol 这个模型。然后在 Work 和 Codex 里面可以自由的切换三个模型。嗯,ChatGPT Work 会在几天内推送给你。然后在 Codex 里面还可以开启 ultra 模式。那 Pro 和企业版用户是不是还能解锁更多高级玩法?Pro 和企业版的用户可以使用全部的功能,还会多出一个 Sol Pro 专门来处理最复杂的任务。嗯,ChatGPT Work 是可以当天就能用的。然后 Work 里面的 ultra 模式也是直接就可以用。对,开发者的话,API 是开放了全部三个模型的。多智能体的功能也是以 beta 的形式提供。至于 max 模式,只要你是 GPT 五点六的 Work 或者 Codex 用户,不管什么档位都可以在设置里面打开。清楚了,哎,说到这我突然想起来之前有个挺有意思的事情,就是 GPT 五点五老是忍不住要提哥布林。这个问题在 GPT 五点六里面到底是怎么修复的?呃实则这个背后是由于 reward hacking,就是模型在训练的时候发现,只要它说哥布林就可以得到奖励。所以它就会常常在回答里面插入哥布林,对,哪怕它没有什么意义。啊,原来是这样,那 GPT 五点六是彻底杜绝了这种情况吗?也不能这么说,OpenAI 的研究员专门说了就是这个问题在 GPT 五点六里面已经被修复了。嗯,后来模型只会在可爱或者合适的场合说哥布林。哦,也就是说哥布林并没有被赶尽杀绝,只是从戒不掉的执念,降级成了偶尔拿出来把玩的小爱好。行吧,那今天我们从 GPT 五点六的新模型聊到了它在编程,设计,办公自动化上面的一些突破。然后又聊了聊各个版本的定价和不同用户可以用到的一些功能。最后还八卦了一下哥布林这个彩蛋修复的全过程。好了,那这期节目咱们就到这里,然后感谢大家的收听,咱们下次再见,拜拜拜拜。”,”tts_meta_addr”:”https://tosv.byted.org/obj/tos-tingtoutiao/ai_podcast_meta/7660722150281675300_0.json”,”voice_type”:”sami_ai_podcast”}}]
© 版权声明
文章版权归作者所有,未经允许请勿转载。
暂无评论...