GPT-5.6 发布之夜,Codex/ChatGPT 合二为一

内容分享2小时前发布
0 1 0

[{“UploadId”:”v0da62g10003d98r3k2ljhta483hta5g”,”Duration”:747.968,”SourceProvider”:”readtt”,”ContentType”:1,”Extra”:{“audio_text”:”今天我们要聊的是 OpenAI 最近发布的 GPT-5.6这个模型。对,然后还有ChatGPT Work 这个智能体的产品。以及他们是怎么把这些 AI 变得更高效。更集成化地去帮我们完成一些实际的任务的,同时还要面对越来越严格的这种政府的监管。没错没错,这个话题最近的确 很火,那我们就直接开始吧。第一第一个话题就是大家最关心的,GPT-5.6 它终于公开亮相了,那这个发布有哪些我们之前实则已经知道了的关键的信息。实则这次 GPT-5.6 的发布啊,就特别像大家在等一个早就定好日期的演唱会。嗯就所有的重大信息实则提前都已经泄露出来了,列如说它的性能跑分,早在六月底就已经在网上传开了,然后它的价格也早就挂在官网上了,大家就只是在等一个正式开抢的时间。既然如此,那OpenAI 在发布 GPT-5.6 的同时,还悄悄的推出了哪些容易被忽略但实则超级值得关注的新的东西?有意思的是,就在 GPT-5.6 正式发布的同时,OpenAI 还上线了一个全新的智能体的产品,叫做 ChatGPT Work,然后另外一个就是,把 Codex App 直接整合到了 ChatGPT 的桌面应用里面,这两个更新实则都被模型本身的热度给盖住了,但实则它们才是这次 OpenAI 真正想要藏在靴子里面的新的玩法。听起来的确 很实用,那这次 GPT-5.6 有哪些不同的版本,然后它们的定价和定位上面到底有哪些新的变化?GPT-5.6 这次有三个不同的版本,分别是旗舰版的 Sol,均衡型的 Terra,还有轻量型的 Luna,啊,这个数字呢还是代表它的这个世代,然后用天体的名字来区分不同的档次,这也暗示了后来每个版本都可以独立的升级。嗯,那不同版本在价格和性能上面拉开的差距大吗?具体来说呢,Sol 的价格实则跟 GPT-5.5 是一样的,每一百万 token 的输入是五美元,输出是三十美元。但是 Terra 的价格直接砍半,然后 Luna 更是降到了一美元和六美元,就超级的便宜。OpenAI 对 Terra 的定位是,在知识工作的评测上面,它可以用更低的成本打败 GPT-5.5,然后 Luna 呢就是,它的成本不到一半,但可以超级接近 GPT-5.5 的最高的能力。所以这次的核心实则是更省,而不是更机智。清楚了,那GPT-5.6 在实际的性能上面,或者说在一些评测上面有哪些让人眼前一亮的新的突破呢?最夸张的是在第三方评测机构,Artificial Analysis 的编程智能体指数上面。Sol 版本在开满 max 推理之后,直接拿到了八十分的历史新高,比之前的最高分的模型还要少用百分之五十四的输出 token,然后时间也缩短了百分之五十七。哇,那这个提升的确 很惊人,尤其是在效率上面。是的,而且有意思的是,这次 OpenAI 在设计上面的改善实则比单纯的提升跑分还要让人关注,由于以前他们的这个模型在前端开发这块一直是被吐槽的嘛。但是目前他们加入了这个类似于人类工程师的这种,看过成品才交付的机制。模型目前可以自己去打开页面,检查这个视觉和功能,然后自动的去补完这些细节。所以他们的这个前端质量的评分也从四点零直接提升到了四点四。甚至连 Canva 都说,GPT-5.6 做幻灯片要比其他的模型强,token 效率可以高出一点六倍。说到这个,那GPT-5.6 在 API 和开发者工具这块,又有哪些让人兴奋的新的特性呢?这可太多了,第一就是这个 API 里面加入了程序化的工具调用。就是模型目前可以自己去写 JavaScript 代码,然后去编排整个工具链,而且是在一个隔离的运行时里面,所以它会超级的安全。这个听起来就大大简化了开发者的许多操作,还有其他的亮点吗?有啊,还有就是这个多智能体的功能目前已经在 Responses API 里面以 beta 版本上线了,就是你可以在一个请求里面同时派生出多个子智能体,然后并行的去工作。另外还有一个就是,缓存机制目前也支持显式的声明断点,就是以前许多需要开发者自己去做的一些流程的编排,目前模型本身就可以处理了。所以目前早期的测试者里面,大家就会有这种,保时捷对曲速引擎的这种比喻,就是说,这些前沿的模型之间的差别已经不是说谁碾压谁了。而是真的就是看个人的喜好了。的确 是这样,那我们接下来就重点来讲讲这个 ChatGPT Work,和这个智能体到底是怎么集成到一个 App 里面的,那ChatGPT Work 这个东西到底有什么独特的,它是怎么帮用户去完成复杂的任务的?ChatGPT Work 实则完全颠覆了大家对于传统 AI 的一个印象,就是它不再只是给你一个提议或者说一个文本的回复,它是真正帮你把活儿干完的一个智能体。OK列如说你要它整理会议记录,它会自动的去调用 Slack 或者是 Teams 里面的聊天记录,然后按照你设定的时间,列如说每周一的早上自动生成一个议程。啊,那它岂不是还能跨应用联动,听起来就感觉很厉害啊。没错没错,就是你可以让它去@一个文件,然后它就会自动打开 Google Drive 去找到那个文件,接着帮你写好一个文档,做好一个表格或者是做一个幻灯片,甚至它还能直接发布成一个网页应用。然后如果遇到没有 API 的情况,它还可以通过内置的浏览器和 Computer Use 来模拟鼠标键盘的操作,就真的是像一个同事一样帮你从头到尾把事情做完。听起来很方便啊,那这个 ChatGPT Work 背后的,浏览和操作电脑的能力到底有多强?有没有什么具体的评测数据可以体现出来?这个嘛,就是最新的这个 Sol 模型在 BrowseComp 上面的网页深度检索的测试当中,它的得分是百分之九十二点二。然后在 OSWorld 二点零这个模拟真实的电脑操作的基准测试当中,它拿到了百分之六十二点六。这两个数据实则都是刷新了纪录的,最夸张的是,它在完成这些任务的时候,只需要用到 Anthropic 的 Opus 四点八的百分之十五的 token 用量。所以这也是为什么 Work 可以连续稳定的运行很长时间,同时还超级超级的省 token。好吧,那就是说这个,Codex 是怎么从一个代码智能体变成一个可以做各种知识工作的通用的智能体的?由于实则,OpenAI 的数据是很能说明问题的,就是每周有超过五百万人在用 Codex,然后其中有一百多万人,他们根本就不是在写代码。所以就是说,有差不多五分之一的用户,他们在用 Codex 来做一些别的事情,列如说分析数据,整理文档等等。哦,那看来许多人已经把它当成一个全能助手了,而不是只用来写代码。对的对的,由于写代码实则就是一个,把目标拆分成小的步骤,然后去用合适的工具把它实现,最后检查有没有错误这样的一个过程。那这个过程实则和做许多知识工作是一模一样的。所以这也是为什么 OpenAI 会把它泛化,变成一个可以做各种任务的智能体。那实则类似的,像 Anthropic 他们实则也在今年一月份的时候,把 Claude 升级成了可以做编码和非编码的各种工作,然后他们最近也有数据显示,在他们的 Cowork 的会话里面,实则只有百分之八点七是写代码,其他的大部分都是一些业务流程,列如说对账啊,做报表啊这种。那这个 OpenAI 这次在把 ChatGPT,Work 和 Codex 整合到一个桌面应用里面的时候,具体都做了哪些让人眼前一亮的调整呢?目前就是,你可以在一个 App 里面,自由的切换 Chat,Work 和 Codex 这三个模式,然后它同时支持 macOS 和 Windows,所有的用户,包括免费的用户都可以用。而且它也很贴心,就是你以前的那些项目设置啊什么的都会帮你保留,甚至你还可以把 Codex 设成默认的主页,然后 macOS 的用户连应用图标都可以保持不变。那这次合并之后,Codex 本身有什么让人兴奋的新功能吗?嗯,目前你可以直接在应用里面编辑 Markdown 和代码,然后 GitHub PR 目前可以在侧边栏直接 review,就是它的评审意见和 diff 是对照着给你看的,而且它一个项目可以管理多个仓库。再加上 GPT-5.6 的加持,目前 Computer Use 的反应速度也更快了。既然如此,那这个,Atlas 浏览器的这个调整,和 Chrome 扩展的这个更新,背后到底有什么深意?实则他们的博客里面有讲到,就是说独立的 Atlas 浏览器会逐渐的退出,然后它的那些浏览器的功能会被一个全新的 Chrome 扩展取代。这个扩展会直接常驻在 Chrome 的侧边栏里面。就你不用再去切窗口了,你就可以直接在侧边栏里面使用这些 AI 的功能。那就是说,OpenAI 目前不只是在做模型的比拼了,他们在产品的入口这块也在做超级激烈的争夺。对的对的,你看他们把 Codex 合并进来,把 Atlas 去掉,然后把 Chrome 扩展做成一个新的主力入口。实则他们的目标很简单,就是要让你一打开电脑就能看到 AI,就是要让所有的用户,无论他是不是付费的,无论他用的是网页还是桌面还是手机,都可以超级顺畅的去使用 Work 和 Codex 这些高级的功能,就是要把门槛降到最低。让 AI 变成你电脑里面的像系统服务一样的东西。感觉的确 很方便啊,那我们接下来就说一说,这个政府的禁令和审查到底带来了哪些影响。嗯就是这个 GPT-5.6 它的发布流程到底在政府的介入之下发生了哪些变化?这次实则最大的不同就是,发布的日期不是 OpenAI 自己可以决定的,由于在六月二号的时候,特朗普签署了一个行政令。要求所有的 AI 公司在他们的前沿模型面向公众之前,必须要先把这个模型交给政府去做一个能力的评估。所以说 GPT-5.6 实则一开始不是所有人都能用上的?是的,虽然它在六月二十六号就对外宣布了,但是实则那个时候,它只开放给了大致二十家已经报备过的机构。然后经过商务部下属的 AI 标准与创新中心两周的评估,到了七月八号才正式全面开放,所以整个流程是被政府严格管控的。我很好奇,这个 Sol 模型到底在网络安全和生物领域展现出了什么样的能力,为什么会引发政府的审查?由于实则 Sol 它是可以识别出系统里面的一些漏洞的,甚至可以找到一些攻击的组件。OK 但是它在官方的测试里面,并没有办法把这些东西组合成一个完整的攻击链。不过就是由于它有这样的潜力,所以政府对于它的管控就会更加严格,会一直下沉到产品的层面。那在这种情况下,OpenAI 是怎么来平衡这个安全审查和用户体验的?他们实则在开发者的文档里面写的很清楚,就是部分的 API 调用,可能会被中途拦截,然后交给安全系统去做更细致的检查,特别是在网络安全这个领域。由于有些操作它是很难去区分到底是一个攻击还是一个防御,所以他们就干脆把防护的级别提升到了上一代的差不多十倍。OK 但是他们也知道这样可能会误伤到一些正常的使用,所以他们也设计了一个很贴心的功能,就是如果你被拦截了,你可以一键切换成一个能力弱一点的模型,马上就可以继续使用,相当于把这个选择权还是交回到了用户的手里。那最近这一波政府的审查和出口管制,对 OpenAI 和 Anthropic 这样的头部的 AI 公司到底带来了什么样的影响?就像 OpenAI 他们虽然配合了审查,但是他们也很明确的表达了,他们不认为这种政府的准入流程应该成为一个长期的默认的机制。然后 Anthropic 这边的话,他们的 Fable 五和 Mythos 五就由于出口管制的指令直接下架了,那虽然说 Fable 五后来又恢复了,但是 Mythos 五目前还是只对美国的部分机构开放。就是这两家公司都在很短的时间内都遇到了这种,模型做好了但是不能随意的向全球发布,这很有可能就是未来的一个常态。OK,那今天我们从这个 GPT-5.6 的发布,聊到了智能体的新玩法,然后聊到了这个产品的整合,最后又聊到了这个行业监管带来的一些变化。实则可以看出来,就是 AI 正在越来越深入到我们的日常工作当中,成为我们真正的助手。好的,那这期播客就到这里啦,然后感谢大家的收听,我们下期再见,拜拜拜拜。”,”tts_meta_addr”:”https://tosv.byted.org/obj/tos-tingtoutiao/ai_podcast_meta/7660832665746096675_0.json”,”voice_type”:”sami_ai_podcast”}}]

© 版权声明

相关文章

1 条评论

none
暂无评论...