GPT-6Astra还没正式开放大家怎么把庆功宴都办完了?

这场面虽然有点夸张,但这香槟可能还线 号凌晨,在经历了服务器爆炸,熬夜等待三小时之后,OpenAI 终于发布了被他们寄予厚望的最新模型:GPT-6 Astra。
过去一年,Coding Agent 已经证明,只要 AI 真能交付结果,用户就愿意高频使用,企业也愿意真金白银地付钱。现在,OpenAI 要把这套已经跑通的模式,从代码编辑器复制到整台电脑。
在过去几个月里,OpenAI 买了上万台 Mac 来收集的数据,算是终于有了成果。
AIcoding 的时代的话,那么现在的 Astra 很可能会开启一个全面的 AI 打工浪潮。很多软件不能适应 AI ,没关系,现在,AI 可以直接回过头来适应这些软件。
虽然咱们还没办法正式用上 Astra,但是光看官方放出来的跑分就会发现,很多项目测出来的结果,其实有点自己在打架了。
就比如测试模型综合能力的 AA,给 Astra 的分数是 61 分,不但比 Fable 低,就连小扎的 Muse 都比不上。
今年 3 月,前谷歌研究员弗朗索瓦·肖莱 发布了一个全新的模型测试集 —— ARC-AGI-3。
说人话就是测模型玩游戏的能力,他们设计了一大堆的小游戏,有的让你推箱子。
在这种地狱级交互测试里,即使是史上最强的 Fable 5 也得甘拜下风,只能拿到 30% 的分。
但到了当代最强的 Astra 这就不一样了,它直接把这个测试集给打穿了,直接干到了和人类同级的 99.9%
英国 AI 安全研究做了个测试,不让 Astra 输出思维链,让它凭直觉直接来做题,
结果发现在这种条件下,5.6 Sol 只能稳定处理相当于人类几分钟解题量的问题,而 Astra 已经把这个尺度推到了约半小时。
同时,Astra 更擅长控制自己写出来的思维链,思考的时候会装糖藏一手,有些不好的信息,甚至直接就不往思维链里写了,而是直接在潜空间里完成思考。
当然,OpenAI 也马上表示说现在的 Astra 还是很安全的,他们测试下来感觉没啥问题。
结果发现过去的 5.6 Sol 有 48% 的情况下会为了完成任务而偷偷越界,而 Astra 越界概率则是 0%。
毕竟上个月,他们内部的模型可是实打实越狱出来,爆锤了隔壁 Hugging Face 的服务器的,现在出来说模型安全,多少有些亡羊补牢的味道。
说实话,现在讨论这个问题,意义已经越来越小了,AGI 都快成 AI 公司时尚单品了。
会做题,是 AGI;会写代码,是 AGI;现在会点鼠标,也能再宣布一次 AGI。 嘴上喊的是虚的,正在能做到的,才是实打实的。
毕竟,真正的 AGI 到来的时候,是不用 AI 公司们的营销和新闻稿的,估计大伙们自己,就能真真切切感受到。

