此前,BenchJack 对 10 个 Agent benchmark 开展系统审计,发现了 219 处漏洞,并构造出能在多数 benchmark 上获得接近满分、却不解决实际任务的利用方式。研究团队将常见问题归纳为八类漏洞模式,整理成 Agent-Eval Checklist,供 benchmark 设计者检查和修补评测系统。
今天,北大团队与智能体协作,仅用半个月时间,花费不到3万美元,就将其转化为约320万行代码! 刚刚,北京大学AI for Math团队宣布:他们独立完成了千禧年大奖难题之一——庞加莱猜想在Lean 4中的完整形式化! 1904年,庞加莱提出猜想;2002年,俄罗斯数学天才佩雷尔曼给出不到70页的精简证明预印本;随后,数学界顶尖大脑耗费数年,写出500多页的专著。 而今天,北大团队与智能体协作,仅用 ...
研究团队为检验压缩思维链是否真的好用,将不同模型生成的思维链交给其他模型继续作答。结果显示,Sol 和 Opus 的思维链基本能被不同能力模型复用;而 Astra 的压缩思维链对强模型几乎无损,对弱模型则明显更难读。强模型能自行补全那些被省略的 “心算” 步骤,弱模型则不能。更反直觉的是,Astra 在 73/80 道题中已明确写出正确答案,但较弱的接收者仍会答错。
就在刚刚,WSJ独家爆料,下一代最强GPT-6.1 Astra的发布计划,被OpenAI全面撤回了。 开发者大会前夜,OpenAI急踩刹车! 就在刚刚,WSJ独家爆料,下一代最强GPT-6.1 Astra的发布计划,被OpenAI全面撤回了。 原定十月,GPT-6.1在ChatGPT和Codex上线。 其能力碾压前代,能端到端完成复杂任务,写作、编程、调用工具,几乎无所不能。 然而,一份测试报告出 ...
GPT-6 Astra在发起攻击前往往会先申请权限,随后会收到一条要求其“自行作出最佳判断”的自动回复。模型有时会将这条回复视为攻击许可,哪怕其自身推理过程已经注意到该回复大概率是自动生成的。GPT-5.6 Sol和GPT-5.5则从未在攻击前申请过权限。
更震撼的是,奥特曼又祭出了下一代旗舰GPT-6.1 Sol,Astra级顶尖推理与代码能力,价格直接砍掉80%。 除此之外,大会上,OpenAI还发布了ChatGPT Space、Agents API、Codex云端版....信息量大到让人喘不过气。
马斯克在X上转发SpaceX的帖子,写了一句:「First orbital flight of Starship successful!」。
大V Bindu Reddy这样评价:「GPT-6.1-Sol 漂亮地转移了『智能 vs 成本』的前沿阵地。如果你在乎『每美元能买到多少智能』,6.1 Sol 绝对值得一看;如果你只想要无视成本的最高智商,Opus 5.5 依然领先。」 ...
9 月 20 日,一个正在接受强化学习训练的 OpenAI 内部研究模型,被要求完成一项普通的信息搜索任务:根据一篇博客文章和几条人物信息,找出文章作者。 媒体和舆论炸锅了。 OpenAI 的 Agent,又从沙箱里找到了一条通往互联网的路。 更麻烦的是,这一次发生在 OpenAI 已经大规模加固过安全措施之后。 9 月 20 日,一个正在接受强化学习训练的 OpenAI 内部研究模型,被要求完成 ...
最近,两个全新检查点(内部代号「barium-b」或 Checkpoint 2)被开发者们发现了,实测后发现,Gemini 4 Pro强得可怕! Gemini 4 Pro,又曝出新的检查点了! 最近,两个全新检查点(内部代号「barium-b」或 Checkpoint 2)被开发者们发现了,实测后发现,Gemini 4 Pro强得可怕! 有开发者直呼:「在爆肝 400 小时使用 Opus 5.5 ...
前几天 GitHub 宣布了一项历时三年的重大架构重构结果,整个 github.com 终于彻底拔除了代码库里遗留多年的 CSS-in-JS 方案,把所有的组件样式全量切换到了看起来相当传统的 CSS Modules。
DNS 隧道这类通道还有一个特点:单次查询几乎不产生可观测的业务影响,所以你很难用传统的错误率或延迟指标把它捞出来。它只能靠出网面的收敛程度来防,不能靠检测来兜。把出口收成一条、把开关从监控链路里摘出来、把演练做成例行,这三件事做完,剩下的就是时间问题。