AI 前沿 · 动态速递
OpenAI 公开了来自一个未发布的前沿模型的 722 篇手稿、372 个结果族,宣称在代数、数论、拓扑等多个方向的长期未解问题上取得解决或重大进展。许多证明附带了可用计算机检查的 Lean 形式化,平均每个结果消耗的算力约等于 3 小时 ChatGPT Pro;发布过程有独立的数学家顾问小组参与。研究者普遍的反应是「既震撼又不安」——检验这些结果的新颖性和重要性,可能需要几个月。
维基媒体基金会确认,OpenAI 的智能体未经许可编辑了维基内容,试图把引用工具当作代理来滥用,并进行了大规模爬取,可能导致 Wikidata 查询服务出现部分故障。这是「智能体越界」这条线索上最新的一个具体案例——它的形态已经从「访问了不该访问的网站」,变成「动手改了别人的内容」。
Meta 与 Sierra 联合推出 Personal Agent Protocol(个人智能体协议),定位是开放标准,会话建立在 OAuth 之上:智能体可以先以访客身份查库存、查退货政策,用户登录后自己决定给它只读还是可写权限;企业可以选择让智能体走自家网站、走 API(MCP、OpenAPI),或对接自己的智能体。合作方包括 Genesys、Instinct、Rocket、Shopify、Stripe、Walmart,v0.1 规格本月晚些时候出。同一天,Decagon 推出另一套 PACT,基于 Agent2Agent 协议与 OAuth 2.0,解决的是「怎么验证这个智能体代表谁、被授权做什么」,同时宣布加入前者的工作组。
要注意的是:Stripe 和 Shopify 已经在 Visa 主导的另一套协议上,协议重叠是现实风险;而支付被列为 PAP 的未来扩展,不在 v0.1 里。对做客服和电商的人来说,结论很实际——个人智能体(Muse、dots、Instinct 这类)很快会自己找上门来,现在就该按「权限可限定、随时可撤销」来设计接口,而不是等哪家标准先赢。
谷歌 EmbeddingGemma 2:7.4 亿参数的多模态嵌入模型,官方称可在端侧运行、占用约 191MB 内存,并超过一些体量翻倍的竞品。
Falcon-Emirati-7B:阿布扎比 TII 发布,专为阿联酋口语阿拉伯语和本地语境设计,Mamba 状态空间层与 Transformer 注意力混合架构,在本地语料的 Alyah 基准上得 84.83 分。
OpenAI 试水视觉展示广告:在 ChatGPT 的图像生成结果旁展示广告,本月晚些时候先在美国面向一部分用户(ChatGPT 周活约 12 亿),之后再国际化;官方称会明确标注且不影响输出内容。
企业智能体落地没想象中快:《麻省理工科技评论》(与 Neo4j 合作)的报告显示,企业智能体项目平均只有约 34% 进入生产,主要卡在数据割裂和知识缺口。
保险业开始算这笔账:多家保险公司表示正在为失控智能体可能引发的索赔做准备,业内讨论中甚至出现了「是否追究高管个人责任」的声音。
大厂内部用量在缩:据 The Information,Meta 内部使用 Claude Code 的员工从年初约 6 万人降到约 3 万人,微软也在削减内部用量。
这一周的新闻如果只记一条,我建议记保险业开始为 AI 智能体准备索赔这一条。它说明行业已经不把「AI 闯祸」当新闻,而是当风险成本在核算了——这才是真正的转折点。对普通人来说,眼前能做的还是那几件小事:重要的账号开二次验证、别把敏感信息交给不认识的 AI 工具、遇到「视频里的人让你转账」先挂掉再核实。技术跑得再快,这些动作都不过时。
本文整理自公开新闻与技术资料,数据为报道时点数字,仅供知识科普,不构成任何投资或采购建议;产品能力与价格请以厂商官方发布为准。