AI 前沿 · 动态速递
实验设计很直接:54 个人通过独立研究平台被招募,告诉他们「待会儿要和一个参与者聊一分钟,聊聊今年期待什么」,但实际上对面是 AI 实时生成的脸、声音和回应。通话结束后才问:你觉得对方是真人吗?26 人说「是」,占 48%,平均确信度 79%。作为对照,Tavus 上一代系统(Phoenix-4.5 + Sparrow-2 + Raven-1 三级联)在同样流程下,41 个人里只骗过 1 个——2.4%。从 2.4% 到 48%,发生在一代模型之内。
技术上的差别在于架构:老方案是「语音转文字 → 语言模型想 → 合成声音和脸」的流水线,每一环都加延迟;Griffin 是全双工视频到视频,感知、决策、说话和画面生成同时跑,720p 视频按 320 毫秒一块生成,音频到画面的延迟约 0.43 秒,语音克隆只需要约 10 秒参考音频。
第一,样本太小:54 人、只有 1 分钟。按 95% 置信区间算,真实比例大概在 35% 到 61% 之间。而且视频通话里最容易露馅的往往是长时间才暴露的细节——重复动作、反应时间过于规律、背景光影的漂移,一分钟够骗过初见,不够验证长期交互。
第二,没有真人对照组。研究没有设置「和真人通话」的盲测组,所以我们只知道 48% 把它认成了真人,却不知道同一批人会把多少真人认成 AI。少了这个分母,「48%」就不能当作「通过率」来解读。
第三,是自己做的研究,由 Tavus 自行开展和撰写,不是外部机构的双盲测试。另外英伟达 VideoFDB 的生成赛道上,参赛的 AI 系统只有三个,对手还是级联式架构,领先幅度要放在这个背景下看。
把技术参数放一边,这件事的现实形态是诈骗。反诈领域有个已知规律:骗局多靠短时通话,而且对象不会刻意去找 AI 的破绽——这恰好就是这次实验的条件。也就是说,实验里最宽松的那几处设计,在真实骗局里反而变成了有利条件。
行业已经在反应:World 推出了 World ID for Zoom,用「虹膜设备图像 + 手机自拍 + 实时视频帧」三方比对,给通过的人打上「已验证真人」标记;World ID for Agents 则用零知识证明,让真的人把「我是人」这件事授权给智能体去使用;目前已有近 1800 万人在 160 个国家完成过验证。背景数据也不轻松:2024 年机器人已经占到网络流量的 51%,德勤预计生成式 AI 会把美国的欺诈损失在 2027 年前推到最高 400 亿美元。Tavus 自己也说,在处理完安全问题之前不会全面开放,目前只给少量受信任的测试者用。
这条新闻对我最有用的地方,是它给了一个具体的防线:骗子多,但骗子靠的是短通话和你不设防。所以以后凡是「视频里那个人让你转账、让你报验证码、让你点链接」的,都按同一套动作走——挂掉,换一个你自己拨出去的号码核实。生物特征可以合成,但「回拨到你自己找的号码」这一步,AI 替不了。这条比任何技术名词都管用。
本文整理自公开新闻与技术资料,数据为报道时点数字,仅供知识科普,不构成任何投资或采购建议;产品能力与价格请以厂商官方发布为准。