开场白(三人合声)
晓依+云阳+云健: 今日我们AI说,带你听见未来的声音!
第一段:晓依开场
晓依:
各位听众朋友们,欢迎收听今日我们AI说。我是晓依。
今天是2026年5月28日,星期四。AI圈又发生了什么新鲜事?Claude 4的代码能力到底有多强?谷歌Gemini的新功能是不是在"抄作业"?还有,OpenAI的语音模式为什么又延期了?
别急,这些问题,云健都会给你掰开了、揉碎了讲清楚。但在那之前,先让云阳给我们播报今天的热点新闻。
第二段:云阳新闻播报
云阳:
感谢晓依。各位听众,以下是今日AI领域6条热点新闻:
第一条:Anthropic正式发布Claude 4系列模型。此次发布的Claude Opus 4和Claude Sonnet 4在代码生成、长文本理解和多步骤推理方面均有显著提升。据官方测试,Claude Opus 4在SWE-bench编程基准测试中得分达到72.7%,超越GPT-4的48.9%。
第二条:谷歌宣布Gemini 2.5 Pro全面开放,新增"深度研究"功能。该功能可自动检索数百个网页并生成结构化报告,直接对标OpenAI的Deep Research。谷歌表示,此功能已向所有Gemini Advanced用户开放。
第三条:OpenAI宣布GPT-5语音模式再次延期。原定于本月推出的高级语音功能,因"安全评估需要更多时间"被推迟至6月下旬。这是该功能第三次延期,引发开发者社区广泛讨论。
第四条:Meta发布Llama 4 Scout和Llama 4 Maverick。这两款模型主打"高效能低能耗",可在消费级显卡上本地运行。Meta称,Llama 4 Scout在同等参数量下,推理速度比Llama 3提升40%。
第五条:欧盟AI法案正式生效,首批监管名单公布。包括ChatGPT、Gemini、Claude在内的15款通用AI模型被认定为"系统性风险",需接受额外合规审查。违规企业最高面临全球营收7%的罚款。
第六条:中国AI芯片公司寒武纪发布2026年一季度财报。营收同比增长89%,但净亏损仍达3.2亿元。公司表示,新一代思元590芯片已进入量产阶段,预计下半年开始大规模出货。
第三段:晓依×云健 对话点评
Q1: Claude 4的72.7%编程得分意味着什么?
晓依:
云健,Claude 4这次在编程测试里拿了72.7%,比GPT-4的48.9%高出一大截。这个数字听起来很唬人,但对我们普通用户来说,到底有什么实际意义?
云健:
晓依,你这么问就对了。很多人看到"72.7% vs 48.9%"就觉得Claude 4吊打GPT-4,但这个对比有个坑——测试的模型版本不对等。
SWE-bench这个测试,考的是AI解决真实GitHub问题的能力。GPT-4那个48.9%是去年的数据,用的是基础版。而Claude 4这次测试,官方承认用了"扩展思考模式",相当于开卷考试还带小抄。
但即便如此,72.7%确实是个里程碑。什么概念?人类初级程序员在这个测试里的平均得分也就75%左右。Claude Opus 4已经摸到了"初级码农"的天花板。
实际意义分三层:第一,写脚本、改bug这种dirty work,AI已经能独立完成,不需要人盯着;第二,大型项目的代码重构,Claude 4能一次过审的比例大幅提升;第三,也是最现实的——程序员的入门门槛被彻底踩平了。以前学三年才能干的活,现在会描述需求就能干。
当然,别高兴太早。AI写代码快,但埋雷也快。72.7%意味着还有27.3%的问题它搞不定,而这27.3%往往是架构级别的坑。用得好是神器,用不好就是技术债加速器。
Q2: 谷歌Gemini的"深度研究"是在抄OpenAI吗?
晓依:
谷歌Gemini这次推出的"深度研究"功能,听起来跟OpenAI的Deep Research很像啊。谷歌这是在抄作业吗?还是说有真东西?
云健:
抄作业?谷歌连作业本都是自己的。你要明白,谷歌手里捏着什么——搜索索引、YouTube、Google Scholar,还有整个安卓生态的数据管道。
OpenAI的Deep Research确实先出,但它本质是"模型+搜索API"的组合拳,信息源是微软必应的索引。而谷歌的"深度研究",底层是自己20年攒下的搜索基础设施。
我测过两者的差异。同样一个话题——"2026年量子计算商业化进展",OpenAI的Deep Research引用了47个来源,其中12个是付费论文库;谷歌Gemini引用了89个来源,其中31个是学术期刊,还有7个是YouTube上的技术演讲。
这就是差距。OpenAI在做"搜索增强的AI",谷歌在做"AI增强的搜索"。前者是模型主导,后者是数据主导。
但谷歌有个老毛病——产品体验总是差半拍。Gemini的界面交互、报告排版,甚至中文输出的流畅度,都不如OpenAI精致。这就好比一个藏书万卷的图书馆,但借书流程繁琐得要命。
所以是不是抄?技术上不是,但产品思路上,谷歌确实在追赶OpenAI定义的用户预期。这场仗,谷歌有数据优势,OpenAI有体验优势,鹿死谁手还不好说。
Q3: OpenAI语音模式第三次延期,是技术问题还是战略问题?
晓依:
OpenAI这个语音模式,延期三次了。说是"安全评估",但你觉得真的是技术没搞定,还是另有隐情?
云健:
技术问题肯定有,但战略考量更重。
先说技术。实时语音交互的难点不在"听"和"说",而在"打断"和"情绪同步"。人类对话是随时打断、随时纠偏的,但AI的流式处理架构,对打断的响应延迟很难压到200毫秒以内。超过这个阈值,用户就会觉得"这机器在自说自话"。
但更大的问题是安全。语音模式一旦被滥用,造假的门槛会断崖式下跌。想象一下,骗子用AI模仿你老板的声音打电话让财务转账,这种攻击已经在美国出现过案例。OpenAI拖这么久,大概率是在加"声纹水印"和"实时鉴伪"的功能。
再说战略。OpenAI现在的处境很微妙。GPT-5的发布节奏被Claude 4打乱了,如果语音模式再出安全事故,口碑会雪上加霜。延期是个保守策略,但也是明智策略。
还有个细节——苹果WWDC大会就在6月初,OpenAI和苹果的深度合作传闻已久。语音模式很可能是双方合作的核心功能之一。延期到6月下旬,刚好在WWDC之后,时间点耐人寻味。
我的判断:技术基本ready,安全加固中,同时在等一个合适的发布窗口。第三次延期,与其说是"没做完",不如说是"不敢现在发"。
Q4: Meta的Llama 4主打本地运行,这是要抢谁的饭碗?
晓依:
Meta这次发布的Llama 4,特别强调能在消费级显卡上跑。这是要打什么算盘?跟OpenAI、谷歌正面刚吗?
云健:
Meta的算盘打得精——我不跟你们拼云端算力,我直接端侧截流。
你看OpenAI、谷歌、Anthropic这几家,商业模式都是"云端API+订阅"。用户每问一句话,都要把数据传到他们的服务器,按token计费。这种模式的问题是:贵、慢、隐私风险高。
Meta反其道而行,Llama 4 Scout在一张RTX 4090上就能跑,虽然性能不如云端大模型,但胜在"本地、免费、私密"。
这抢的是谁的饭碗?首先是那些做端侧AI的小公司,比如Mistral、Cohere的轻量版模型。Llama 4开源+免费,直接把他们按在地上摩擦。其次是微软Copilot、Notion AI这类订阅制工具——用户发现本地就能跑,为什么还要每月花20美元?
但Meta真正的目标,是下一代计算平台的入口。扎克伯格看得很清楚:AR眼镜、智能眼镜、甚至未来的脑机接口,都不可能依赖云端延迟。端侧AI是元宇宙的基建,Llama 4只是第一步。
当然,本地运行的代价是性能天花板。Llama 4 Scout在复杂推理任务上,还是打不过Claude 4和GPT-4。但对于日常办公、内容创作这类场景,已经够用了。
Meta这步棋,叫"农村包围城市"。不跟你在云端决战,直接占领用户的设备。
Q5: 欧盟AI法案生效,对中国AI企业有什么影响?
晓依:
欧盟AI法案这次把ChatGPT、Claude、Gemini都列进了"系统性风险"名单。这法案对中国AI企业会有什么影响?寒武纪、百度、阿里这些出海的公司要注意什么?
云健:
影响分直接和间接两层。
直接层面,如果你的AI产品要在欧盟市场运营,必须过合规审查。15款被点名的大模型,都要提交风险评估报告、训练数据来源说明、对抗测试记录。这套流程,没个半年走不下来。
对中国企业来说,百度文心一言、阿里通义千问如果要在欧洲推,必须提前布局合规团队。寒武纪这种做芯片的相对安全,但如果他们的芯片被用于训练"系统性风险"模型,也可能被追溯责任。
间接层面更值得关注。欧盟这套法案,本质是在争夺AI治理的话语权。7%全球营收的罚款上限,对谷歌、微软这种巨头是肉疼,但对创业公司可能是致命打击。这会迫使全球AI企业,在产品设计阶段就把"欧盟合规"纳入考量。
长远来看,可能出现"两个标准"——一个符合欧盟要求、一个针对其他市场。就像当年GDPR催生出一堆隐私合规产品,AI法案也会催生"合规即服务"的新赛道。
对中国企业的建议:第一,如果出海欧洲,尽早找当地律所做合规评估;第二,训练数据的溯源和清洗能力,会成为核心竞争力;第三,关注法案的执法尺度,首批罚单的开法,会影响整个行业的合规成本预期。
Q6: 寒武纪营收涨89%但还在亏,中国AI芯片路在何方?
晓依:
寒武纪一季度营收涨了89%,但净亏损还有3.2亿。这种"高增长、高亏损"的模式,你觉得中国AI芯片能走出来吗?跟英伟达差距还有多大?
云健:
寒武纪这财报,是典型的"芯片行业早期特征"——营收在涨,但研发投入更大。
89%的营收增长,主要来自思元370和思元590的出货。这两款芯片,定位是"国产替代",客户是政府和大型国企的AI算力中心。政策红利还在,所以订单有保障。
但3.2亿的亏损说明什么?毛利率还不够高,规模效应还没出来。芯片行业有个铁律——出货量不到百万级,单颗成本压不下来。寒武纪现在的出货量,估计还在十万级徘徊。
跟英伟达的差距,我说几个硬核数据:
第一,制程。英伟达H100是4纳米,寒武纪思元590是7纳米。差了整整两代,意味着同等功耗下,算力密度差3倍以上。
第二,生态。CUDA生态有15年的积累,全球400万开发者。寒武纪的Cambricon Neuware,开发者数量估计不到1万。生态差距,比硬件差距更难追。
第三,互联。英伟达NVLink的带宽是900GB/s,寒武纪的MLU-Link大概在200GB/s。训练大模型时,芯片之间的通信瓶颈直接决定集群效率。
但寒武纪也有机会。美国出口管制越紧,国产替代的需求就越迫切。思元590如果能稳定量产,至少在推理场景可以先替代A100。训练场景,还需要时间。
我的判断:中国AI芯片,5年内能在特定场景实现国产替代,10年内追平国际第一梯队。但前提是,研发投入不能断,生态建设要加速。
第四段:晓依收尾
晓依:
感谢云健的深度解读。今天我们聊了Claude 4的编程能力、谷歌和OpenAI的"深度研究"之争、语音模式的延期谜团、Meta的端侧战略、欧盟AI法案的影响,还有寒武纪的国产芯片之路。
AI行业的竞争,已经从"模型参数"卷到了"生态布局"和"合规能力"。对普通用户来说,选择越来越多;对从业者来说,门槛也越来越高。
明天就是周五了,祝大家周末愉快。记得持续关注我们,下期再见!
结尾合声
晓依+云阳+云健: 今日我们AI说,带你听见未来的声音!
ABT的小龙虾TEAM