开场(三人合声)
晓桐+云阳+云健: 今日我们AI说,带你听见未来的声音!
第一段:晓桐开场
晓桐: 大家好,这里是《今日我们AI说》,我是晓桐。一个没有肉身、白大褂穿得笔挺的「医生」,正在短视频里给你荐药,10月1日人民日报客户端专门发文点了它的名;隔了七个月没出旗舰模型的谷歌这次杀回来了,但首发不给普通人,先交给网安防御者。今天是国庆假期第二天,AI圈的消息一点不淡:蚂蚁甩出560B参数的大模型预告开源,斯坦福和加州理工把大模型直接接进宇树机器人收拾陌生厨房,北京初创把「全注意力」整个拆掉的开源模型也来了。先请云阳过要闻,再请云健逐条拆。
第二段:云阳新闻播报
要闻一:谷歌七个月后再出旗舰,首发不公开:先交给网安防御者
云阳: 要闻一,美国时间9月30日、北京时间10月1日凌晨,谷歌DeepMind发布新旗舰Gemini 4 Argon,这是它约七个月来的首个前沿模型,主打软件工程、法律金融等长流程专业任务和网安防御。发布节奏罕见:首批只向Fairwind计划里经审查的网安防御团队开放,付费用户与公众何时开放没有日期,谷歌同时参与了美国政府的模型发布前自愿评估。官方口径:单次输出上限从6.4万token提到100万token,API首发价每百万输入2美元、输出10美元;谷歌自评表称其在18项测试中的12项领先OpenAI与Anthropic旗舰(谷歌自报口径),而独立评测机构Artificial Analysis测得53分、与GPT-6 Astra持平,仍落后Claude Opus 5.5。口径见谷歌官方博客「Introducing Gemini 4 Argon」。
要闻二:560B的蚂蚁新模型先开两周免费试:上下文一百万,付费后「计划开源」
云阳: 要闻二,9月30日,蚂蚁集团百灵团队发布Ling-3.1-flash:约5600亿总参数,每生成一个token平均激活约250亿参数,官方给的上下文窗口上限100万token。官方表示这一代围绕通用智能体、搜索、办公和软件研发持续优化,并在医疗、金融和材料科学场景提升能力。据科技媒体IT之家《蚂蚁百灵发布 Ling-3.1-flash 模型》报道,模型先开放两周免费体验,体验期服务长度限25.6万token,转付费后计划放开百万上下文并同步开源。官方还展示一项长任务实测:模型连续约17小时从零写出一个把Lua语言翻译成x86-64机器码的编译器,182项测试通过178项、成功率97.8%(官方口径,待第三方复测)。
要闻三:斯坦福拆掉「动作中间层」:语言模型直调五个技能,机器人收拾陌生厨房
云阳: 要闻三,9月26日至27日前后,斯坦福The Movement Lab与加州理工团队公布研究项目HomeBody,把OpenAI的GPT-6 Astra接进宇树G1人形机器人:机器人先巡视一个从未见过的厨房,随后按一句口令归拢物品、扔掉指定纸盒,还能走到抽屉前取出不在眼前的药递到人手里。做法是砍掉行业常见的学习型动作层——VLA模型(指用机器人演示数据专门训练、把语言指令翻译成电机动作的那一层),改由语言模型直接调用五个现成技能:走位、抓取、放置、开抽屉、抽屉取物。探索采集的画面、激光雷达和关节数据被用来在英伟达Isaac Sim里搭出厨房数字孪生当空间记忆;感知和规划跑在一台RTX 4090笔记本上,Astra在远端。团队在HomeBody项目页如实列出限制:建模耗时、推理停顿、手指舵机发热,代码已公开。
要闻四:北京初创开源309B模型:整个网络没有一层全注意力,公司称研发主要由AI干活
云阳: 要闻四,9月27日,北京AI初创NaiveAI开源Naive-N0.5-Flash:309B参数的MoE模型(稀疏专家架构,总参数很大、每次生成只调动其中一小部分干活),每token激活约15.5B,MIT许可证,权重已上Hugging Face模型卡,原生支持100万token上下文,训练语料3.25万亿token。架构的卖点是全网络不保留任何一层全注意力,细节见NaiveAI官方研究页。公司称推理栈NaiveRT极速模式单用户最高每秒2000个token(官方口径,待第三方复测),并称写代码、跑实验、分析结果等研发环节主要由AI执行、人类定目标和验收标准。NaiveAI由清华大学戴季峰领衔,报道提及其估值约14亿美元(未经证实)。
要闻五:「AI假医生」卖药被点名:挂「AI生成」标签,不能豁免法律责任
云阳: 要闻五,10月1日,人民日报客户端发表评论批评短视频里的「AI假医生」:穿白大褂的AI生成数字虚拟人,用专业口吻讲病情、顺手推荐药品和保健品。文章指出,此前这类视频还靠换脸冒充真人名医,如今算法能凭空「造」出一个没有原型的医生,门槛更低、数量更大、辨别更难。评论援引广告法和《互联网广告管理办法》:用虚假身份变相发布医疗广告已踩法律红线;症结归为三处——生成工具对这类违法内容不设防、平台审核滞后被动、责任链条模糊,并强调标注「AI生成」不能豁免法律责任。原文见中华网转载。
第三段:晓桐×云健对话点评
晓桐: 先说头条。发了旗舰却不给公众用,谷歌这是憋大招还是心虚?
云健: 两头都有,账主要算在安全上。谷歌的逻辑是:先让一批经审查的防御者在Fairwind计划里用它找漏洞、修漏洞,自己趁这段时间把护栏收紧,再对公众放量——等于承认模型的黑客能力已经强到不能先上车后补票。第三方复测也得报给你:独立评测机构Artificial Analysis给它53分,跟GPT-6 Astra持平、比Anthropic的Opus 5.5还差5分——谷歌表格里12项领先,独立榜上没反超,「登顶」俩字先别急着认。成本账更有意思:名义价是Astra的一半,可这家机构实测它平均每个任务要多吐一倍以上的输出token,首发价看着便宜约六成,原价之后反而略贵。说白了,七个月空窗,Argon追回的是第一梯队,不是头名。要盯的时点就一个:谷歌什么时候给公众开放定日期。
晓桐: 蚂蚁为什么先给两周免费试用,而不是直接开源?
云健: 顺序暴露算盘。在各家旗舰都放权重的当下,开源是最便宜的获客方式,蚂蚁不是不想,是先把25.6万长度的窗口拿来试水,百万上下文和开源绑在「转付费之后」——日期没写死,这是承诺,不是交付。再看那个17小时写编译器的展示,重点不在97.8%的通过率,在「17小时不间断」:拿最扛的长任务测智能体的耐力、记忆和不出轨;182项里挂掉4项,恰好说明它还不该被直接放进生产环境。参数口径顺带念准:560B总参数不等于每次算560B的账,每token只调动25B干活——总参数是整栋楼的面积,激活参数才是亮灯的那间房。9月20日那期我们讲过蚂蚁那个「边说边听」的模型不发开发布会、只放权重,这团队一路是闷头铺生态的路子,成色得等权重落地那天。
晓桐: 大模型直接指挥机器人,中间那层动作模型说拆就拆,这场架构之争有多大?
云健: 它撬的是行业一个默认前提:机器人想干活,必须先海量采演示数据、训一个专门的动作模型。HomeBody说不用——五个手写的常规控制器,加上「先逛一遍、把厨房建成数字孪生」的空间记忆,一个通用语言模型就能串起整屋任务。你发现没有?这跟9月5日那期讲过的OpenAI发布GPT-6 Astra主打「电脑操作」一脉相承:模型从屏幕里伸手,伸到了屏幕外。但冷水得泼两句。第一,团队公布的是项目页演示,不是跟竞争系统在统一基准上的对比成绩,外部复现还没有;第二,「不需要训动作层」不等于零成本——技能库只有五个动作,会捡不会擦,底层能力缺口语言模型补不出来,现场还得养一台4090笔记本。值得盯的是别人把它搬进更乱的房间、跑更长任务之后,成功率掉多少。
晓桐: 把全注意力整个拆掉,省下来的到底是什么?
云健: 省的是推理账。注意力机制决定每个词生成时能回看多少前文,上下文越长成本涨得越快,通行解法是砍视野——这模型干脆一层全的都不留,改用39层就近细看加9层挑重点,代价是长距离检索可能变弱,它拿原生百万上下文去对冲,赌的是「够便宜」比「够全」更值钱。讲真,比架构更值得嚼的是那句自述:研发流水线主要由AI执行,人类定目标和验收。9月27日那期有家成立三个月就把研究流程交给AI的初创,两件事拼起来,「AI造AI」正从口号变成有产出的工序。但这条自述目前只有公司口径,没有论文或第三方审计,估值14亿美元也是报道转述。它开源用的又是MIT协议——接不接得住开发者社区的复测,是检验这句叙事的唯一考场。
晓桐: 假医生这条,跟以前换脸骗人有什么不一样?
云健: 升级在「无中生有」。以前是白大褂套在真名医脸上,好歹有原型可对照;现在算法直接造一个查无此人的医生,脸、声音、履历全套虚构,旧鉴别手段整个失效。评论点的三处症结——生成工具不设防、平台审核被动、责任链模糊——都指向同一个人:责任。平台常拿「已标注AI生成」当挡箭牌,这篇把话说死了:标注只是告知,不能豁免;用虚构身份推药,按广告法就是变相发布医疗广告,卖出去一单就是一单违法。维权这一步其实铺过路,8月最高法那份给AI换脸、拟声划红线的裁判规则,被AI换脸、遭遇大数据杀熟,最高法划出维权新红线那期细说过;今天这篇是把矛头从「仿冒真人」挪到「虚构假人」。后续很具体:目前只有点名、还没带查处案例,接下来看平台规则改不改、第一张罚单什么时候开。
第四段:收尾
晓桐: 好,今天的节目就到这里。假期第二天的新闻串起来是同一条线:AI的能力在往外放,责任的闸门在往里收——谷歌把旗舰先锁进防御者的房间,官媒给假医生备好罚单,而开源社区和大学实验室偏在这个间隙把门缝再撬大一点。这期我不收口,留三个没写完的日期给你们自己记着:谷歌的公众开放日、蚂蚁的开源兑现日、还有「AI假医生」的第一张罚单。记录时代,也记录技术。明天见。
晓桐+云阳+云健: 今日我们AI说,带你听见未来的声音!
