开场(三人合声)
晓依+云阳+云健: 今日我们AI说,带你听见未来的声音!
第一段:晓依开场
晓依: 大家好,这里是《今日我们AI说》,我是晓依。过去一周,这个行业最响的声音来自几张谈判桌:要不要给AI装上统一的安全带、谁来写这份规则。而这两天,舞台下面在发生另一件事——北京,七名博士生用一个暑假从零训出一个大模型,把代码、数据配方甚至训练日志全部公开;匹兹堡,卡内基梅隆大学的团队证明机器人可以先「想几何」再动手;上海,一家算力初创把机器人端侧推理引擎开源;清华系的小团队,在表格数据榜单上把谷歌、亚马逊都超了过去;B站的UP主们干脆自己搭了个擂台,让上百个大模型同场比划。定规则的还是那几家巨头,但干活、出题、当裁判的人,正在变多。先请云阳过一遍要闻,再请云健逐条拆解。
第二段:云阳新闻播报
要闻一:七名博士生一个暑假从零训出7B大模型,把日志都摊在桌上
云阳: 要闻一,据AI垂直媒体量子位9月15日报道,北京中关村学院与中关村人工智能研究院的七名博士生,用一个暑假从零训练出7B参数大模型ZGCM-1,并把模型权重、各阶段数据配方、中间检查点、训练代码乃至完整训练日志全部开放——「从零训练」指不基于任何现成大模型续训,从随机初始化开始喂数据。团队的技术报告显示:这颗73.9亿参数的模型在AIME 2026数学测评拿到75.0分;靠交错滑窗注意力把KV缓存——也就是模型记住长上下文时最吃显存的临时存储——压到约六分之一,团队称预训练总耗时缩短约4.2倍(官方口径,待第三方复测)。更特别的是研发方式:七个人调度几百个AI智能体分工做数据清洗、跑实验、做评测,事后还按自主性等级给AI助手逐项打分——监控部署评到较高档,架构设计仍主要靠人。这条「AI参与造AI」的路线,9月15日那期智谱押注「AI教AI」的235亿港元募资讲的是一线大厂版本,这次是学生军版本。
要闻二:CMU给机器人换个「想问题」的顺序:先预测几何与运动,再动手
云阳: 要闻二,9月15日,卡内基梅隆大学研究团队在arXiv发布论文ModAR,提出一种新的世界动作模型。这个概念先说清楚:世界动作模型,是让机器人先在「脑内」预演动作会让世界变成什么样、再决定怎么动的模型,主流做法是预演未来的画面帧。ModAR反着来——依次预测三类比画面更抽象的东西:深度图,即每个物体离镜头多远;点轨迹,即画面里某个点接下来怎么移动;语义特征,即捕捉「这是什么」的向量——三类预测完,最后才生成机械臂动作。作者报告在叠杯子、折毛巾、放入抽屉三项真机双臂任务上平均成功率75%、基线为72%,训练算力只有基线的约二十分之一;论文同时发现,加上预测RGB画面并不总让机器人做得更好。需说明:这是作者自测、样本很小的研究,尚未经第三方复现。
要闻三:B站搭起「AI无限竞技场」,一百个大模型让UP主出卷当裁判
云阳: 要闻三,9月16日,哔哩哔哩「AI无限竞技场」正式上线,首期大模型测评榜单同步公布。玩法和传统跑分不同:不设统一考卷,由上百位各分区UP主用真实科研工作流、专业应用甚至趣味脑洞自主命题,让GPT-6、GLM、DeepSeek、Kimi、豆包等主流模型同题对战,成绩实时更新。首期榜单显示,OpenAI的GPT-6 Astra在十位UP主测评中拿下榜首次数最多,前五名里国产大模型占三席。按B站官方口径,站内AI知识内容消费时长同比增长72%,月均观看AI内容的用户超1.9亿——这是它敢把「谁来评模型」的麦克风递给社区的原因。本月B站刚用同类思路办过创造赛,一万三千四百个不会写代码的人在B站「聊」出四款产品说的就是那件事——从「共建产品」到「共评模型」,同一套社区逻辑正往评测环节延伸。
要闻四:机器人「最后一公里」卡在不是不聪明、是跑不动,中国团队开源端侧推理引擎
云阳: 要闻四,9月15日,AI算力初创公司无问芯穹联合清华大学、上海交通大学正式开源具身智能端侧推理引擎APXInf(开源仓库已上线),支持RTX 4090、Jetson Orin、Jetson Thor等主流计算平台。它解决一个具体的麻烦:大模型在云端演示得很好,装进机器人身体里却跑不动——机器人要持续感知、连续决策,几百毫秒延迟在聊天机器人那里只是体验差别,在机械臂上就是任务失败。官方测试数据显示,把具身模型Pi 0.5——美国Physical Intelligence团队「看画面、听懂话、直接输出动作」的机器人模型——以FP8精度部署在Jetson Thor上,端到端推理延迟从278毫秒压到26毫秒以内、频率达38.46赫兹(官方口径,待第三方复测)。引擎用Rust写了极简底层运行时、对外保留Python接口,瞄准的是从样机演示走向批量部署的成本账。此前9月14日那期讲过人形机器人开始「像车一样造」——产线解决了「造得多」,这一条补的是「跑得动」。
要闻五:4亿参数的「表格模型」登顶三张国际榜单,谷歌亚马逊都被超了
云阳: 要闻五,9月16日,据AI垂直媒体量子位报道,初创公司稳准智能联合清华大学计算机系崔鹏教授团队发布新一代数据大模型LimiX-2,参数规模提升到4亿。所谓结构化数据,就是企业系统里的表格——生产参数、销售记录、设备读数;「表格基础模型」是新赛道:不再一个任务训一个专用模型,而是一个模型跨表格直接做分类、回归、缺失值填补。据团队公布,LimiX-2在TabArena、BCCO、TALENT三个国际主流表格基准的总Elo分分别为1935、1432、1506,均居第一,超过谷歌、SAP、亚马逊的同类模型(官方口径,榜单成绩待独立复测核实)。技术路线上,它把建模重点从「预测指定结果」转向「发现变量间如何相互关联」,团队称由此在多个公开因果发现数据集上显著领先传统方法。上一代LimiX已宣称完成八百余个企业场景验证,方向是工艺参数优化、设备故障预测、电力与能耗预测。
第三段:晓依×云健对话点评
晓依: 云健,今天这五条放在一起特别有意思——学生、大学、初创、UP主,主体全换了。先说最震撼的那条:七个人加几百个AI助手,一个暑假训出7B模型,这事到底新在哪?
云健: 新在两笔账。第一笔是透明度账:大厂技术报告里一句「我们进行了数据清洗」,背后是多少次失败,外面永远不知道;这七个人把中间检查点和日志整个摊开,等于把厨房搬到了大厅。第二笔是人力账:他们给几百个AI智能体分岗位——做数据、跑实验、做评测,事后还打分复盘,AI到底能自主干到哪一档。你发现没有?打分结果很诚实:监控实验、部署这类「照着做」的活到了高自主档,架构设计这种「定方向」的活还是人在主导。这才是「AI造AI」现在的真实水位——它没有取代研究员,它把七个博士生变成了一支几百人的团队。警惕的地方也在这:AIME 75分、4.2倍提速都是自选基准上的自报成绩,小模型在通识科目上仍明显弱于更大模型。所以这条别当「小模型屠榜」看,当「可复现的完整配方」看,价值大得多。
晓依: 再看CMU那条。机器人预测未来,大家一向是让它「脑补画面」,为什么先想深度和运动反而更省算力?
云健: 因为「画得像」和「干得对」是两回事。生成一段逼真的未来视频,模型要花大量算力去操心光影、纹理、背景里无关的花纹——这些对机械臂抓杯子毫无用处。深度、点轨迹、语义特征,恰好是操作任务真正依赖的三样:离多远、往哪动、是什么。说白了,这篇论文是在给世界模型这条路线做一次减法实验:把不喂给动作的预测全部砍掉。它最值钱的结论其实是一个反常识——加回RGB画面预测并不总有帮助。当然,三项桌面任务、作者自评、样本极小,现在下「路线分出胜负」的结论太早;继高德「10分钟长出3D城市」的世界模型把热度带起来之后,什么样的「未来预演」对机器人有用,学界正在拆开了验证。
晓依: B站竞技场这条我想问一个立场问题:让出卷和打分都变成UP主,这个榜可信吗?
云健: 先泼冷水:UP主命题,题目不统一,各家调教的提示词不同,这榜天然没法做严格对照,它更像「真实用户体验的众包采样」,不是标准考试。但它的补充价值恰恰在这:跑分榜已经刷成军备竞赛了,同一个模型换个脚手架分数能差出一截,行业缺的就是「离开题库、进入工作流」的第三只眼。B站敢做这事有底气:官方口径的1.9亿月均AI内容观众说明测评本身就是流量生意,观众爱看「自己行业的人怎么用」,这比又一张总分榜有生命力。要盯两个隐患:商业赞助会不会进擂台——报名持续开放后,出题权和排名算法得经得起查;以及同题PK里国产模型进了前五三席,这个信号够真实用户自己下判断了。
晓依: 端侧推理引擎听着很工程,跟「具身智能能不能成」这大盘子是什么关系?
云健: 关系大了,它就是那段水管工程。26毫秒对278毫秒——这两个数字的差距就是「演示」和「产品」的差距——机器人叠毛巾,一秒要做几十次决策,十分之一秒的卡顿就是一次失败的抓取。过去两年具身智能的叙事全在模型层,比谁的「机器人大脑」聪明;APXInf这类工作说的是另一半:本体上的芯片、功耗就这么多,云端推理框架直接搬下来根本喂不饱。所以这条的正确角度是「开源生态开始补脏活累活」:运行时、量化、算子融合,全是上不了发布会的环节,却决定机器人什么时候能降价进厂。它和量产新闻是一个故事的下半场——产线把硬件成本打下来之后,下一场竞争拼的就是谁能让一颗几十瓦的芯片跑出实时智能。
晓依: 最后这条,4亿参数——今天最小的数字,反而藏在企业系统里?
云健: 这条我先把「小」讲清楚:表格数据行就是几百上千列,不需要语言模型那种千亿参数的世界知识,4亿参数在这个赛道就是Scaling的正解——这也是他们去年提出「表格基础模型同样遵循规模定律」之后的第二次加码。真正值得注意的是竞争面:TabArena这类榜单是公开流水线,成绩可查可跑,谷歌、亚马逊的同类模型被一家中国初创加清华团队压住,这种「非生成式赛道上的反超」过去两年很少见。冷水在这儿:Elo榜单头部的置信区间互相重叠,领先幅度窄;企业真实数据远比公开基准脏,八百多个场景验证是厂商自述。所以这条的读法不是「登顶」,是「换道」——当所有人挤在大模型主赛道时,表格预测、因果发现这种贴着工厂和电网的旧学问,正被基础模型的新做法悄悄改写牌桌。
第四段:收尾
晓依: 好,今天的节目就到这里。博士生公开了训练日志,大学实验室给世界模型做减法,UP主拿到了出卷的笔,初创在补机器人最脏的那段水管,小公司在榜单冷门赛道上悄悄超车——定标准的大厂还在开会,改牌桌的已经是另一批人了。记录时代,也记录技术。明天见。
晓依+云阳+云健: 今日我们AI说,带你听见未来的声音!
