← 返回 今天AI说 列表

2026年9月18日 周五

📅 2026-09-18 周五 ⏱ 11:24
今天AI说 · 9月18日|小米直播大模型训练现场:一小时烧三万美元 封面

本期看点

开场(三人合声)

晓依+云阳+云健: 今日我们AI说,带你听见未来的声音!

第一段:晓依开场

晓依: 大家好,这里是《今日我们AI说》,我是晓依。上一期的看点是博士生晒出了训练日志,这几天的风声则是一连串「把过程摊开来」:小米把强化学习训练现场做成直播,烧了多少钱、哪块卡坏了全都看得见;美国一个全植入的脑机接口,让渐冻症患者自己组词、在电话里和孙辈聊天;IDC给企业AI换了考法,央企自研的Agent考了个满分单项;图形学宗师童欣离开微软二十五年,去了一个博士辍学创业的年轻人开的公司;又一家国产视频模型,靠着「物理对不对」挤进国际第三方榜单。过去发布只看结果,现在交付开始让人查过程。先请云阳过一遍要闻,再请云健逐条拆解。

第二段:云阳新闻播报

要闻一:小米直播大模型训练现场:一小时烧三万美元,账本和故障全公开

云阳: 要闻一,9月17日,据AI垂直媒体量子位报道,小米MiMo团队的强化学习研究员罗福莉把新模型MiMo-V2.6系列Pro与Flash两款的强化学习训练过程开放给全网围观:在官方直播页上,训练花了多少钱、跑到第几步、奖励曲线涨没涨、哪张显卡出了故障,全部可查;官方口径显示,训练开始36小时已花超108万美元、平均每小时约3万美元(官方口径,待第三方复测)。先把「强化学习」说清楚:不是给模型刷填空题,而是让它在真实任务环境里干活——每道题同时给模型十六次机会,一条尝试要经历几十轮思考、调用工具、拿环境反馈、再修改动作,然后对整条过程打分给奖励,喂它的是「干活的经验」。MiMo每个训练步处理约二十亿Token,任务混合了代码、通用、视觉、对话四类,打分环节本身也在加算力。评测面上,团队公开的DeepSWE v1.1离线分数是Pro 62.24分、Flash 60.77分,同榜第一梯队的DeepSeek-Flash为74.2分(自报口径)。当上期那七名博士生把从零训练的日志摊在桌上时,公开的是预训练配方;这一次,轮到强化学习开直播。

要闻二:全植入脑机接口让渐冻症患者自己组词:「我有好多话想说」不是台词

云阳: 要闻二,美东时间9月14日,美国脑机接口初创公司Paradromics发布官方新闻稿(行业媒体BioSpace转发全文):其Connect-One研究的首位植入者,用全植入式Connexus系统实现了实时的语音与文字交流。患者是密歇根州一位六十多岁的女性,患进行性运动神经元疾病、说话严重含混,今年6月接受植入。和以往演示的分水岭在于:过去多数言语解码展示靠抄写研究者给的固定句子或从词表里选词,这次她自己选词、回答开放式问题,还在一通实时电话里和孙辈聊上了天。她对未来的试验者说,那句被广泛引用的「我有好多话想说」,是她自己组织的话。系统把电极阵列放在大脑运动皮层的言语区,导线走皮下连到胸内的植入单元,公司给出的设备寿命目标是至少十年(官方口径,待第三方复测);团队还说,第一次同时观察到「试着说话」和「想象说话」两种不同的神经活动模式,方向是从内心语言里直接取词,但承认这一步还在很早期。要说清边界:这是美国药监局早期可行性研究,三家医疗中心、计划最多入组十人、随访六年,单例里程碑不等于获批产品。9月11日那期讲过AI从脑电波里读出「你改主意了」,那条是戴在头上的无创路线,这一条是全植入路线——光谱的两端,这周各亮了一格。

要闻三:IDC换了考法:近百道非公开的办公真题,央企自研Agent考出满分单项

云阳: 要闻三,9月17日,据AI垂直媒体量子位报道,IDC发布国内首份面向企业级通用Agent的产品技术评估。通用Agent指的是能理解目标、调用工具、接进企业系统并连续执行任务的AI,而不是单轮问答机器人。这次IDC没跑公开题库,出了近百道非公开真题:处理三千七百多行脏数据、从约三万字材料里提炼一份十一页的演示文稿,跑完还要核验系统状态和最终文件,确认任务真的做完了才算数。成绩单上,中国电信自研的TeleAgent常规任务得3.49分、复杂任务3.36分,九项能力里任务表现拿了满分,成本效率是全场最高,总排名进前三。分数后面是一串工程账:约三万行自研Go代码的执行内核、突破四十万Token的上下文窗口和快触顶就自动压缩的机制、定期整理对话的长期记忆、按任务复杂度把请求分给轻量、均衡、旗舰三档模型——官方称这套智能路由能把推理成本降约四成(官方口径,待第三方复测)。产品今年4月还在集团内部试用,7月对外上线,官方口径用户规模已接近120万。IDC今年4月的调研显示,48.5%的企业已进入通用Agent的评估、试点或使用阶段。9月15日那期银行把「信贷员」装进聊天框讲的是企业敢不敢用,这次评测回答的是另一半:用了之后,怎么验收。

要闻四:图形学宗师童欣离开微软25年,加盟3D初创出任首席科学家

云阳: 要闻四,9月17日,据AI垂直媒体量子位报道,计算机图形学学者童欣加入AI 3D生成公司Meshy,出任首席科学家,负责制定长期科研战略。童欣1999年在清华拿到博士学位后,进了成立不到一年的微软中国研究院,也就是后来的微软亚洲研究院,一待25年,从第一批研究员做到网络图形组负责人、全球研究合伙人,在材质捕捉、纹理合成、真实感绘制等方向论文引用超过两万一千次;浙大的周昆、清华的徐昆、北大的王鹏帅这些如今华人三维视觉的中坚,都与他长期合作或出自他门下。对面这家公司的创始人胡渊鸣是清华姚班出身、MIT图形学博士,读博期间写出了Taichi编程语言;Meshy的主营是把一句话或一张图变成3D模型,公司口径全球用户1200万、客户覆盖全球市值与估值前十企业里的半数,今年7月完成近4亿美元B轮融资、投后估值超100亿元人民币(公司口径,未经审计)。两人的接头暗号其实写了十年:童欣2016年就提出要解决图形内容生产的「任何人在任何地方」问题,2024年又问过一句——三维是否只是视频生成的特例。过去这是实验室的远期命题,现在它成了一家独角兽的路线图。

要闻五:国产视频模型把「物理对不对」卷上国际第三方榜:HiDream发布全模态新品

云阳: 要闻五,9月17日,基础模型公司HiDream通过官方公告(Media OutReach平台发布)宣布推出原生全模态视频生成模型HiDream-O1-Video-1.0:文本、图像、视频都可以作为输入,输出5到20秒的1080p视频,目前处于内测阶段。技术框架分三步:先在全局规划叙事和角色状态,再把画面、运动、语义联合生成,最后用多模态奖励信号对齐画质、连贯性和物理合理性——重力、惯性、碰撞、形变这些要素被写进生成约束;视频时长也不再由用户锁死,模型按事件推进的节奏在5到20秒区间内自己定。公告称,发布时该模型在第三方评测站Artificial Analysis的图生视频(含音频)榜排第四、在用户匿名投票的Arena图生视频榜排第八,两榜成绩以榜单实时页面为准。同一天,公司宣布完成C+轮融资,投资方包括招银体系的欣维资本、成都交子金融控股旗下的交子资本和工银资本。9月13日那期高德「10分钟长出一座3D城市」是空间生成,这条是视频生成——共同点很明确:中国团队开始把「像不像」之上那一层「对不对」,搬到国际第三方榜单上比。

第三段:晓依×云健对话点评

晓依: 云健,先聊烧钱的事。以前说开源,晒的是权重,这次小米直播的是训练过程——这个动作里最值钱的东西是什么?

云健: 是失败。成品上榜单只看得到高光;训练曲线里的坑、哪张卡坏了、奖励涨到一半又平了,才是行业最稀缺的经验,第一次有厂商把这些做成全天候直播。你注意这次直播的是强化学习:不再靠喂世界知识,而是让模型在真实环境里做题,一题十六条尝试,打分打的是整条过程。「算力等于能力」是预训练的老算术,MiMo想证明「环境乘尝试乘评分」是新算术。冷水也得泼:62分对74分是自家榜单的自报口径,第三方能不能复现这套训练环境里的反馈信号,才是这场直播真正的考题。

晓依: 等等,我先问一句。脑机接口的新闻听了这么多年,Paradromics这一条到底哪儿不一样?

云健: 一句话:从「照着抄」变成了「想说啥说啥」。过去的言语解码演示,多是抄写固定句子或者闭集选词;这次患者自己组织语言、接开放式问题、还能在电话里接住家人的话——这是实用价值的分水岭。第二条不一样在全植入:导线埋在皮下,设备长期留在体内,它赌的是医疗器械的寿命和稳定性,不是实验室的演示期。但你发现没有?官方自己把边界划得很清:早期可行性研究、最多十个人、随访六年,离获批产品还远。这一步真正回答的问题是「信号质量和设备寿命撑不撑得住日常使用」;至于「想象说话」能不能也变成字,那是下一道题。

晓依: 央企的Agent考进IDC前三,这件事里,是榜单重要,还是IDC换考法重要?

云健: 换考法。题库化评测这些年已经刷成了军备竞赛,同一个模型换个脚手架分数能差一截。IDC这次用非公开题、跑完还验文件和系统状态,本质是把考试从「笔试」改成「上岗实操」——信号是给采购方的:企业不再问「模型聪不聪明」,改问「Agent能不能把活干完、干完一单花多少钱」。TeleAgent任务表现拿满分、成本效率全场最高,恰好是老板们最想先看到的那两个数。它和9月15日那期银行信贷员的逻辑是同一张考卷的两面:一边是把活交出去,一边是验收得回来。要留个心眼:这类厂商参评产品的成本数字都还是自报口径,进采购合同前得自己压测。

晓依: 童欣在微软待了25年,跳去一家成立五年的创业公司,这在你意料之中吗?

云健: 意料之中,但这三年人才流向同一个方向已经不算新闻了:从大厂研究院流向垂直赛道的创业公司,高校里的顶尖学者也开始选「问题大的地方」而不是「牌子老的地方」。图形学是给屏幕造「怎么把三维世界画出来」这门手艺的,过去25年它服务的是游戏和影视管线,现在Meshy这类公司要的是「一句话生成可交互的3D世界」——题变了,手艺得换个更大的考场。胡渊鸣那代人是童欣理念的下游:让任何人把想象变成可视内容。学者去创业公司定十年期的研究路线,比再发一篇论文更能说明这个赛道被押注的深度。风险也直白:公司的研究方向跟着商业估值走,长期命题能不能扛住下一轮现金流波动,得持续盯着。

晓依: 最后这条,视频生成卷成这样,HiDream新来一个,赌的到底是什么?

云健: 赌「像」不够用了。物理一致性是所有视频模型的公共短板:杯子穿桌、布料乱飘、物体转个角度就变形。HiDream把重力、惯性、碰撞写进生成约束,时长按叙事自动定,这些细节听着工程,实际是视频生成从「玩票素材」跨进广告和影视生产工具的门槛。榜单成绩别太当真:第四和第八都是第三方榜单的瞬时排名,下一个版本随时可能被反超,这是各家口径里最需要动态跟踪的数字。真正的信号是群像——生成式视频这条赛道上,中国团队正在第三方榜单上形成集团军,比的已经不是单家的画质,而是「物理正确」这项新基建谁先铺完。

第四段:收尾

晓依: 好,今天的节目就到这里。训练现场开成了直播,脑电信号变成了自由的句子,企业的考卷从题库换成了实操,图形学的宗师换了考场,视频模型开始比谁更懂物理——把过程摊开让人检验,行业正在从「宣布胜利」走向「接受验货」。记录时代,也记录技术。明天见。

晓依+云阳+云健: 今日我们AI说,带你听见未来的声音!

❓ 读者常问

这期节目里的数据能当作投资依据吗?

本站所有内容仅作科技产业动态与商业逻辑的客观解读,不构成任何投资建议或决策建议。文中数据均来自官方公告、企业直播页、新闻稿及权威媒体报道,厂商自报口径均已标注,引用请以原始出处为准。

播客里的信息是从哪里来的?

本期选题来自9月15日至17日公开报道与官方物料,经多源比对后写成脚本,包括:小米MiMo官方强化学习直播页(mimo.xiaomi.com/rl)及量子位报道、Paradromics官方新闻稿(Business Wire发布,BioSpace转发)、IDC《中国企业级通用Agent产品技术评估》相关报道(量子位)、童欣加盟Meshy的量子位报道、HiDream-O1-Video-1.0官方公告(Media OutReach发布)。我们不编造数据。

「直播训练过程」和常见的「开源模型」有什么本质区别?

开源模型通常公开的是最终权重,最多附带训练数据和代码的说明,训练过程中踩过的坑不对外;小米这次公开的是一个持续运行的强化学习训练现场——花费、步数、奖励曲线、显卡故障实时可查,属于公开「过程」而非仅公开「成品」。需要注意:直播页展示的数字是厂商自采口径,第三方能否基于同样的环境和信号复现成绩,目前尚无独立验证结论。

脑机接口让患者「自己组词」,算不算读心术?

不算。Paradromics系统的做法是把电极阵列放在大脑运动皮层的言语控制区,解码的是患者「尝试说话」时产生的运动信号,再由计算机合成语音和文字——患者必须主动想「说」,系统才能输出。团队观察到「试着说」和「想象说」的神经活动存在差异,从纯粹的内心语言直接取词是下一步研究方向,目前仍在很早期。该系统处于美国药监局批准的早期可行性研究阶段(计划最多10名受试者、随访6年),不是已上市产品。

👁 阅读中…

💬 评论

免责声明

本文由 ABT 编辑团队基于公开权威信源整理,仅作宏观财经知识、市场现象与行业逻辑的客观解读,不构成任何投资建议,不推荐任何标的,亦不提供个股买卖点位、涨跌预测或收益承诺。文中数据均标注官方来源,投资有风险,决策请独立判断。

作者简介

ABT TEAM —— ABT 财经内容编辑团队,长期跟踪宏观经济数据、货币政策与行业动态,坚持「事实可溯源、观点可区分」的内容准则。更多内容见 财经图鉴。

总访问量 -- 次 · 总访客数 -- 人
京ICP备2026062851号-1 京公网安备11010802050438号