← 返回 今天AI说 列表

2026年9月23日 周三

📅 2026-09-23 周三 ⏱ 11:11
今天AI说 · 9月23日|OpenAI称模型解决100多道数学难题 封面

本期看点

开场(三人合声)

晓依+云阳+云健: 今日我们AI说,带你听见未来的声音!

第一段:晓依开场

晓依: 大家好,这里是《今日我们AI说》,我是晓依。这两天AI圈干了几件看着不相干的事:OpenAI声称一个内部模型解掉了上百道数学难题,小米那场直播给全网围观的模型训练交了卷,合肥一家存储厂宣布不用最先进的光刻机也做出了第一梯队的内存,还有一家安全公司发现,四个主流AI编程助手栽在同一个没锁上的安全锁上。把发布会的稿子翻到背面,今天的共同主题是:数字和锁,都不如标题里说的那么漂亮。先请云阳过一遍要闻,再请云健逐条拆解。

第二段:云阳新闻播报

要闻一:OpenAI称模型解决100多道数学难题,但外界一份证明都没看到

云阳: 要闻一,9月12日那期我们讲过AI攻破悬置90年的纳维-斯托克斯方程后爆发的署名之争——那是流体力学里描述水流和气流怎么运动的方程,一百多年没人能证明它的解永远光滑。9月21日,OpenAI在官方博客宣布:8月28日开始训练的一个内部模型,除纳维-斯托克斯之外,已经「解决」了100多道长期悬置的数学开放问题,横跨大部分数学分支,并且直言进展速度让公司内部的数学家都吃了一惊。配合这个宣布,OpenAI公布了一个新机制:与独立顾问小组「数学与人工智能咨询小组」合作,九人数学家设在普林斯顿高等研究院,名单里有菲尔兹奖得主蒂莫西·高尔斯、马丁·海尔,还有物理学家爱德华·威滕。要划清楚的重点有三个:成员全部不领报酬;小组对OpenAI的研究节奏没有决定权,普林斯顿高等研究院原话说「我们没有在任何一家AI公司的决策权」;他们的第一个任务,是把这100多份还没公开的结果整理出来、决定以什么顺序发布。背景是此前25位菲尔兹奖得主联名公开信,批评把解开放题当成模型竞赛的标尺。截至发稿,OpenAI没有公布问题清单,没有任何一份证明经过外部核验。详见OpenAI官方公告。

要闻二:小米把直播完的训练交卷:MIT协议全开源,智能体考试咬住两大闭源旗舰

云阳: 要闻二,9月18日那期我们讲过小米把大模型训练全程直播、账本和故障全公开。9月21日到22日,这场直播交卷了:小米MiMo团队发布MiMo-V2.6系列的开源权重。先报口径:Pro版总参数1.02万亿,但生成每个Token只激活其中420亿——稀疏MoE架构,像一家登记上万名医生的大医院,每位病人只叫醒对应的当值科室;另有总参数3090亿、激活150亿的Flash版。两款都能原生处理文本、图像、视频、音频,支持一百万Token上下文,许可证是最宽松的MIT协议:任何人可下载、微调、商用转售。第三方评测机构Artificial Analysis的指数上,Pro拿到46.32分,是公开发布权重模型里的最高分之一,但整体仍排在Claude Fable 5.1、GPT-6 Astra等闭源旗舰之后。小米自称Pro在多数智能体基准上与两大旗舰同级,模型卡给出的DeepSWE v1.1得分71.9,对照Claude Opus 5的74.0、GPT-5.6 Sol的73.0(官方口径,待第三方复测)——上次直播里这个自报数字还在62分档。强化学习阶段的账单也定了稿:多家跟播媒体统计合计约347万美元,超过DeepSeek-R1与MiniMax-M1两家此前公开数字之和。发布详情见科技媒体SiliconANGLE报道,API价格维持上一代水准。

要闻三:一台EUV光刻机没用,合肥把内存追进第一梯队:三巨头牌桌上多了新对手

云阳: 要闻三,9月20日,据环球时报报道,长鑫存储在合肥举行的世界制造业大会上宣布,第五代DRAM工艺平台正式进入量产。先把最容易翻车的口径说清:官方公布的11.95纳米,量的是存储阵列里关键结构的「半间距」——相邻两组结构中心距的一半,它是个几何测量值;三星、SK海力士说的「12纳米级」是产品代际命名,两者没有换算公式,外媒也提醒不可直接对比。在这个口径下,长鑫走的是多重曝光路线:EUV极紫外光刻机受出口管制买不到,就用普通深紫外设备反复曝光、多次刻蚀「雕」出更密的线条,代价是工序更多、单片产出节奏更慢。同步发布的两款24Gb容量LPDDR5X手机内存,单颗比上一代多装一半数据,官方称已进入国产主流旗舰手机,每片晶圆产出的芯片数比第四代平台多至少50%(官方口径,待第三方复测)。行业研究机构数据显示,长鑫的全球DRAM营收份额约7%,排在三星、SK海力士、美光之后居第四。对普通消费者,这条新闻可以翻译成一件事:给手机电脑供内存的供应商,从三家变成四家。今年8月31日那期财经节目里讲过长鑫LPDDR6全球首发量产,这次是它下一代的制造底座整代换代。

要闻四:一条Git命名规则骗过四大AI编程助手:安全锁自己报绿灯,没人去核对

云阳: 要闻四,9月17日到18日,企业AI安全公司Air Security公开了一项代号Plugin4Shell的漏洞研究:Anthropic的Claude Code、OpenAI的Codex、GitHub Copilot和谷歌Gemini CLI,四个主流编程智能体在安装插件时共用一把没锁上的锁。机制是这样:插件市场为了防供应链投毒,会把每个插件钉死在一个40位字符的提交号上——相当于「你审过的就是这一份代码,以后永远只跑这一份」;但四个智能体都只告诉Git「去取这个号对应的代码」,装完从不回头核对落地的到底是不是它。而Git有个特性:当一个分支的名字和提交号一模一样时,它优先认分支。攻击者只要控制插件仓库,建一个用提交号命名的恶意分支并设为默认,智能体就会装上恶意代码,同时报告「已按审过的版本完成安装」。加上Claude Code和Codex默认在后台自动更新插件,整条攻击链不需要受害者点任何一下——术语叫零点击。细节见Air Security研究博客。补丁进度:Claude Code在2.1.179版、Codex在0.146.0版已修复;Copilot截至披露没有补丁,GitHub的说法是其平台早已禁止提交号样式的分支名;Gemini CLI因产品退役,谷歌确认不修。多家安全媒体也复核指出:默认插件市场都托管在GitHub、自动更新默认只对市场自家插件开启,实际影响面比标题小——但对从自建Git服务装插件的用户,那把锁依旧是假的。截至披露日,该漏洞未分配CVE编号。

要闻五:前OpenAI研究员把人类视频变成机器人课本,6B技能库直接开源

云阳: 要闻五,9月21日,据科技媒体RuntimeWire报道,前OpenAI研究员Roger Jiang创办的初创公司Light Origins发布Light-O1:一个从互联网人类视频里学「全身动作」的机器人基础模型。思路一句话:让机器人先看人干活的视频,学到「身体是怎么动的」,再适配到各自的本体上。真机演示里,同一个预训练底座驱动两台完全不同的机器人——自家的LightBot和宇树G1人形——完成下蹲、平衡、擦黑板、拾物。团队把60亿参数的Light-O1-Preview权重以Apache 2.0协议放上Hugging Face开源,推理代码同步上GitHub,模型卡显示它基于Qwen3.5-4B-Base衍生,报道与地址见RuntimeWire。这条路赌的是一个成本结构:真机数据又贵又稀缺,人类视频却是海量免费教材,先用视频预训练、把金贵的真机小时数留给最后适配。这家公司2024年底成立,8月刚完成数亿元人民币的Pre-A轮融资。9月22日我们聊过中国移动给机器人开源的通用转接头——那条管模型怎么接上身体,这条管动作从哪学来。

第三段:晓依×云健对话点评

晓依: 云健,先掰扯OpenAI这份数学成绩单。题目它自己选、宣布它自己定、证明还不给外人看,这和9月12日那次的署名之争比,算进步还是倒退?

云健: 得拆两层。成绩单层,现在就是零分制里的空卷——没清单没证明,谈不上下游真假,唯一能引的是DeepMind的前例:国际数学奥赛那两块奖牌之所以没人质疑,是因为考题和裁判都不是它定的。机制层,讲真,这次最值钱的反而不是那100道题,是OpenAI承认需要一个外部程序。顾问小组无权刹车、成员不领薪,是软约束;但25位菲尔兹奖得主的联名信第一次逼出了「发布前有人过目」这道程序。真正的硬指标在后面:证明一旦公开,数学家的审稿周期才是裁判。自证清白这条路,它才走到第一个路口。

晓依: 那你接着说小米。直播是直播了,最后分数还是小米自己贴出来的,这波到底该信几分?

云健: 看两个变化。一个数字:上次直播里自报的DeepSWE还在62分档,终稿模型卡写71.9,涨的分没人替它担保,但这串数是全网盯着从训练里长出来的,中途两次故障重启也都记了账。另一个是许可证:MIT协议,加上「离闭源旗舰差几个点」的智能体能力,等于把前沿级的Agent底座免费发给全世界的开发者,按Token收费的闭源API模式会先感到疼。你发现没有?直播训练真正的杀伤力不在透明本身,而在把「自报数字」变成了「公开可追溯的自报数字」——离第三方复测就差最后一个外人。别的厂商暂时不会跟,这活儿等于把自己工程水位晾在太阳底下,敢晾第二次的,才算这条路走通。

晓依: 长鑫这条,稿子里特意先解释「半间距」——手机芯片说的3纳米是晶体管的工艺代际,DRAM说的11.95纳米量的是存储单元排布的几何间距,根本是两把尺子。为什么不直接对标三星的12纳米级来说?

云健: 因为对不了。这条新闻该盯的,说白了不是那个纳米数像不像第一梯队,而是两个能算钱的数:单颗容量多一半、每片晶圆多产五成的芯片——如果量产能站住,成本就压下来了,内存从「三家长期默契涨价」的生意,变成四家抢单的生意。冷水也得泼:多重曝光用工序换精度,节拍慢、缺陷控制难,良率是厂商自己的说法,等拆解报告和装机实测出来才算数。但方向可以现在下判断:这个市场的进入成本被实质性压低了一件事实——三家想躺着提价,得先看第四家答不答应。

晓依: Plugin4Shell那条,四家公司四套代码犯同一个错,这真的是巧合吗?

云健: 不是巧合,是同一个想当然:「我把提交号传给了Git」等于「我跑的就是提交号那份代码」——四家都没去核对落地的东西。一家犯错是疏忽,四家同犯就是行业公共盲区:过去两年所有人的注意力都在「怎么骗模型」上,这次是分发层本身被骗。这个漏洞的修法说出来让人哭笑不得,一行判断的事——装完把实际落地的哈希再读一遍,对不上就中止。自保动作也给到普通开发者:Claude Code和Codex升级到修复版本;还在用Copilot和Gemini CLI的,只从GitHub上的官方默认市场装插件,顺手把自动更新关掉,等厂商补完再打开。

晓依: 最后说机器人。看视频学动作这条线,跟9月22日那条「转接头」拼得上吗?

云健: 拼得上,一个管插座一个管课本。两条线拧的是同一个死结:真机数据太贵。Light-O1敢把60亿参数的小模型直接开权重,赌的就是「视频预训练加真机微调」能被社区复现验证。风险也直白:视频里学的是人的动作,人的关节极限、重量分布和机器人完全不是一回事,课本给的是常识,不是安全边界。从「会擦黑板」到「擦黑板不闪腰」,中间还隔着数据回流那一整环——所以这两条新闻合起来看,具身智能的竞争焦点正在从单体演示挪到基础设施。

第四段:收尾

晓依: 好,今天的节目就到这里。成绩单要等证明公开,安全锁要等回头核对。记录时代,也记录技术。明天见。

晓依+云阳+云健: 今日我们AI说,带你听见未来的声音!

❓ 读者常问

可以相信OpenAI「解决100多道数学难题」的说法吗?

截至目前,OpenAI仅公布声明,未公开问题清单与证明原文,也没有任何一份结果经过第三方数学家或期刊核验。本期以「OpenAI称」的口径转述,若后续证明公开、同行评审或数学界形成结论,我们会在节目中跟进。

用AI编程助手的开发者现在应该做什么?

将Claude Code升级到2.1.179、Codex升级到0.146.0以上即可关闭该风险;GitHub Copilot与Gemini CLI截至披露日没有官方补丁,建议只从GitHub托管的官方默认市场安装插件,暂停插件自动更新,并核对已装插件实际落地的提交号,待厂商修复后再恢复。

这期节目里的数据能当作投资依据吗?

本站所有内容仅作科技产业动态与商业逻辑的客观解读,不构成任何投资建议或决策建议。文中数据均来自公司公告、官方统计及权威媒体报道,引用时请以原始出处为准。

播客里的信息是从哪里来的?

本期选题来自9月17日至22日的公开报道,经多源比对后写成脚本,包括OpenAI官方公告、小米模型卡与SiliconANGLE报道、长鑫存储大会发布与环球时报、Air Security研究博客与多家安全媒体复核、Light Origins开源页与RuntimeWire报道。我们不编造数据。

👁 阅读中…

💬 评论

免责声明

本文由 ABT 编辑团队基于公开权威信源整理,仅作宏观财经知识、市场现象与行业逻辑的客观解读,不构成任何投资建议,不推荐任何标的,亦不提供个股买卖点位、涨跌预测或收益承诺。文中数据均标注官方来源,投资有风险,决策请独立判断。

作者简介

ABT TEAM —— ABT 财经内容编辑团队,长期跟踪宏观经济数据、货币政策与行业动态,坚持「事实可溯源、观点可区分」的内容准则。更多内容见 财经图鉴。

总访问量 -- 次 · 总访客数 -- 人
京ICP备2026062851号-1 京公网安备11010802050438号