← 返回 今天AI说 列表

不会撒谎的AI,攻下棋盘最后一块硬骨头

📅 2026-10-04 周日 ⏱ 10:26
今天AI说 · 10月4日|AI攻克「藏牌」棋类Stratego 封面

本期看点

开场(三人合声)

晓桐+云阳+云健: 今日我们AI说,带你听见未来的声音!

第一段:晓桐开场

晓桐: 大家好,这里是《今日我们AI说》,我是晓桐。有个棋类游戏,因为AI「不会撒谎」,被公认是棋盘上最后一块难啃的硬骨头——现在它被攻下来了:卡内基梅隆、麻省理工等四所大学做的智能体,二十局对阵战棋Stratego史上战绩最好的棋手,赢了十五局只输一局,整轮训练只花了几千美元。今天是国庆节假期第4天,共7天;假期里AI圈还有四条动静:中国科协9月30日发布「材华」材料大模型,院士推介的说法是世界首个百亿参数;美国一个云服务商开源了不写文字的「决策模型」,官方口径下智能体做一道选择题只要三十九毫秒;全球最大的预印本平台arXiv这个月起给论文「配给」,一人每月两篇;国内一个开源社区给智能体排了个「班表」,简单的活小模型干。先请云阳过要闻,再请云健逐条拆。

第二段:云阳播报

要闻一:AI攻克「藏牌」棋类Stratego,世界冠军级对手十五胜一负四平,训练花几千美元

云阳: 要闻一,9月30日,国际学术期刊《自然》刊发卡内基梅隆大学、麻省理工学院、纽约大学、斯坦福大学联合团队的论文:智能体系统Ataraxos在二十局比赛中,以十五胜一负四平的战绩击败Stratego历史上荣誉最多的棋手皮姆·尼迈尔——四届世界冠军、连续六百多周排名第一。论文称这是据其所知该游戏史上首个超人水平的AI成绩。Stratego是暗信息棋类:双方各摆四十枚标着军衔的棋子,位置看得见、身份看不见,可能开局阵型超过10的33次方种。团队成员对麻省理工新闻稿举例,对比DeepMind此前的DeepNash,这套系统训练样本不到前者的百分之一、自对弈棋局不到三十分之一,作者估算整轮训练花了几千美元。论文原文见《自然》论文页。

要闻二:科协专场发布材料大模型「材华」,院士推介称世界首个百亿参数材料大模型

云阳: 要闻二,9月30日,中国科协主办的「新天工开物」科技成就发布会人工智能专场首播,集中发布两项成果:一是苏州国家实验室联合上海人工智能实验室、上海交通大学打造的材料多模态大模型「材华·MatVerse」,走通了数据、大模型、智能体、评测、应用的全链条流程,首创覆盖十九类材料二级学科的多模态评测基准;中国工程院院士、苏州国家实验室学术副主任孙宝德介绍,它是世界首个百亿参数的材料大模型、也是首个原生多模态的材料大模型(推介口径),并称已在国内多所顶尖大学及龙头企业应用。同日发布的还有哈尔滨工业大学(深圳)张民团队的「立知」Uni-MoE系列多模态大模型,该成果获2025年度吴文俊人工智能科学技术奖特等奖。报道见人民网财经频道(人民网转载中国科协场发布内容,记者赵竹青)。

要闻三:美国云服务商开源「决策模型」:智能体做选择题不写文字,官方口径中位延迟三十九毫秒

云阳: 要闻三,10月1日,美国云服务商Cloudflare发布Clef和Clef-flash两个开放权重的「决策模型」。这类模型不生成文字:接一个带选项的问题,直接返回每个选项的概率,用来做「这封邮件急不急、工单转给哪个组」这类智能体分类判断。大的那款270亿参数、小的90亿参数,两者都基于阿里巴巴千问家族的开源模型继续训练,带视觉编码器,能同时给图片和文字做判断。Cloudflare官方口径:Clef-flash决策延迟中位数39毫秒(官方口径,待第三方复测),在自家43项基准和多项分类测试上领先这个品类的开创者、TypeSafe AI公司的Jev。两个模型都以Apache 2.0许可上了Hugging Face,接口与Jev兼容。外媒The Decoder的报道见The Decoder报道页。

要闻四:全球最大预印本平台开始给投稿「配给」:一人每月两篇,被拒也扣额度

云阳: 要闻四,10月1日,预印本平台arXiv在官方博客公告,即日起对所有领域、所有投稿者实施新的投稿限额:每人每个自然月最多提交两篇,任意时刻在审稿件最多三篇;论文被拒稿退回,也照样扣掉当月额度。公告给了背景数字:2026年9月单月收到四万零三百六十三篇投稿,比2024年9月翻倍还多,一个月产生近九千个支持工单;平台说志愿者审核员的时间,正在被窄范围的单薄论文、一项研究拆成多篇的「香肠论文」和AI密集写作的稿件占用。限额按「实际提交人」计,合著者众多的团队可以换人投递,独立研究者受影响最大——这是外媒The Register报道里补的执行细节。公告原文见arXiv官方博客。

要闻五:国内开源社区给智能体排「班表」:简单活小模型干,社区自测省一半以上Token

云阳: 要闻五,10月2日,AI垂直媒体量子位报道:开源AI智能体平台openJiuwen首发其自演进模型路由技术X-Router。openJiuwen由华为系多个团队联合高校、企业开发者共建。这套路由层的思路是:智能体每调用一次模型前先判一道「难度题」——简单任务交给本地小模型,复杂任务才派给云端大模型;路由策略不是写死一次,而是用上下文老虎机和轻量强化学习,从每次真实执行的结果里持续修正经验,并针对华为昇腾算力做了亲和适配。报道给出的说法是「实测减少50%以上Token消耗」(社区口径,待第三方复测)。报道见量子位。

第三段:晓桐×云健对话点评

晓桐: 先说头条。下围棋、下象棋的机器人都早就有了,为什么偏偏一个「藏牌」的棋,能让AI的攻关报告写了十年?

云健: 围棋象棋要解的题是「局面已知,下一步怎么走最好」,Stratego是「你连局面都看不见」——你发现没有?这才是它难十年的原因。对面四十个棋子全是暗的,你每算一步,理论上都要把所有可能的藏子组合都过一遍——这是组合爆炸,DeepMind当年也卡在这。这支四校联盟的做法,是不去穷举所有可能,而是先让另一个神经网络「读牌」:根据对手已经走过的棋,猜他藏子的可能身份,再只抽样几个最可能的局面去做搜索——等于把无穷问题拆成「先估、再小范围查」。训练费从百万级美元掉到几千级,我觉得真正值钱的不是赢棋,是这个架构:谈判、网络安全、资源调度,现实里全是「看不见对手手牌」的题。还有个细节值得记一笔:论文里同一套方法顺手做掉了斗地主,中国原创的暗信息牌类,对抗、合作、组队三类游戏都扛住了——这才让这篇稿子超出「赢一盘棋」的级别。

晓桐: 「材华」这条,我想先问清楚:「材料大模型」跟咱们天天用的聊天大模型,差别到底在哪?

云健: 聊天模型学的是人写下来的话,材料模型要学的东西大多没写成文章:显微组织的图像、谱学数据、实验记录里的失败配方。所谓多模态,就是让它同时读得懂这些格式。「世界首个百亿参数」是院士的推介口径,我劝大家别把分量押在参数量上——材料模型真正的难点在参数外头:一是数据散在各家实验室手里,二是这个行业此前没有统一考场,模型说自己会配材料,没人拿得出卷子验。所以「首创覆盖十九类材料二级学科的评测基准」才是我认为这条成就里最硬的部分——先把统一命题立起来,后头的分数才有得比。至于落地,通稿说进了顶尖大学和龙头企业,但具体哪条产线用它省了哪一步试验,没披露。哪天能问到「哪款合金或电池材料的研发周期被它压短了」,才算真成功。

晓桐: 那决策模型呢?它就是个缩小版的大模型?

云健: 不是缩小版,是换了工种。智能体每天干的活,大头不是写文章,是选择题——这张工单算不算加急、这条内容违不违规、下一步调用哪个工具。让通用大模型干,它得先写一段推理,你再从文字里把答案抠出来,又慢又贵。决策模型直接报概率:违规九成三、放行不到半成,一次调用几十毫秒。这背后是行业共识在变:不是每个问题都值得动用全能模型。两个口径要钉牢:一是那39毫秒和榜单领先全是Cloudflare自测,有海外测评站复测其早期版本跑到约六百毫秒,接近官方数字的二十倍,正式版截至目前的第三方数据还没有;二是它权重随Apache 20协议开放下载,但训练数据和流程不公开——开源社区管这叫「开权重」,不叫全开源。有意思的是基座:这两兄弟用的是阿里千问——美国公司拿中国开源模型当底座做新品类、再面向全球发,中国开源生态的输出,这次是长在这样的工程件上。

晓桐: 回到arXiv这条。一人每月两篇,会不会把认真做研究的人也一起卡住?

云健: 这条规则的倾斜恰恰在这:限额按提交人算,作者多的大团队可以换人投递,机构基本没感觉;真正被卡的是没有合著者的独立研究者。但我不觉得这是在惩罚谁——它在给一个成本结构打补丁:AI把写一篇像模像样论文的成本打到接近零,可初筛还是志愿者一个一个肉眼看。官方公告自己也写了,这是权宜之计。往后盯两件事就行:arXiv会不会拿省下的窗口期做出真正的机器初筛工具;以及这个「按人头配给」会不会外溢——被限额的团队转头去开新预印本服务器,那就只是把问题挪了个地方。对个体研究者,这新规实际抬高的,是把每个想法都攒成一篇正经稿的分量——手一抖投篇水的,半个月的额度就没了。

晓桐: 最后这条,X-Router排班表,省的不就是点电费钱吗?

云健: 省钱是一面,关键是「看错人」。本该大模型干的难题被路由判给了小模型,一次事故性返工的花费,可能比省下来的 token 费更贵——而路由判错的概率,报道里没有第三方数据,这是我最想看的那一栏。它用上下文老虎机加轻量强化学习自演进,方向我认,但这类东西天然难验收:策略天天在变,「线上跑的是哪一版路由」这个答案本身每天都在变,出了问题算谁的,生产部署得先回答。倒是可以跟10月1日那期给智能体配手机号和钱包的节目放一块看:那家智能体公司官方口径新框架运行成本降三成,跟这边的省五成,说的是同一件事——智能体的成本结构战已经开打,从决策层打到路由层,国内国外都在拆「每次调用都上最贵模型」这个账本。省下来的数是毛利,判错的率才是生死。

第四段:收尾

晓桐: 好,假期里的这五条,串起来是一根线:十五胜一负四平、只花几千美元练出来的棋类智能体,说明能力未必只能靠算力堆出来;材料大模型、几十毫秒的决策模型、会排班的路由器,说明AI的账正在越算越细;而arXiv的每月两篇,是同一枚硬币的另一面——产能爆炸,审核跟不上。下一步的答案不用等榜单:去问材料实验室的中试周期缩了多少,去问智能体服务商每千次调用的账单厚薄,去看「每月两篇」的额度会先卡住哪一类作者。记录时代,也记录技术。明天见。

晓桐+云阳+云健: 今日我们AI说,带你听见未来的声音!

❓ 读者常问

这期节目里的数据能当作投资依据吗?

本站所有内容仅作科技产业动态与商业逻辑的客观解读,不构成任何投资建议或决策依据。文中数据均来自期刊论文、平台官方公告、机构发布与权威媒体报道,厂商与发布方自报口径均已逐处标注,引用请以原始出处为准。

播客里的信息是从哪里来的?

本期选题来自9月30日至10月2日的公开信息,经多源比对后写成:Ataraxos以《自然》论文原文及麻省理工新闻稿为准,训练成本为作者估算口径;「材华·MatVerse」以中国科协「新天工开物」专场发布内容及新华网、人民网报道为据,「世界首个」为院士推介口径;Clef以Cloudflare官方博客发布内容为准,延迟数据为官方口径;arXiv限投以官方博客公告原文为准;X-Router以量子位10月2日报道及openJiuwen社区公开信息为据,省Token比例为社区自测口径。我们不编造数据。

Stratego是什么棋?为什么它被公认是AI最难攻克的棋类之一?

Stratego是两人的暗信息战棋:双方各布四十枚标着军衔的棋子,对局时能看到棋子位置但看不到对方军衔,只有碰撞才揭示身份,开局阵型组合超过10的33次方量级,且要赢必须会「虚张声势」。此前DeepMind的DeepNash能做到顶级人类水平但无法结合前瞻搜索,因为要枚举的隐藏局面规模爆炸。卡内基梅隆、麻省理工、纽约大学、斯坦福四校团队的解法是训练一个「信念网络」根据对手走法估计藏子身份,再只抽样若干可能局面做决策时搜索,最终在二十局中15胜1负4平击败四届世界冠军皮姆·尼迈尔,论文9月30日刊发于《自然》,作者称这是该游戏史上首个超人成绩(据论文表述,尚未经更多独立对局验证)。

「决策模型」和常见的大模型有什么区别?

大模型按词元逐步生成文字,决策模型(如Cloudflare10月1日发布的Clef系列)不生成文本,而是接一个带选项的问题,在一次前向计算内直接返回每个选项的概率,用于智能体工作流里的分类与路由判断,速度以几十毫秒计。它通常基于开源大模型(Clef用的是阿里千问系列)继续训练,但训练数据不公开,严格说是「开放权重」。Cloudflare给出的延迟与榜单优势均为官方自测口径,截至本期播出尚无公开的第三方完整复测。

👁 阅读中…

💬 评论

免责声明

本文由 ABT 编辑团队基于公开权威信源整理,仅作宏观财经知识、市场现象与行业逻辑的客观解读,不构成任何投资建议,不推荐任何标的,亦不提供个股买卖点位、涨跌预测或收益承诺。文中数据均标注官方来源,投资有风险,决策请独立判断。

作者简介

ABT TEAM —— ABT 财经内容编辑团队,长期跟踪宏观经济数据、货币政策与行业动态,坚持「事实可溯源、观点可区分」的内容准则。更多内容见 财经图鉴。

总访问量 -- 次 · 总访客数 -- 人
京ICP备2026062851号-1 京公网安备11010802050438号