← 返回 今天AI说 列表

2026年9月22日 周二

📅 2026-09-22 周二 ⏱ 10:29
今天AI说 · 9月22日|阶跃把旗舰价打到底:单任务成本是Claude的八 封面

本期看点

开场(三人合声)

晓依+云阳+云健: 今日我们AI说,带你听见未来的声音!

第一段:晓依开场

晓依: 大家好,这里是《今日我们AI说》,我是晓依。今天这期节目,讲一件事:AI 正在离开聊天框。一家中国模型公司把旗舰价格打到对手的八分之一,赌的是智能体替人跑完整个工作流;一颗广东上天的卫星,把地面完整的通信基站和一台星载计算机搬进了太空;一家运营商把机器人与大模型之间的「转接头」开源给了全世界;微软训练了一个会犯真实错误的「虚拟学生」,先拿来教 AI 家教怎么上课;还有一家视频模型公司,正在让画面「边说边画」。从车间、轨道到课堂、游戏引擎,AI 去的这些地方,光会说话不够用。先请云阳过一遍要闻,再请云健逐条拆解。

第二段:云阳新闻播报

要闻一:阶跃把旗舰价打到底:单任务成本是Claude的八分之一,权重下月全开源

云阳: 要闻一,9月20日,大模型创业公司阶跃星辰发布新一代旗舰基座模型 Step 5 Preview,凤凰网科技援引官方公告报道了这个数:在第三方评测机构 Artificial Analysis 的智能指数上拿到44分,位居全球开源模型前三;跑一个任务的平均成本0.71美元,约为 Anthropic 旗舰 Claude Opus 5 的八分之一。架构上它是稀疏 MoE——用大白话说,模型像一家大医院,登记在册的「全院医生」有6000亿参数,但接待每个病人只叫醒约270亿参数的「当值科室」,所以又大又省;上下文窗口支持一百万 Token,原生读图。官方还展示:连续二十四小时自主改写 GPU 内核代码,把一段程序的峰值性能推到508 TFLOPS,超过 Claude Opus 5 的493(官方口径,待第三方复测)。API 即日全量开放,模型权重承诺10月15日开源。上一期我们讲过一张消费级显卡就能跑的国产开源模型,这一条把「便宜」的战场从本地小模型打到了旗舰级。

要闻二:把完整的5G基站送上天:鹏城首发星带着星载AI算力入轨

云阳: 要闻二,据中新网9月20日报道,9月20日,鹏城首发星暨鹏城南科一号卫星随力箭一号遥十八运载火箭在东风商业航天创新试验区发射入轨,实现国内首次把地面完整的5G NTN基站、核心网、星载AI智能算力、星地激光与微波通信「联合搬上天」。这颗150公斤的卫星由商业航天公司银河航天与鹏城实验室、南方科技大学联合研制,搭载三种载荷:基于3GPP标准的5G NTN通信载荷、「数字视网膜」在轨计算载荷、星地激光通信载荷。接下来它要围绕星地通信、星载AI算力、每秒100千兆比特的星地激光通信做在轨分时验证——通俗讲,就是让卫星先在天上把遥感数据处理完,只把结果传回地面,而不是把原始数据整筐倒下来,带宽不够、时延太高这些老毛病,指望用「天上算、地上收」来治。这批任务也是后续6G空天地一体化网络的一次前置考试。

要闻三:运营商给机器人开源「通用转接头」:接一个新模型只需几十行代码

云阳: 要闻三,9月16日,据界面新闻及IT之家报道,中国移动宣布面向全球开源 Open-RAIL——行业内首个连接 VLA/WAM 模型与机器人本体的通用工程底座。解释一下这两个词:VLA 是「视觉-语言-动作」模型,看着画面、听懂指令,直接输出机械动作;WAM 路线则先预测环境接下来会怎么变,再决定动手。麻烦在于,不同品牌机器人的关节定义、通信协议、坐标系方向全不一样,每接一个模型都像重新配一次转接头。Open-RAIL 抽出一层硬件抽象层,把控制、状态读取、动作执行统一标准化,让模型推理、真机执行、数据回流、模型迭代在同一个底座里闭环。官方描述,目前已适配4款异构机器人、支持10个主流 VLA/WAM 模型,新模型接入最少只需五十到一百行代码(官方口径,待第三方复测)。9月20日那期我们聊过一家中国初创给「机器人大脑」画的2027时间表,那条讲的是脑子,这条补的是脖子和接口。

要闻四:微软造了个会犯错的「虚拟学生」,先拿它教AI家教怎么上课

云阳: 要闻四,微软研究院与伊利诺伊大学香槟分校团队近期公布了一项名为 StudentSim 的研究,论文已挂上arXiv预印本,代码在 GitHub 开源。它要解决的痛点很实在:想让 AI 家教个性化,得知道「哪种讲法对这个孩子管用」,但真人学生的反馈又慢、又贵、又稀疏。团队的办法是给每个学生训练一个「虚拟分身」:先把一批学生的行为共性学成一个公共底座,再针对单个学生做个性化特化——效果就是既让这个分身「像本人」,能复刻他特有的错误,又让它「可教」,听了讲解会真的改。团队同步发布了覆盖国际象棋、英语写作、数学三门课、六十名真实学生记录的评测协议,国际象棋场景下,其两项核心指标分别为0.51与0.91,直接用 GPT-5.4 扮演学生则为0.23与0.72。最有意思的一步是把训练好的分身当作强化学习的「考官」去打磨象棋家教模型:专家盲评里,这样教出来的家教在准确性、引导性和个性化上,超过了不做强化学习的基线和用 GPT-5.4 当考官的版本。论文自己写明,这是可行性验证,不宣称做出了最好的家教。

要闻五:视频模型开始「边说边画」:Runway要把世界模型装进实时引擎

云阳: 要闻五,视频生成公司 Runway 9月10日在官方研究博客公布实时视频生成的技术路线,科技媒体 The Decoder 在这个周末跟进解读。传统流程是「你写提示、等几秒、拿成品,不满意重来」;Runway 的目标是反着来:画面逐帧流出来,你中途可以改指令。工程路径分两步:先把双向的视频模型改造成因果、自回归的生成方式——只根据已经生成的内容往后续帧,不再回头全局重算;再用蒸馏把每一帧的生成步骤压到几步,快到能直播。此前他们9月3日发布的交互式世界模型 GWM Worlds 2 已能实时输出720p、每秒24帧的音画,用户用文字动作改变场景;官方演示在英伟达新硬件平台上把首帧延迟目标压到100毫秒以内,同时坦承代价:实时和画质目前要做交换,镜头急转会掉细节,长时程记忆不稳。技术博客里点名的用途除了游戏和互动内容,还包括机器人与自动驾驶的仿真评测——让智能体在「实时长出来」的世界里练手,这一方向与9月13日那期高德把世界模型用于地图生成是同一条河的上游。

第三段:晓依×云健对话点评

晓依: 云健,先说阶跃这个八分之一的价格。第三方榜单上的分数我信,但「便宜到对手的零头」这种话,是不是得先问一句成本砍在哪了?

云健: 问对地方了。成本账拆三层:架构上,600B 总参数只激活27B,单次计算量天然小一截;商业上,API 先收费、权重下月才开源,等于是用三周窗口期先把「便宜旗舰」的名分卖出去;评测上,44分和单任务成本都出自 Artificial Analysis 这个第三方,比厂商自报的分数硬。但泼一瓢冷水:帕累托前沿是特定任务集的平均值,具体到你的代码库、你的财报分析,成本结构未必等比例。权重10月15日落地才是验货时刻——开源之后,社区拿自己的任务实测那一天的表现,才算数。

晓依: 那你接着说说卫星。把基站搬上太空,跟普通卫星通信差在哪?直接说人话。

云健: 传统卫星是「哑巴转发器」:地面把数据丢给它,它照原样弹回来,自己不看懂任何东西。这颗星的关键在「数字视网膜」——名字来自仿生学,模拟人眼视网膜先在眼里就做初步处理:遥感图像在天上直接分析、识别、压缩,只把结论传下来。带宽账立刻不一样:整筐原始数据往地面倒,和告诉你「第三幅图里有三处违建」,是两种生意。说白了,这是把「边缘计算」的思路打到600公里高的边上。难点也别忽略:太空的辐照、散热、算力功耗,芯片在天上能不能长期稳定跑,要等在轨验证的季度报告,现在只是开考。

晓依: 换一条。中国移动这个开源底座,运营商造机器人的接口,图什么?

云健: 图的是标准权。机器人行业现在最像2010年的手机业:硬件各造各的,软件全都不通。谁先把「转接头」免费铺出去,谁就最有机会变成那层绕不开的行业协议——安卓当年干的就是这事。你发现没有?这条新闻的信号不在「中国移动做了个机器人项目」,而在它开源、且明确喊话让别人的模型来适配:四款机器人、十个主流模型的名单是它的存量诚意,五十到一百行的接入成本是它撒的鱼饵。风险同样直白:运营商的工程文化和开源社区节奏能不能对上,得看提交记录的活跃度,不看发布会。

晓依: 学生模拟这个研究,我第一反应是有点凉——把孩子的错误学成一个模型拿去训练,AI 家教真的会更懂孩子,还是更会「骗过」考官?

云健: 你这个担心,正是这项研究自己最清醒的地方。它的论文里没有喊「最好的家教」,只说「训练出来的分身当考官,比拿通用大模型扮演学生当考官,教出的家教在专家盲评里得分更高」。两个指标的设计也讲究:既要像本人,又要可教——缺一不可,因为只会扮演「聪明学生」的模型会把家教惯坏。更实际的价值在成本:AI 家教每迭代一版,不必再招一批真人孩子做实验,先在六十个分身身上跑一遍。要警惕的反而是规模化的那一天:分身学的是真实学生的弱点,教出来的是「最会提分的套路」还是「最好的理解」,取决于人定的目标函数,这一步没有技术答案,只有教育答案。

晓依: 最后说 Runway。生成视频做到能实时交互,除了打游戏,跟普通人的关系在哪?

云健: 讲真,这条离普通人最远,但离整个行业的下一步最近。视频模型实时化,本质是花大钱买两样东西:延迟和成本。Runway 的技术博客自己也承认,实时现在是拿画质换速度,长会话会「忘事」。真正值得盯的是它点名的另一个买家:机器人与自动驾驶的仿真。训练一辆车处理十万分之一的事故瞬间,靠路上跑是跑不出来的,只能靠世界「现编」——实时视频模型若能受控地生成边缘场景,就是给具身智能造模拟考场。这条赛道上谷歌有 Genie 路线、国内有高德的地图世界模型,Runway 把赌注押在「流式生成」上。考场能不能用,先要看判卷标不标准:物理对不对、因果连不连贯,第三方基准目前都还没长出公认的答案。

第四段:收尾

晓依: 好,今天的节目就到这里。一颗卫星把计算送上600公里的高空,一个开源底座给机器人接上统一的脖子,一间教室先住进了六十个虚拟学生,一段视频开始边生成边听指挥,一款旗舰模型把价格表当成武器。AI 离开聊天框的每一步,都是一道工程题:便宜要能复测,上天要在轨验证,开源要看社区提交,拟人要听人话反馈,实时要还画质的债。记录时代,也记录技术。明天见。

晓依+云阳+云健: 今日我们AI说,带你听见未来的声音!

❓ 读者常问

这期节目里的数据能当作投资依据吗?

本站所有内容仅作科技产业动态与商业逻辑的客观解读,不构成任何投资建议或决策依据。文中数据均取自官方公告、论文预印本、通讯社及权威媒体报道;厂商与机构自报口径(阶跃 Step 5 Preview 的内核优化与自主设计训练数据实验、Open-RAIL 的接入代码行数与适配清单、在轨验证的阶段性目标)均已随文标注,引用请以原始出处为准。

播客里的信息是从哪里来的?

本期选题来自9月10日至21日公开报道与一手材料,经多源比对后写成:阶跃星辰 Step 5 Preview 官方发布信息(凤凰网科技、每日经济新闻报道,Artificial Analysis 第三方评测)、中新网关于鹏城首发星随力箭一号遥十八入轨的报道、中国移动 Open-RAIL 开源公告(界面新闻、IT之家报道)、StudentSim 论文(arXiv:2609.01591)与微软 GitHub 开源仓库、Runway 官方研究博客《Towards Instant Video Generation》及科技媒体 The Decoder 跟进解读。我们不编造数据。

为什么说 Step 5 Preview 的「八分之一成本」和上一期的「一张显卡能跑」不是一回事?

两者落在成本曲线的两端:上一期中国电信开源的星辰模型主打端侧私有化部署,面向数据不能出域的政企;阶跃 Step 5 Preview 是云端 API 旗舰,主打同等智能下更低的单次任务价格,权重承诺10月15日开源后也可自行部署。智能与价格的「帕累托前沿」由第三方评测机构 Artificial Analysis 的指数与成本图给出,针对其任务集的平均值,不保证在具体业务上复现同样比例。

「世界模型」和 Runway 生成的视频是一回事吗?

不完全。视频生成关注「画面好看且连贯」;世界模型额外要求状态可交互、物理与因果一致——你输入一个动作,世界按规则演化出下一帧。Runway 的 GWM 系列自称通用世界模型并点名机器人仿真用途,但官方也承认当前版本存在画质与速度的交换、快速镜头运动下细节退化、长时程记忆不稳等问题;对「生成式世界」的可用性判定,学界与业界尚无公认的第三方基准。

👁 阅读中…

💬 评论

免责声明

本文由 ABT 编辑团队基于公开权威信源整理,仅作宏观财经知识、市场现象与行业逻辑的客观解读,不构成任何投资建议,不推荐任何标的,亦不提供个股买卖点位、涨跌预测或收益承诺。文中数据均标注官方来源,投资有风险,决策请独立判断。

作者简介

ABT TEAM —— ABT 财经内容编辑团队,长期跟踪宏观经济数据、货币政策与行业动态,坚持「事实可溯源、观点可区分」的内容准则。更多内容见 财经图鉴。

总访问量 -- 次 · 总访客数 -- 人
京ICP备2026062851号-1 京公网安备11010802050438号