本文小节
9 月 1 日,Google 宣布 Gemini 的“智能体式视频理解”功能可通过动态扫描视频片段,将 token 消耗最多降低 88%、成本最多降低 66%,同时将质量最多提高 7%。这组数字看似同时改善了效率、价格与结果,但它衡量的是特定视频分析机制的表现,而不是一个通用多模态模型能力的总排名。Google DeepMind 的产品公告恰好说明:2026 年被统称为“多模态性能突破”的成果,实际上正在回答不同的问题——模型能否处理更多信息、是否能以更低代价处理信息,以及能否在真实物理或专业任务中产生有效输出。
把这些问题混为一个“模型更强”的结论,会掩盖技术路线与实际收益之间的差异。
更大的上下文,不等于更低的使用成本
Kimi K3 技术报告描述了一条以基础模型扩展为中心的路线:该模型总参数量为 2.8 万亿,采用混合专家架构;每个 token 激活 896 个路由专家中的 16 个,实际激活参数为 1040 亿。报告还称,该模型原生支持视觉输入,并拥有 100 万 token 的上下文窗口。
这些指标指向的是模型可容纳和调度的信息规模。报告将效率提升归因于 Kimi Delta Attention、Attention Residuals、Stable LatentMoE,以及训练和数据方案的改进,并称相对于 Kimi K2,整体扩展效率约提高 2.5 倍。这里的“扩展效率”是模型训练与架构层面的描述:在更大规模和更长序列条件下,如何让信息流动、专家路由和系统资源管理更有效。 来源:arxiv.org
但这与终端用户看到的调用成本并不是同一个量。模型能处理百万 token 上下文,首先意味着它为长文档、长期任务或复杂交互提供了容量条件;是否每次都应读取如此长的输入、每次读取需要多少计算资源,则仍取决于推理时怎样选择和压缩信息。Kimi K3 报告提到面向长程执行的强化学习、持续 rollout 与沙箱状态等基础设施安排,说明长上下文本身并不能自动转化为稳定的长任务表现,训练与部署环节同样是能力的一部分。 来源:arxiv.org
据此可以推断,参数总量、激活参数、上下文长度和扩展效率,适合衡量一条“把模型做大且保持可训练、可运行”的路径;它们不能直接用来判断某一视频、图像或专业科学任务的单位成本。
视频理解的改进,来自“少看一点、看对一点”
Google 对 Gemini 视频功能的描述提供了另一种性能定义。其所谓智能体式视频理解,并非默认对视频进行一次性、均匀的全面读取,而是让模型动态扫描相关片段。公司称,这一机制可最多减少 88% 的 token 使用量、最多降低 66% 的成本,并最多提升 7% 的质量;该功能面向 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 提供。 来源:blog.google
这组结果的关键不在于模型接收了更多视频信息,反而在于它避免处理不必要的信息。视频是一种时间序列输入:同一任务未必需要逐帧阅读全部内容。若系统能先定位潜在相关区段,再将计算资源集中于这些区段,就可能同时降低输入量和计算支出。Google 公告所报告的“质量提高”,因此应理解为这种动态扫描策略在其测试条件下带来的结果,而不能扩大为所有视频任务、所有模型或所有部署环境中的普遍增益。 来源:blog.google
与 Kimi K3 的技术报告相比,两者并不构成谁“性能更高”的直接对照。前者主要讨论大规模模型怎样维持训练、长上下文和专家激活的效率;后者报告的是一项推理时视频访问策略在 token、成本和质量上的联合变化。它们的共同点是,性能优化都已越过单纯增加计算量的思路;但优化对象不同,一个处理模型内部的规模约束,一个处理输入内容的选择问题。 来源:arxiv.org;来源:blog.google
“统一模态”仍须与具体任务效果分开看
NVIDIA 的 Cosmos 3 技术报告则将问题推向第三个层面。该系列模型被设计为在统一的混合 Transformer 架构中联合处理和生成语言、图像、视频、音频与动作序列。报告将其定位为面向 Physical AI 的“全模态世界模型”,并称其能够覆盖视觉语言模型、视频生成器、世界模拟器和世界—动作模型所涉及的关键模态组合。
这种统一架构的价值,在于减少不同模态、不同模型之间的接口断裂:同一个系统可以接收语言指令、视觉与音频信息,也可以生成内容或动作序列。报告称,其评测在一组理解与生成任务中达到新的最佳结果;该结论是技术报告作者对其评测的主张。它所证明的重点,是单一框架覆盖多类输入输出配置的可行性,而不是已经证明一个系统在所有具体场景中都优于专用模型。 来源:arxiv.org
这一区分尤其重要。多模态能力常被表述为“看得见、听得懂、会行动”,但每一项能力涉及不同的评价尺度:输入是否被有效整合,生成是否符合要求,动作是否适合任务,系统运行是否足够经济。Cosmos 3 的“统一”回答的是架构整合问题;Gemini 视频功能的成本和质量变化回答的是推理调度问题;Kimi K3 的扩展效率回答的是大规模训练与长上下文的系统问题。三者可以互补,却不能被压缩成一条无条件的性能曲线。 来源:arxiv.org;来源:blog.google
目前材料所能支持的判断是,多模态模型的竞争已经不只是让模型接入更多媒介。更可核验的改进,往往发生在具体约束之下:长上下文如何保持可训练,视频如何避免无效读取,多种感知与动作序列如何进入同一框架。对使用者而言,问题也应随之具体化:需要的是更大的信息容量、更低的视频分析账单,还是一个能处理多种输入输出的统一系统。不同答案对应的,并不是同一种“突破”。