用10元数据挑战2000元真机,昆仑万维布局世界模型的一盘棋
程以晴 · 2026-07-23
昆仑万维将异构数据成本降至10元/小时,挑战传统真机数据2000元/小时,以游戏场景和视频切片构建世界模型,降低多模态AI数据壁垒。
昆仑万维将异构数据成本降至10元/小时,挑战传统真机数据2000元/小时,以游戏场景和视频切片构建世界模型,降低多模态AI数据壁垒。7月19日WAIC现场,昆仑万维董事长兼CEO方汉说了一句话,当时没引起太大波澜,但细想起来挺有意思。
他说:真机采集数据,成本是500到2000元每小时。异构数据当前成本不到50元,目标是降到10元每小时。
这不是在炫耀成本控制,更像一个技术路线的宣言。如果能把数据成本压到十分之一甚至二十分之一,这个行业的数据壁垒就不成立了。
昆仑万维董事长兼CEO方汉
当天昆仑万维发布了三条产品线:黎曼机器人模型1.0、世界模型Matrix-Game3.5和音乐模型Mureka v9.5&O3。两条线看上去分散,实则指向同一个核心命题:异构数据能不能替代真实数据,在多模态AI时代跑通。
这是一场有预谋的布局,而底牌恰好藏在昆仑万维最不起眼的身份里,他是一家游戏公司出身的AI科技企业。
游戏业务攒下的那笔家底
大多数人对昆仑万维的印象还停在做过游戏、浏览器、出海、社交等业务层面。但从AI训练数据的视角重新审视这家公司,会发现他攒了一笔别人很难复制的家底。
1200个游戏场景,500万个视频切片。
Skywork首席科学家成宇讲述世界模型Matrix-Game 3.5
而这两个数字非常值得拆开来看。1200个游戏场景覆盖室内空间、街道、野外地形、工业环境、商业场所等多种类型,是旗下游戏产品线十几年运营沉淀下来的资产。这些场景最初是为游戏玩法服务的,但从AI训练的角度看,游戏场景恰好具备合成数据最难构造的东西:多样性。
500万个视频切片来自另一个方向。昆仑万维搭建了一套自动挖掘互联网游戏视频的管线,经VLM评分筛选高质量片段,再自动切分镜头,成为视频生成模型的训练原料。视频切片的价值在于它携带真实世界的运动模式:人怎么走路,物体怎么倒下,光线怎么随时间变化。这些信息在纯粹的游戏引擎渲染里很难完全还原。
两个来源叠加形成异构数据:游戏渲染场景提供多样的3D环境和可控的物理参数,真实视频切片提供真实世界的运动规律。混合训练的目标是让模型同时从两类数据里学习。
游戏引擎生成数据的流程,比渲染场景四个字要复杂得多。每个游戏场景需要先做语义标注,把可交互物体、导航区域、遮挡关系分层打标,再通过程序自动控制虚拟摄像机在场景里移动,记录不同角度和光线下的画面,生成带动作标签的训练数据。随机化参数是关键,光照条件、物体材质、摄像机视角都需要刻意随机变化,防止模型只认识游戏里的特定画风。这套流程本身算力成本不高,但建立标注和随机化基础设施需要时间,这才是10元成本背后真正的门槛。
Matrix-Game3.5的数据体系不止这些。在已有的三套生产线中,一套基于虚幻引擎构造,引入agent自主探索实现毫秒级同步采集;一套针对GTAV、荒野大镖客2、赛博朋克2077等AAA商业游戏做自动控制与数据采集。三套管线配合,覆盖从可控合成到真实素材的全谱系,也解释了500万切片和1200个场景这两个数字的来源。
10元VS 2000元,哪里站得住,哪里要打问号
10元对2000元,乍一听挺爽,细抠的话,有几个地方站得住脚,也有几个地方得打个问号。
1200个游戏场景和500万视频切片,是游戏业务多年沉淀的产物,这个资产壁垒其他公司短期内很难复制。买游戏引擎也能生成合成数据,但场景多样性和积累规模不是一年能追上的。异构数据策略在实际训练中也已经产生了可量化的效果。
问号在另一边。
1200个场景够不够?昆仑万维没有在公开发布中详细展开这个问题。场景数量对于覆盖工厂、医院、家庭等不同部署环境是否足够,目前也没有第三方验证。训练数据的评测标准、环境复杂度以及基线比较方式,发布里都没有公开细节,这些都会影响结论的可靠性。
更根本的问题是物理差距。游戏引擎的物理模拟经过二十年积累已相当成熟,但游戏物理和真实环境的物理复杂度仍有差距。布料形变、液体流动、非刚体碰撞在游戏里往往是计算妥协后的近似结果。视频世界模型要支撑真实的物理推理,模拟和现实的迁移误差一旦放大,会直接反映在生成质量上。目前没有足够的公开数据来量化这个差距在昆仑万维体系里有多大,这个洞还没人填上。
还有一个结构性问题:异构数据覆盖的是训练分布,但真实部署环境里的长尾情况在训练集里基本不存在。工厂里某款罕见的零件形状,养老院里某种特殊的地面材质,这些场景在1200个游戏场景里几乎不会出现。真机数据之所以贵,部分原因恰恰是它能系统性地捕捉这些合成数据覆盖不到的边缘情况。10元策略能解决常见情况,能否覆盖长尾,目前没有答案。
Matrix-Game3.5在解决什么问题?
长时序一致性,是视频生成最难绕过去的坎。模型在生成第100帧时,往往已经忘记了第1帧里某个角落的细节。
Matrix-Game3.5的应对方案叫patchmemory:在模型内部引入显式的记忆单元,每个单元对应场景里的一个空间patch。生成新帧时,模型先查询对应patch的记忆,再结合当前上下文生成内容。记忆的读写是局部的、稀疏的,计算开销可控,同时场景的局部一致性得到显式保障,无论镜头怎么移动,画面中物体的位置和空间关系都能维持稳定连贯。技术指标是50亿参数、720p分辨率、20帧每秒,单卡即可实现实时生成,这意味着模型已经具备实时交互的能力。
训练分三个阶段。
第一阶段是因果适配,用游戏场景数据做领域适配,建立合成分布和真实分布之间的映射基础。第二阶段是一致性蒸馏,通过多步蒸馏将扩散模型的采样过程加速压缩。第三阶段是分布匹配蒸馏,用真实视频数据校准模型在运动流畅度和物理合理性上的偏差。打个比方:先让模型认清游戏里的规则,再通过多步蒸馏压缩采样过程,最后用真实视频校准感知。三段走下来,模型既有合成数据带来的多样性,又有真实数据带来的感知校准。
在世界模型的框架下,patchmemory要让模型维护一个持续自洽的物理世界状态,这个差别对需要理解物理因果关系的下游应用至关重要。但这个状态能否真正具备物理保真度,是当前所有世界模型都还没答清楚的问题。
发布会上,黄晓明提到自己看了一部朋友制作的AI电影,王珞丹分享了自己用AI做短片创作的经历,说曾经抽卡抽到凌晨4点,反复调整画面效果。两个场景说明视频生成已经从能看推进到能用,能够支撑娱乐内容的工业化批量生产。对昆仑万维来说,这条商业路径很熟悉:先用游戏场景数据训模型,再用模型生成娱乐内容,娱乐内容反过来验证模型的实用性。
Mureka v9.5 & O3 在解决什么问题?
从SkyMusic1.0内测到Mureka v9.5 & O3,昆仑万维的音乐模型走过了一条从“作品成立”到“创作可控”再到“多模态创作”的演进路径。早期的SkyMusic主要验证一件事:AI能不能生成一首听起来成立的歌。那个阶段的标准很低,能出声、有旋律、不失真就算过关。后来随着版本迭代,昆仑万维把重心从“生成质量”转向“创作可控性”,让用户的意图能够准确反映在最终的音乐里。Mureka v9.5是这条路走到目前的节点。
v9.5的标签叫“最没有AI味的AI音乐”,这个定位本身就是一种判断。当前AI生成音乐最大的问题不是能不能出声,而是听起来像AI。这个“AI味”的根源在于大多数音乐生成模型把生成当成一次性的前向推理,输入提示词,输出音频,中间没有任何审视和修正的过程。编配往往过度堆叠,情绪缺乏层次,整体质感显得生硬。
歌曲的主观评分
Mureka v9.5的技术路线叫MusiCoT。CoT是Chain-of-Thought的缩写,原本是语言模型领域的概念,指让模型在给出最终答案之前显式地走完推理步骤。MusiCoT把这个逻辑迁移到音乐生成:模型在输出最终音频之前,先生成一条描述音乐结构和情绪走向的路径,再依此生成音频内容。这条路径相当于一份内部创作大纲,锁定了歌曲的段落结构、乐器层次和情绪曲线,后续的音频生成在这个框架内展开。从评测结果看,v9.5在旋律、人声、音质和编曲上全面提升,指令精准度从6.92提升到7.62。它不再把更满更复杂当作唯一标准,而是在真实音乐框架里更克制地处理编配和情绪。
进一步的O3版本在MusiCoT基础上引入了更高的推理计算预算,让模型在推理阶段有更多深化的空间。用在音乐生成上,O3会在生成过程中持续审视当前表达是否符合既定的情绪和结构目标,不满足则修正,直到生成结果与内部路径对齐。这和Matrix-Game3.5用patchmemory维护一致性是同一类思路,都是把生成从单次前向推理变成一个有反馈的过程,引入显式的自我监督机制。MusiCoT加test-time scaling的代价是推理成本更高,但对于需要高度定制化、强情感表达的音乐场景,这个代价值得付。
在产品层面,Mureka已从单一模型演进为完整的创作平台。多版本创作功能让同一灵感可以快速生成多个版本,用户可以在旋律、人声、结构等维度进行局部保留与替换,选出最接近想法的那条线再深化。Character功能让用户用一段声音、一张照片就能生成专属歌手角色,贯穿歌曲和MV的全链路,解决的是AI音乐人格化的问题。AI配乐能自动分析视频画面的场景、动作与情绪,生成更贴合内容的音乐。Mureka Agent是整合性入口,通过自然语言一次对话就能调用生成、Remix、延伸、MIDI导出等全部能力,全程无需切换界面。这几个功能放在一起,瞄准的是把创作门槛降下来。
方向有逻辑,但缺口还在
合成数据和真实世界之间的物理差距,游戏场景覆盖不到的长尾,这两个问题目前没有公开答案。10元策略是一个有说服力的方向,但还不是一个验证完的结论。