当生成式AI还在比拼谁生成的画面更炫时, 腾讯混元3D 团队给出了不同的答案:先让世界能用。2026年8月,腾讯混元在arXiv公开论文并上线展示官网,推出WorldClaw,一个全智能体驱动的3D开放世界生成框架。用户只需输入一句开放式文本描述,它就能生成可自由探索、可继续编辑的大规模3D世界,每个物体都是独立可复用的资产,而非一张只能看不能动的渲染图。
一、从生成画面到生成世界,WorldClaw要解决什么问题
生成式模型已经能够根据文本生成图像、视频和3D对象,但生成一段看起来像世界的画面,与构建一个可进入、可继续编辑和使用的3D世界并不相同,后者需要连续一致的空间结构,以及可独立编辑、替换和扩展的建筑、道路、植被等场景元素。现有方法大致归为四条技术路线:程序化内容生成依靠规则与程序构建地形植被,控制性强但表达力受限于硬编码规则;图像视频提升借助图像或视频生成模型合成场景观测再提升为3D表示,内容丰富但缺乏全局一致性与几何保真度;原生3D扩散直接学习体素、距离场或高斯的分布,几何质量高但受限于3D场景数据集的稀缺;多模态大模型智能体用大语言模型驱动生成流程,灵活但常缺乏精细的几何控制。
WorldClaw属于第四条路线,却通过多智能体协作弥补了既往智能体方法在几何细节上的短板。它的核心主张很明确:生成结果不只是视觉上合理的画面,更是显式的、可复用的实例级资产,每个物体都有独立的网格与材质,可以单独选中、编辑、替换,场景文件可以被下游工具链直接使用,这与纯图像渲染式生成有着本质区别,也让生成结果真正具备工程化价值。
二、粗到细四阶段流程,先搭骨架再填血肉最后自我检查
WorldClaw采用由粗到细、从全局到局部的生成方式,整个过程分为四个阶段。第一阶段是意图分析和场景规划,意图分析Agent只提取用户明确给出的信息,如场景类型、视觉风格、关键区域、物体和空间关系,不主动补充用户没有提及的内容;场景规划Agent在此基础上补全生成所需的信息,将区域、地形、物体及其关系整理成统一的场景规范,相当于人类建筑师动工前先画图纸。
第二阶段是全局地形生成,系统先准备一张划分不同区域的语义布局图、一套岩石和植被等可复用3D环境资产,以及草地、岩石、沙土等地表材质,随后通过程序化内容生成构建3D高度场,不同区域采用相应的地貌规则,让山地自然起伏、沙漠产生连续沙丘、平原保持舒缓,并使不同地貌自然衔接,岩石植被等环境资产的分布还会参考区域类型、局部高度和坡度,过滤过陡或不合理的位置。
第三阶段是区域对象生成,系统渲染局部地形作为条件,让图像模型绘制完整的2D构图,再通过SAM3将图像分割成独立实例,用SAM3D逐一重建为3D网格,并利用光线求交恢复每个物体的三维位置,放回地形上。第四阶段是场景精修,渲染检查Agent从多个视角检查生成结果,识别物体尺度、姿态、几何质量以及悬浮、穿模、地形接触等问题并进行局部修改,直到通过检查或达到迭代上限。简单来说,这套流程就是先理解用户想要的世界,再搭建地形、填充内容,最后自动检查和精修。
三、多模型协同的编排管线,Claude与GPT-Image-2各司其职
WorldClaw本质上是多个基础模型与常规3D软件组成的编排系统。据论文披露,腾讯的实验以Claude Opus 4.8作为Agent基础模型,GPT-Image-2负责图像生成,SAM3与SAM3D负责分割与重建,腾讯自家的Hunyuan3D负责高质量几何与纹理生成,整套流程在 Blender 5.1.1中通过MCP接口驱动,服务器配备四块Nvidia H20 GPU。大型物体获得2048乘2048的PBR贴图,小型资产使用1024乘1024的贴图。
论文将WorldClaw与SynCity、Marble、MajutsuCity、WorldGen和GPT-5.6 Sol五个系统进行了定性对比:Marble单视角视觉保真度高,但没有区域级地形组织,也不暴露独立可控的对象资产;WorldGen是下游可用性最接近的基线,能生成连贯可穿行的村庄,但地形相对平坦、内容变化有限;GPT-5.6 Sol作为编码Agent能产出显式独立可控的几何,却依赖简单几何图元和重复物体形状,近似搭建草模。对比结果显示,WorldClaw生成的复杂地形具有明显高差、连续边界和清晰的语义分区。
值得注意的是,论文在消融实验中也坦承,开源替代模型在语义布局生成上频繁失败,这正是腾讯选用Claude和GPT-Image-2的原因。这一细节也揭示了行业趋势:前沿实验室的旗舰研究,越来越多地表现为围绕其他公司模型搭建的编排管线,创新单元正在从模型权重转移到编排本身。
四、可编辑资产化,游戏、机器人仿真与3D打印的共同底座
WorldClaw与既往3D生成方法最大的差异,在于对可编辑性的执着。这为多个产业场景铺平了道路:游戏开发中,美术团队需要的是能放进引擎、能调参的资产,而不是一张无法修改的静态渲染图,WorldClaw可以把开放世界地图的概念设计压缩到分钟级,让策划团队快速验证世界设定的可玩性,再让美术团队在生成的基底上精修。
影视与VR领域,电影场景预演、虚拟制片背景、VR沉浸式内容都需要大量高质量3D场景,生成式工作流可以显著降低场景搭建成本,让中小制作团队也能驾驭宏大的视觉设定。工业数字孪生方面,工厂、园区、城市级的3D场景重建是数字孪生的基础,生成式方法有望加速这一过程的自动化。更具想象空间的是具身智能与机器人仿真,机器人在真实环境中的训练成本高昂且存在安全风险,世界模型提供的虚拟仿真场可以把训练试错转移到算力集群,WorldClaw生成的物理合理、可交互的3D世界,正是机器人训练所需的仿真环境素材。
对3D打印而言,可编辑资产的意义同样直接,生成结果的模型可以直接拆件、修复、导出多色打印格式,省去大量人工建模环节,让AI生成的模型真正变成可打印的实物。演示案例覆盖四季村落、热带海盗要塞、河谷部落、沙漠战场、雪山未来设施等,从写实自然到科幻建筑均有呈现,直观展示了框架的风格覆盖能力。
五、开源背后的行业信号,管线正在取代模型成为主角
WorldClaw的论文于8月5日提交至arXiv(编号2608.05248),项目主页与GitHub仓库同步上线,用户可在项目页查看完整演示。一个耐人寻味的细节是,GitHub仓库目前只有README和展示图片,尚无完整代码,相关讨论在技术社区引发热议,Hacker News上相关帖子获得两百余条评论。有评论者将其形容为调用外部模型的Python脚本,这并非贬低,恰恰点中了行业趋势:如今创新的单元正在从模型权重转移到编排管线本身。
当然,WorldClaw也坦承自身局限,大规模场景的生成计算开销依然巨大,资产类型覆盖范围有限,与顶级手工场景的品质差距仍然存在。但作为首个把智能体协作与可编辑资产化作为核心设计目标的开放世界生成框架,它为行业指明了一条从能看走向能用的演进路径。腾讯混元此前已发布HunyuanWorld 1.0用于从文本或图像生成可探索的3D场景,并于2025年11月将Hunyuan 3D创建引擎推向国际市场,WorldClaw进一步将生成对象从单物体扩展到可编辑的开放世界,把AI 3D内容生产的版图从生成比拼推进到可制造比拼。
六、总结
腾讯混元WorldClaw以多智能体协作与可编辑资产化为核心,把3D世界生成从演示推向生产。它印证了AI 3D内容的范式转移:从单物体生成走向世界级场景生成,从一次性渲染走向可复用资产。对创作者而言,一句话生成一个可编辑世界,正在从愿景变为现实。
来源:智东西、腾讯混元官方、arXiv、IT之家
