9月1日,上海3D生成大模型公司影眸科技正式发布世界生成模型 Hyper3D WorldGen,把3D生成从「单个资产」推进到「完整场景」。用户只需上传一张场景照片,系统就能自动识别画面中的主要物体,分别生成独立可编辑的3D资产,并重建物体之间的位置、尺度与支撑关系,最终输出一个可以进入游戏引擎、仿真环境和影视流程的完整三维场景。这是继谷歌、腾讯、字节跳动等巨头加码之后,国内AI 3D赛道在场景级生成方向上的又一次关键突破,也标志着行业竞争正从「生成一个模型」升级为「组织一个世界」。
一、从「造物」到「造世界」:一张照片如何变成可交互场景
在传统工作流中,搭建一个完整的三维场景需要经历建模、布线、贴图、摆位、调校光影、物理绑定等数十道人工工序,耗时数小时甚至数天。而WorldGen要做的,是把这一整套流程压缩到分钟级。据影眸科技演示,用户上传一张办公室盥洗室的照片后,系统能够自动识别水龙头、盘子、水果等主要物体,大约两三秒就能生成单个物体的3D预览,并在两三分钟内还原出完整场景。
为了保证可控性,WorldGen同时支持手动框选:用户可以在图片上圈定指定区域,让模型针对目标对象单独生成,兼顾自动化出图与精细化调校两种需求。影眸科技创始人兼CEO吴迪解释,传统做法如果把整个会议室直接作为一个模型生成,所有内容容易被合并成不可拆解的整体,场景很难继续使用。WorldGen的价值恰恰在于把场景拆解为可以单独操作的资产,同时保持它们之间的空间与物理关系。
在技术表达上,WorldGen采用网格与3D高斯泼溅相结合的混合方案:需要编辑和交互的主要物体,以前景独立网格资产的形式生成,便于后续修改与绑定;不需要参与交互的墙面、远景和环境背景,则通过3D高斯泼溅保留更完整的视觉信息与空间沉浸感。场景中的每个资产都支持单独移动、缩放、替换和材质修改,生成结果可以直接进入 Blender 、Unity、PlayCanvas、团结引擎与Unreal Engine等DCC工具和实时引擎进行二次创作。
二、CAST架构与物理感知:场景生成难在理解物体关系
影眸科技联合创始人兼CTO张启煊指出,场景生成比单物体生成困难得多,因为模型不仅要生成物体本身,还要理解物体之间的支撑、悬挂、接触和遮挡关系。WorldGen的底层能力来自团队自研的CAST架构,即基于单张RGB图像的组件对齐式3D场景重建。这项研究在2025年斩获SIGGRAPH最佳论文,当年同时获奖的商业公司仅有谷歌、Meta和影眸Hyper3D三家。
CAST的核心技术是从单张图片中补全被遮挡物体的三维结构,判断物体间谁支撑谁、谁悬挂于谁,并通过物理感知校正机制优化姿态,修正穿透、悬空等不合理现象。张启煊透露,CAST研究完成之后,产品化仍然用了大约一年时间,原因在于多模块系统会产生错误累积:即使每个模块的成功率都很高,级联之后的整体成功率也会显著下降,这正是3D生成从实验室走向产线的真实工程门槛。
生成精度方面,WorldGen依托Hyper3D Rodin Gen-2.5首次在3D生成领域提出的Thinking Effort思考深度架构,为场景中的每个资产按需分配精度:关键物体可以继续细化,获得更精细的几何与表面细节;远处或非关键的普通物体可以快速生成,最快4秒即可产出可用资产。开启SimReady功能后,系统还会为资产补充碰撞体,并估计质量、摩擦系数、恢复系数等仿真属性。需要说明的是,这些属性来自几何与类别先验的推断,属于仿真用估计值而非测量值,不能当作精密工程数据使用;当前WorldGen主要生成刚体,关节化资产、柔性体和动态交互仍是后续演进方向。
三、具身智能、影视、游戏与空间计算四线并进
在具身智能方向,影眸Hyper3D是NVIDIA Inception成员,此前已借助NVIDIA Omniverse与Isaac Lab上线Sim-Ready功能,为生成资产赋予物理属性,并推出Isaac Sim官方插件。今年7月,影眸联合地瓜机器人、谋先飞发布「具身智能可训练仿真闭环解决方案」:WorldGen根据单张照片重建可交互三维场景,谋先飞基于自研物理引擎MotrixSim完成仿真适配,地瓜机器人则提供算力底座与开发工具链,把场景重建、仿真运行、数据采集、模型训练和策略验证整合到同一平台,训练所得策略可迁移部署到实体机器人。此外,影眸参与的研究工作cuNRTO还获得了2026年具身智能国际顶会RSS最佳论文提名,探索Sim-to-Real问题。
在影视制作方向,WorldGen正在与Seedance 2.5等视频生成模型组成组合式AI工作流。多镜头叙事一直是视频生成的难点,创作者可以先在WorldGen中建立资产独立、空间结构明确的3D场景,像使用「3D导演台」一样自由调整镜头、移动物体、替换资产,再把确定的构图交给视频模型补充人物表现、材质、光影与风格,从而提升复杂场景与多镜头内容的可控性和一致性。游戏与空间计算方面,影眸7月已与Unity中国共同宣布构建从3D生成到实时游戏应用的工程闭环,WorldGen也在团结引擎2.0发布会上亮相;生成场景还能与Apple Vision Pro等XR设备结合,用于室内设计、沉浸式教育与空间展示。
四、赛道加速收敛:场景级生成成为下一轮竞争焦点
WorldGen发布的同一天,AI 3D行业另一家头部公司VAST也官宣完成合计约30亿元的B轮与B+轮融资,并同步发布旗舰模型Tripo P2.0,首次实现原生四边面拓扑网格的端到端生成。两件事同日落地并非巧合。今年以来,谷歌开放Genie 3体验,World Labs发布Marble 1.1,腾讯开源混元3D世界模型2.0,阿里发布世界模型HappyOyster 1.0,字节跳动推出Seed3D 2.0,巨头与资本密集涌入,3D生成正从「生成单个资产」全面迈向「生成完整世界」。
在吴迪看来,3D生成的赛道正在收敛,而收敛意味着最终只有少数真正解决了产业问题的团队能够留在牌桌上。WorldGen目前已经进入具身智能仿真训练、影视制作、游戏开发与空间计算等真实生产场景,据机构数据,全球3D生成式AI模型市场规模预计将从2025年的约18亿美元增长到2032年的75.9亿美元。场景级生成能否真正嵌入现有生产管线,将成为AI 3D玩家下一阶段的分水岭。
| 应用方向 | 核心能力 | 生态合作 |
|---|---|---|
| 具身智能仿真 | 单图重建可交互训练场景 | 地瓜机器人、谋先飞、NVIDIA Isaac Sim |
| 影视制作 | 3D导演台式可控调度 | Seedance 2.5等视频模型 |
| 游戏开发 | 独立资产直入实时引擎 | Unity中国、团结引擎 |
| 空间计算XR | 图片转可进入三维空间 | Apple Vision Pro等设备 |
从单个资产生成到完整场景生成,再到可运行、可编辑、可持续扩展的三维空间,3D生成的基本单位正在发生改变。当生成的场景能够承载内容、模拟现实、支持交互并连接不同产业,AI 3D的价值也将不再局限于提升建模效率,而可能成为连接数字内容、智能系统与现实空间的重要基础设施。
来源:网易智能、智东西、每日经济新闻
