微软研究院联合清华大学开源发布的大模型TRELLIS.2,正成为AI 3D生成领域最受关注的基础模型。这款40亿参数的模型能从单张图片在约60秒内生成最高1536³分辨率、带完整PBR材质的3D资产,并以MIT协议开放全部模型权重与训练代码。它不仅解决了此前3D生成在拓扑表示上的根本性瓶颈,还让游戏、机器人仿真、工业设计等场景的资产生产从「数小时人工」迈向「分钟级自动」。本文深入解析TRELLIS.2的技术内核与行业影响。
一、从TRELLIS到TRELLIS.2:一场3D表示的底层革命
TRELLIS是微软研究院2024年末发布的结构化3D潜空间生成模型,入选CVPR 2025 Spotlight,在GitHub上积累了超过1.3万颗星,是图像转3D领域最成功的开源项目之一。2025年11月,微软研究院与清华大学合作的续作TRELLIS.2正式开源,论文《TRELLIS.2: Native and Compact Structured Latents for 3D Generation》发布于arXiv,编号2512.14692,并入选CVPR 2026最佳学生论文,成为该会议在3D生成方向最具分量的研究成果之一。
与通常理解的「模型迭代」不同,TRELLIS.2的核心改变在于3D表示方式:从「有场」的等值面结构,换成「无场」的O-Voxel稀疏体素。清华大学智能产业研究院助理教授赵昊评价称,TRELLIS.2从原生三维数据中学习结构化的隐式表征,解决了原生3D Token的问题,其中O-Voxel表征不仅包含几何信息,还包含透明度、粗糙度、金属感与基础颜色等全部光学属性。这不是参数更大的同一个模型,而是底层表示范式的全面升级。
二、O-Voxel:绕开等值面瓶颈的新范式
传统3D生成(包括原版TRELLIS)普遍采用有符号距离场、占用场或Flexicubes作为表示,再用Marching Cubes等方法提取网格。这套流程存在一个根本性限制:等值面只能提取封闭、可定向、流形的曲面。然而现实中的物体往往并非如此:衣物、叶片、薄壳等开放表面在Marching Cubes处理后漏洞百出;铁丝网、网格结构等非流形几何完全无法正确表示;箱子里的物品这类内部封闭结构更会被直接丢弃,生成的模型名不副实。
O-Voxel绕开了这一问题:它不生成场,而是直接生成稀疏体素网格,每个体素同时携带几何与材质属性。具体而言,几何参数采用双网格结构,既保留尖锐特征又能处理任意拓扑;外观参数则完整覆盖基础色、金属度、粗糙度与透明度四项PBR属性,支持任意光照下的真实感渲染。输出时直接转换导出,没有有损的等值面提取步骤,从而能够稳定生成布料、叶片、带内部空腔的机械零件等复杂结构。O-Voxel还支持网格与体素的双向即时转换,网格转体素在单CPU上即可完成,为后续处理流程提供了极大便利。
三、SC-VAE压缩与生成速度:60秒产出1536³完整资产
支撑O-Voxel高效运作的,是配套研发的稀疏压缩自编码器SC-VAE。这是一个全卷积稀疏网络,实现了16倍的空间压缩比:一个带完整纹理的1024³分辨率资产,平均只需约9600个潜空间token,且重建保真度损失可忽略。这一设计取代了原版TRELLIS基于flow-transformer的方案,采用残差自编码机制并引入非参数残差捷径,缓解了极端压缩比下的优化难题,同时通过自定义Triton内核(FlexGEMM后端)保证稀疏卷积的高性能,已在NVIDIA A100与H100上验证。
在生成速度上,TRELLIS.2交出了极具竞争力的成绩单,以下为H100单卡测试数据。
| 输出分辨率 | 总耗时 | 形状生成 | 材质生成 |
|---|---|---|---|
| 512³ | 约3秒 | 2秒 | 1秒 |
| 1024³ | 约17秒 | 10秒 | 7秒 |
| 1536³ | 约60秒 | 35秒 | 25秒 |
512³分辨率下3秒出图的速度已足以支持交互式工作流,设计师可以像调参一样反复尝试造型;而1536³下60秒产出一个带完整PBR材质的资产,相比传统人工建模动辄数小时的工作量堪称质变。生成链路采用三阶段流匹配,稀疏结构流、形状流与材质流在大模型上仅对活跃token生成紧凑潜变量,再一次性解码成高分辨率几何与材质,兼顾了质量与效率。
四、训练代码全开:从通用模型到垂直领域微调
TRELLIS.2最具颠覆性的意义在于开源程度。它以MIT协议发布,允许商业使用、修改与再分发且无授权费用,模型权重托管于Hugging Face,GitHub仓库获得超过1万颗星。更关键的是,团队完整开放了训练流水线:数据预处理工具包可将原始3D资产转换为O-Voxel格式,SC-VAE训练(形状与材质各一个)、流模型训练(稀疏结构流、形状流、材质流)以及512到1024的高分辨率微调脚本全部公开,训练数据基于Objaverse-XL(Sketchfab子集)。
这意味着开发者可以用私有3D资产数据集微调出垂直领域模型,无论是游戏资产、工业零件还是家具模型,都能获得针对性的生成能力。社区生态同样迅速跟进: ComfyUI 封装让用户可以直接拖拽工作流,Docker方案简化部署,Hugging Face Spaces提供在线试用,甚至已有开发者通过PyTorch MPS与MLX将模型移植到苹果M系列芯片上本地运行,摆脱了对NVIDIA显卡的依赖,进一步降低了使用门槛。
五、行业影响:AI 3D生成的「基础设施时刻」
TRELLIS.2带来的行业影响是多层次的。对机器人训练与仿真而言,此前构建仿真环境的瓶颈从来不只是算力,而是用多样化、高保真的3D资产填充环境的成本与延迟,如今单图60秒生成资产的能力,从根本上改变了环境构建的经济性。对游戏与空间计算而言,程序化生成物理准确的3D资产,意味着世界构建从「人工逐个建模」转向「按需即时生成」。对工业设计而言,MIT协议与全量训练代码开放,让企业可以把模型嵌入自有工具链,微调后直接部署到生产流程。
当然,TRELLIS.2仍非万能。当前实现仅在NVIDIA A100与H100上验证,消费级GPU的门槛有待社区量化等手段进一步降低;1536³的分辨率上限也带来下游网格优化的课题。但方向上,它已经证明了AI 3D生成能够同时满足拓扑自由、材质完整、潜空间紧凑与生成可扩展四大要求,为整个行业树立了新的基准。可以说,TRELLIS.2正在书写AI 3D生成的「Linux时刻」,开源的力量将让这一技术以远超想象的速度渗透进每一个需要3D资产的角落。
总结:微软TRELLIS.2以40亿参数与O-Voxel无场稀疏体素范式,实现了单图60秒生成1536³高保真3D资产,突破传统等值面表示的拓扑瓶颈,并以MIT协议全量开源。从机器人仿真到游戏开发,这一模型正把3D资产的生产成本压缩到分钟级,为AI 3D生成的规模化落地奠定了基础设施。
来源:The Agent Times、DeepTech、博客园
