港科大携手华为诺亚提出AsySplat:3D场景重建速度提升近800倍,开启非对称计算新范式

👁️ 1708浏览 📅 2026-07-30

2026年7月28日,香港科技大学与华为诺亚方舟实验室联合团队发布了一篇重磅预印本论文,提出了名为AsySplat的3D场景重建框架。这项研究从一个极为简单的洞察出发——3D场景的几何信息和外观信息不需要被同等对待——却带来了令人瞩目的性能飞跃:在32张960P高清照片输入下,AsySplat比现有优化方法快近800倍,同时使用更少的参数就超越了当前最佳通用模型在零样本场景下的表现。本文将深入解析AsySplat的技术原理、创新价值以及对产业应用的潜在影响。

从"一刀切"到"因材施教":AsySplat的核心洞察

要理解AsySplat的创新之处,首先需要回顾当前主流的3D场景重建方法——3D高斯泼溅(3D Gaussian Splatting, 3DGS)。3DGS通过数百万个半透明的高斯椭球体来表征三维场景,每个高斯体携带位置、形状、颜色和不透明度等参数。当这些高斯体从任意新视角被渲染时,通过混合算法计算出对应视角下的图像。这种方法在效果上已经能媲美传统NeRF方法,但在处理长序列、高分辨率输入时,计算开销极其昂贵。

现有的通用化3DGS方法,包括AsySplat主要对标的最新方法LongLRM,采用的都是"一刀切"的处理策略:将所有输入图像切分为细粒度的图像碎片(patch),然后通过堆叠数十层Transformer让神经网络同时处理这些碎片之间的几何关系和外观关系。问题在于,这种方法把有限的计算资源平等地分配给了两个难度完全不同的任务。

研究团队通过细致观察发现了两条关键事实。第一,精确的三维几何重建并非高质量新视角合成的必要条件。换言之,要生成一张"看起来真实"的新视角图像,并不需要计算机精确知道每个表面点的三维坐标,只需要外观信息足够充分即可。第二,外观信息(颜色、纹理、光照)的学习难度通常远低于几何结构的恢复。基于这两个洞察,AsySplat提出将几何建模和外观建模解耦为两条独立但协同的支路,为不同的子任务分配不同粒度的计算资源——这正是"AsySplat"中"Asymmetric"(非对称)一词的由来。

非对称双支路架构:几何粗粒度、外观细粒度

AsySplat的核心架构由三条关键组件构成。第一条是几何支路,负责从多个视角的照片中恢复场景的三维结构。这条支路处理的是粗粒度的图像特征令牌,并且集中了模型中的大部分参数。研究团队的解释是:几何恢复本质上是高维空间中的一种"推理"任务,需要在不同视角之间进行匹配和三角测量,因此需要更强的模型容量来处理多视角之间的对应关系。

第二条是外观支路,负责捕捉场景中每个位置的视觉细节——颜色、纹理、光泽等。这条支路处理的是细粒度的特征令牌,但使用的参数数量显著少于几何支路。这是因为外观信息的本质是"感知"而非"推理":模型只需要学习从三维位置到颜色值的映射关系,而这个映射在局部空间中是相对平滑的,不需要跨视角的长程推理能力。

第三条是关键的双向连接机制。几何支路和外观支路并非完全独立工作,而是通过双向连接层相互交互。几何支路将恢复出的场景结构信息传递给外观支路,帮助外观支路更准确地定位每个高斯体在物理空间中的位置;与此同时,外观支路也将细粒度的视觉特征反馈给几何支路,辅助几何支路在精细结构区域做出更准确的判断。这种双向引导机制确保了两条支路之间的信息不会割裂,同时避免了重复计算。

性能飞跃:近800倍加速与零样本超越

实验结果表明,AsySplat在多项指标上实现了质的飞跃。在32张960P分辨率输入的标准评测基准上,AsySplat达到了与逐场景优化方法(per-scene optimization)相当的渲染质量,但速度提升了整整两个数量级——接近800倍。与此同时,该模型使用的参数量远少于当前最优通用模型,且在零样本(zero-shot)场景下(即模型没有针对特定场景进行任何微调),其表现超越了所有现有通用化方法。

更具体的量化数据包括:在PSNR峰值信噪比和SSIM结构相似性这两项核心图像质量指标上,AsySplat匹配甚至超越了优化式的3DGS方法;在LPIPS感知相似度指标上(更贴近人类视觉感知),AsySplat表现优于所有对比方法。在训练效率方面,AsySplat的训练时间相比LongLRM减少了约60%,显存占用降低了约50%,使得原来需要8张高端GPU才能完成的长序列场景重建任务,现在可以在一张消费级显卡上完成。

研究团队还展示了AsySplat在多个真实场景中的重建效果。无论是大规模室内场景(如会议室、长廊)、户外场景(如建筑立面、街区),还是动态场景中的人体运动,AsySplat均能稳定生成清晰流畅的新视角视频。与传统方法在边缘区域容易出现模糊或伪影不同,AsySplat在外观支路的细粒度表征加持下,对纹理细节的还原度明显更优。

产业意义:从实验室到工程部署的可行路径

AsySplat的发布并非一次单纯的学术突破,它对准的是3D视觉技术在实际落地中的核心痛点——计算效率。新视角合成技术是虚拟现实、增强现实、数字孪生、自动驾驶和影视制作等领域的底层基础设施。以数字孪生为例,工业场景中需要频繁采集和更新大规模厂区、生产线的三维模型,如果每次重建都需要数小时甚至数天的计算时间,就丧失了实用价值。AsySplat将重建效率提升至接近实时水平,为数字孪生系统的自动化和常态化更新提供了可能。

在自动驾驶领域,高精地图的构建和更新同样依赖于高效的3D场景重建能力。当前的自动驾驶车队每天采集数十TB级别的视觉数据,传统优化方法的计算量使得全量重建几乎不可行。AsySplat的近800倍加速意味着,原本需要集群服务器运行数小时的任务,现在可以在车载边缘计算平台上分钟内完成,这为自动驾驶地图的快速迭代提供了技术基础。

对于消费级应用而言,AsySplat的低资源消耗特性意味着更低的硬件门槛。随着高通骁龙、苹果M系列芯片对神经网络加速的支持日益成熟,未来智能手机和AR眼镜完全有可能在端侧实时完成3D场景重建,从而催生一批全新的AR交互应用——例如"随手一拍生成房间3D模型""实时扫描叠加虚拟家具"等场景将从科幻走进现实。

研究背景与展望

AsySplat由香港科技大学计算机科学系博士生钟英骥(Yingji Zhong)领衔,联合华为诺亚方舟实验室的陈振宇、欧福昭、陈有宇、李志豪、洪兰晴以及香港城市大学的Dan Xu教授共同完成。该论文以arXiv:2607.10995号预印本形式于2026年7月13日公开发布,项目主页和代码也已同步开放。

在更广阔的学术背景下,AsySplat属于近年来"通用化3D高斯泼溅"研究浪潮的一部分。同类工作包括LongSplat、FreeSplat等方法,都在尝试解决长序列场景建模中的计算冗余问题。AsySplat的核心贡献在于提出了一个最简单的解决思路——既然几何和外观的难度不同,就不要用相同的计算量去处理它们。这种"非对称计算分配"的思路有望在更广泛的AI应用中得到借鉴,例如多模态学习中不同模态的信息处理、大规模语言模型中注意力头的差异化设计等。

研究团队表示,下一步的工作方向包括:进一步压缩模型体积以适应移动端部署、引入时序维度支持动态场景的实时重建、以及探索与NeRF等互补表示的融合方法。可以预见,AsySplat的出现将加速3D视觉技术从学术研究向大规模工程应用的转化进程。

总结

AsySplat以一项看似简单却极其深刻的洞察——几何和外观不需要同样的计算预算——实现了3D场景重建效率的数量级提升。近800倍的加速、减半的计算量、零样本超越现有最优方法的综合表现,使这项研究成为2026年3D视觉领域最具工程价值的重要成果之一。对于正在加速落地的数字孪生、自动驾驶、AR/VR等产业而言,AsySplat提供了一条从实验室走向大规模部署的可行路径。

来源:arXiv、香港科技大学、华为诺亚方舟实验室、腾讯新闻

📚 想系统学习AI建模+3D打印?

18节实战课程,从想法到实物全流程跑通,零基础也能轻松学会!

立即学习 →