(来源:科技行者)

这项由卢森堡大学自动化与机器人研究组(SnT)联合西班牙萨拉戈萨大学共同开展的研究,以预印本形式发布于2026年7月16日,论文编号为arXiv:2607.15058,研究受卢森堡国家研究基金DEUS项目资助。
**当机器人拿起一件东西之前,它需要先"看懂"这件东西**
不妨设想你是一位仓库工人,上级给了你一张椅子的示意图,然后让你在堆满货物的仓库里找到那把椅子,并把它精确地摆放到货架上——不仅要搞清楚椅子在哪儿、朝向哪边,还要搞明白它究竟有多大。这个任务听起来对人类来说并不困难,但对机器人或计算机视觉系统而言,却是一项极具挑战性的难题。
这正是"CAD模型与图像对齐"这一研究方向所要解决的核心问题。CAD模型可以理解成一种精确的三维数字蓝图,就像建筑师画的施工图纸。当系统拿到一张普通照片,它需要把这个三维蓝图"贴合"到照片里的对应物体上,弄清楚物体的旋转角度、所处位置以及实际尺寸——这三者合在一起,在技术上被称为"9D姿态估计",其中9个维度分别对应3个方向的旋转、3个方向的平移以及3个轴向的缩放比例。
这项能力一旦成熟,将直接赋能机器人抓取、增强现实叠加以及场景理解等大量实际应用。然而,现有方法普遍存在两个痛点:要么需要大量昂贵的人工标注数据来训练,泛化能力差;要么虽然不需要标注、能做到"零样本"对齐,却精度不足、速度太慢。
这支研究团队为此提出了一套名为**SUFLECA**(Scaling Up Feature LEarning for CAD-to-image Alignment,即"面向CAD对齐的特征学习规模化扩展")的新框架,并在核心评测基准上首次以零样本方法超越了有监督方法的精度,同时做到速度更快、显存占用更小。
一、从"认脸"到"认形":视觉特征学习的根本困境
要理解SUFLECA解决了什么问题,先要弄清楚现有方法为何会失败。
近年来,计算机视觉领域出现了一批被称为"视觉基础模型"的强大工具,它们经过海量图片训练,能够提取图像中的丰富语义特征。你可以把这类特征理解为一种"外貌描述"——比如"这个区域看起来像布料"、"那个角落颜色偏暖"、"这里的纹理很细密"。利用这种外貌描述,系统可以在CAD渲染图和真实照片之间寻找相似的区域,从而建立"对应关系"——即哪张图的哪个点对应另一张图的哪个点。
然而,"外貌描述"天然有个弱点:同一个物体在不同光线、不同遮挡、不同拍摄角度下,外貌会发生很大变化;而CAD渲染图作为干净的三维模型投影,和真实照片之间存在明显的风格差距,这就是所谓的"合成到真实域的鸿沟"。更根本的问题在于,外貌特征无法告诉系统一个表面点在三维空间里究竟位于哪个位置,而这恰恰是做姿态估计时最需要的信息。
研究者们此前已经尝试过一种补救方案,叫做"归一化物体坐标"(Normalized Object Coordinates,简称NOC)监督学习。NOC可以理解成给物体表面的每一个点贴上一个三维坐标标签——物体最左边的点标记为红色,最右边的点标记为青色,最高的点标记为亮色,最低的标记为暗色,诸如此类。通过教会模型预测这些坐标标签,模型就能在特征空间里建立起对三维几何的理解。
但问题是,之前采用这种思路的方法(如ZeroCAD)只在合成数据上训练,且只覆盖9个物体类别、约30万张图片,模型一旦碰到真实场景里有遮挡、有杂乱背景的物体,就会出现明显的精度下滑。此外,这些方法在建立对应关系时,采用的是简单的"最近邻匹配"——即找到特征最相似的点就配对——这种做法容易产生"一对多"的混乱匹配,几何上非常不一致,最后不得不依赖耗时的迭代优化来补救。
SUFLECA的两项核心贡献,分别针对上述两个痛点进行了根本性改进。
二、用67万张图片"磨练眼力":大规模几何感知特征学习
SUFLECA的第一项核心贡献,是将NOC监督特征学习的规模大幅扩展,从数据量、数据多样性和真实性三个维度同时发力。
研究团队汇聚了12个来源各异的数据集,包括室内场景扫描(ScanNet、ScanNet++)、移动端RGB-D采集(ARKitScenes)、网络视频帧(RealEstate10K)、合成渲染场景(3D-Front、Hypersim、ShapeNet),以及更传统的目标识别数据集(Pascal3D+、Pix3D、ObjectNet3D)等,总计形成约**67.5万张训练图像**,平均每张图含3.38个被标注的物体实例。这一规模比此前最强的同类方法大了约一倍,物体类别覆盖范围也远超以往。
更重要的是,这个数据集横跨真实图像和合成图像两个领域。由于CAD对齐任务本身就需要在真实照片和合成渲染之间建立桥梁,研究团队在每张有CAD标注的真实图像旁边,额外生成了一张对应的合成渲染图:把CAD模型以大致相同的角度渲染出来,配上随机化的背景和材质,偶尔还会把场景里的某个物体替换成外观相似但型号不同的版本。这样一来,模型在训练时就同时接触到"真实世界的杂乱感"和"合成图像的几何精确性",自然地学会跨域不变的几何感知特征。
并非所有数据集都直接提供现成的NOC标注图,大多数数据集只给出了三维场景中物体的位姿信息。研究团队因此设计了一套自动化的NOC推导流程:先把CAD模型按照已知位姿投影到图像上,大致确定物体位置,再用SAM2(一种强大的图像分割模型)精确提取物体掩码,然后利用深度图或单目深度估计把掩码内的像素反投影回三维空间,最后按照标准方法计算每个像素的归一化坐标。为了把质量差的标注过滤掉,团队还设置了验证步骤:将计算得到的NOC与CAD渲染的理论NOC进行对比,误差超过阈值的实例直接丢弃;可用标注像素太少的帧也整体舍弃。对于高帧率摄像机拍摄的视频数据集,还通过等间隔采样和最小相机位移约束来确保视角多样性。
在模型结构上,SUFLECA选择了DUNE-B作为冻结的感知编码器——这是一种经过大量异质数据预训练的通用视觉编码器,具有很强的基础特征提取能力。DUNE-B的多尺度输出特征通过一个"密集预测Transformer"(Dense Prediction Transformer,简称DPT)模块进行融合和上采样,产生与输入图像等分辨率的稠密特征图,每个像素对应一个384维的特征向量。在这个特征图之上,再接一个轻量级的"NOC分类头":将三维坐标空间的每个轴向分成64个均匀区间(称为"bin"),对每个像素预测它落在哪个区间,再以加权平均的方式还原出连续坐标值。训练损失由两部分组成:分类交叉熵损失(确保预测的区间是正确的)和L1回归损失(确保预测的连续坐标值足够精确)。
关键的设计在于:NOC分类头只在训练时使用,**推理时直接丢弃**。真正用于后续匹配的,是DPT输出的那个384维特征图,经过L2归一化后作为每个像素的"几何感知描述子"。通过NOC监督,这个特征空间被"塑形"成对三维几何敏感的形态,而同时保留了DPT特征本身的判别能力。研究团队还提供了一个名为SUFLECA-blend的变体,将DPT特征与DUNE-B主干网络的最后一层输出特征拼接,以在泛化能力和计算量之间取得不同的平衡。
三、像拼图高手一样找准对应:几何一致性匹配算法
光有好特征还不够,如何利用这些特征建立准确的对应关系,同样至关重要。SUFLECA的第二项核心贡献,是一套完整的几何一致性对应估计算法。
整体对齐流程可以分为以下几个环节,像一条精密的流水线依次运行。
首先,系统对输入的真实图像提取特征图,同时对候选CAD模型预先渲染若干个固定视角的视图(默认6个),并为每个视图预计算好特征图和三维点坐标。有了这批预渲染视图,系统面临的第一个问题是:从6个候选视角里,选哪个视角来做匹配最合适?研究者们发现,经过训练的视觉编码器其实能在特征层面隐式编码视角信息。于是,系统用单目深度估计把真实图像的掩码区域里的像素反投影成三维点云,从中用"最远点采样"(Farthest Point Sampling)挑出512个代表性点,然后对每个点去找6个候选视图里特征最相似的像素,把所有点的最大相似度取平均,得分最高的视图就被选为匹配对象。
选好视图之后,下一步是建立点对点的对应关系。普通的最近邻匹配会把真实图像里的每个点都找一个最相似的渲染图像点来配对,但这很容易让多个点都配到同一个目标点,造成"多对一"的混乱。SUFLECA采用的是**互相k近邻匹配**:只有当图像里的点A在渲染图里k个最近邻中找到了点B,同时渲染图里的点B在图像里k个最近邻中也找到了点A时,这对配对才被保留下来。当多个点同时认领同一个目标时,用贪心策略只保留相似度最高的那一对。这样得到的候选对应关系(称为"假设对应集")质量已经比单纯最近邻好很多,但仍然可能包含几何上不合理的匹配。
真正的精华在最后的**几何一致性筛选**这一步。研究者们设计了一套聪明的方法来判断哪些对应关系在三维几何上是自洽的。核心思路是:如果两对对应关系(A对应A',B对应B')都是正确的,那么A和B之间的三维距离,应该与A'和B'之间的三维距离满足一个由物体各向异性缩放比例决定的关系。换句话说,正确的对应关系应该"集体同意"一个统一的缩放参数,而错误的对应关系则会违背这个约束。
为了处理这个问题,研究团队先通过枚举所有候选对应对,计算每对的各向同性缩放比例对数值,取直方图的众数来得到一个鲁棒的初始等比缩放估计;再以此为基础,用迭代重加权最小二乘法(IRLS)细化出三个轴向可能各不相同的各向异性缩放估计,同时用一个系数α在各向异性估计和等比初始值之间做插值,防止样本不足时估计退化。有了这个缩放估计,就能对每一对候选对应计算"预测距离"和"观测距离"的相对偏差,将偏差小于阈值β的对应对在一个一致性矩阵里标记为互相支持。然后计算这个矩阵的主特征向量,每个候选对应关系在特征向量里的分量反映了它与多数"靠谱对应"的一致程度,低于阈值的对应关系被剔除,高于阈值的被保留下来传入后续的RANSAC注册求解器。
最终的三维配准步骤采用了一种支持各向异性缩放的普氏分析(Procrustes)算法,在空间分区RANSAC框架下鲁棒地求解旋转、平移和缩放参数。与此前方法不同的是,SUFLECA不把CAD检索的置信度分数作为对齐质量的代理指标,而是直接从配准残差的信息矩阵出发,计算对数行列式作为对齐质量得分。这个得分在多视角聚合或多检测非极大值抑制时用于排序,比语义检索置信度更能真实反映几何对齐的质量。
四、数字说话:在ScanNet25k上首次超越有监督方法
评测结果是这项研究最具说服力的部分。
核心评测基准ScanNet25k是从室内扫描数据集ScanNet中提炼出来的标准测试集,包含来自Scan2CAD标注的真实物体对齐任务,涵盖浴缸、床、垃圾桶、书架、柜子、椅子、显示器、沙发、桌子共9个类别。判定标准相当严格:平移误差须在20厘米以内,旋转误差须在20度以内,尺寸误差须在20%以内,三个条件同时满足才算正确。
在这个基准上,SUFLECA(基础版)以**33.4%的类别平均精度**和**42.3%的实例平均精度**排名第一,相比此前最强的零样本基线ZeroCAD(不含迭代优化版本)分别提升了10.3和12.2个百分点,相比ZeroCAD完整版(含迭代优化)也分别高出10.3和12.2个百分点。更引人注目的是,SUFLECA在9个类别里有7个达到了最高或次高精度,**整体精度首次超越了依赖9D位姿监督训练的有监督方法MultiObj-SPARC**,尽管后者在ScanNet上进行了充分的有监督训练。
在另一个分测试集DiffCAD split(包含6个类别,评测时不使用非极大值抑制)上,对零样本方法而言挑战更大,因为没有NMS来抑制错误对齐。SUFLECA在这个更严苛的设置下同样表现突出:类别平均精度达到36.1%,实例平均精度44.8%,比ZeroCAD分别高出20.2和23.9个百分点,甚至超过了DiffCAD论文中使用真实位姿选最优结果的"神谕版本"(oracle variant,类别均值35.8%,实例均值41.9%)。
更轻量的SUFLECA-S版本(使用更小的DUNE-S编码器,特征维度256)以30.6%/39.5%的精度同样大幅领先所有零样本基线,证明即便用更紧凑的模型,这套框架的核心优势依然成立。SUFLECA-blend版本在常见室内类别上的表现与基础版相当,但在应对不常见物体时具有更强的泛化能力。
五、在陌生物体上的泛化测试:CO3D数据集实验
为了检验SUFLECA对从未见过的物体类别是否依然有效,研究团队还在CO3D数据集上设计了一套更贴近真实使用场景的评测。
CO3D是一个以物体为中心的三维重建数据集,研究团队对其进行了适配:通过将COLMAP点云与单目深度估计对齐来恢复度量尺度,并在物体掩码内随机放置矩形遮挡块来模拟部分遮挡,CAD候选模型则通过SAM3D和OSCAR零样本检索获得。评测分为两组:**已见类别**(椅子、沙发,这两类在SUFLECA训练时出现过)和**未见类别**(烤面包机、吹风机、微波炉、行李箱,这四类训练时从未出现)。每类采样100帧图像,覆盖208个不同物体实例。
在已见类别上,SUFLECA三个变体的表现均显著优于对比方法:3D交并比达到62.6%左右,而DINOv3-L和DUNE-B基线分别只有36.2%和23.4%,Diorama达到39.4%。在更具挑战性的未见类别上,SUFLECA同样保持了相当的竞争力:基础版3D-IoU达到48.9%,SUFLECA-blend通过融合更通用的DUNE-B特征进一步提升到49.5%,Diorama以39.1%位居第二但在旋转精度上相对较好,而DINOv3-L和DUNE-B基线则因缺乏几何感知特征而表现很弱(8.8%和4.5%)。这组结果表明,SUFLECA学到的几何感知特征具有跨类别的迁移能力,即便面对训练时从未见过的物体,也能在有部分遮挡和检索不精确的条件下维持较好的三维对齐质量。
六、拆解每一块积木:消融实验的发现
研究团队还系统地测试了每个设计选择对最终性能的贡献,以确认没有哪个环节是"多余的装饰"。
关于训练数据:当把ScanNet相关数据(即与评测集来源相同的数据)重新纳入训练时,精度从33.4%/42.3%小幅提升到34.4%/42.8%。这个仅1个百分点的提升说明,即便在严格零样本设置下不使用任何与测试集同源的数据,SUFLECA的性能依然很强,多样化训练数据的覆盖范围已经提供了足够的泛化能力。
关于对应估计策略:若只用最简单的最近邻匹配,精度降至26.3%/34.2%,比完整版本低了7个百分点以上。加入互相一致性约束(变为互相最近邻匹配)可以提升到30.7%/39.4%,但仍有差距。进一步改用互相k近邻匹配则达到32.0%/41.0%,最后加上几何一致性筛选才达到最终的33.4%/42.3%。每一步改进都带来了实质提升,证明这套多层次的匹配策略各环节缺一不可。
关于NMS评分机制:如果用ROCA检索置信度代替SUFLECA自己的对齐质量得分来做NMS排序,精度降至30.4%/39.3%(下降3个百分点);如果用视角选择相似度得分来排序,则进一步降至29.2%/38.8%。这说明基于配准残差信息矩阵的对齐质量评分,是比语义检索置信度更可靠的筛选依据。
七、速度与内存:零样本方法中的效率冠军
SUFLECA的优势不只体现在精度上,在计算效率方面同样表现突出。
从GPU显存占用来看,SUFLECA基础版只需要2178 MB,是所有零样本对比方法里最低的(ZeroCAD代理实现需要约5000 MB,FoundationPose需要8544 MB)。特征维度384远低于ZeroCAD的2048,正是高效运行的关键之一。更轻量的SUFLECA-S版本显存占用进一步降至1556 MB,特征维度仅256。
从单实例处理时间来看,SUFLECA基础版每个物体实例只需0.53秒,SUFLECA-S更快至0.49秒,均比ZeroCAD(含迭代优化,约3.77秒)快了7倍以上,也比没有迭代优化的ZeroCAD代理版(1.30秒)快了一倍以上。研究团队还对SUFLECA内部各环节做了细分计时:特征提取86.6毫秒、视角选择43.1毫秒、对应估计与筛选68.7毫秒、RANSAC三维配准332.0毫秒。绝大部分时间花在RANSAC上,而RANSAC的迭代次数是可以直接调节的,这意味着使用者可以根据需要灵活地在速度和精度之间取得平衡。
八、真实部署时的软肋:CAD检索质量的制约
研究团队也坦诚地分析了整个系统的薄弱环节:CAD检索的质量对最终对齐精度有相当大的影响。
当使用Scan2CAD数据集提供的理想标注(即给出每个物体的正确CAD模型)时,SUFLECA的类别平均精度达到43.0%、实例平均精度54.2%;当使用有监督训练的ROCA检索器时(检索准确率34.3%),精度降至33.4%/42.3%;而当使用完全零样本的GroundedSAM+OSCAR检索时,由于检索准确率仅有3.8%(大量检索到的CAD模型与目标不匹配),精度进一步降至22.5%/33.1%。
有意思的是,从理想标注到有监督检索,检索准确率下降了约65个百分点,但对齐精度只下降了约9个百分点;而从有监督检索到零样本检索,检索准确率又下降了约30个百分点,对齐精度只下降了约11个百分点。这种"对齐精度的衰减远慢于检索准确率的衰减"的规律表明,SUFLECA对检索不精确的CAD模型具有一定的鲁棒性——即便拿到的CAD模型不是完全匹配的版本,它依然能找到有效的几何对应关系。不过,如何在真实世界的遮挡和外观变化下实现高质量的零样本CAD检索,依然是一个有待突破的开放问题。
说到底,SUFLECA这项工作做的事情可以用一句话概括:它教会了计算机用"几何眼光"而非"外貌眼光"去匹配物体。通过汇集12个跨领域数据集、用三维坐标标签塑造特征空间、再用一套严密的几何一致性筛选机制挑出可靠对应关系,这套系统在不需要任何位姿标注数据的情况下,精度首次超越了需要大量有监督训练的专用方法,同时做到了更快的速度和更低的显存消耗。
这对机器人领域来说意味着什么?它意味着机器人在面对陌生物体时,不再需要预先收集大量该物体的标注图像来训练,只要有一个粗略的三维模型,就能做到较为精准的位姿估计和抓取规划。对增强现实应用而言,这也意味着更低门槛的三维内容叠加能力。
当然,如研究团队自己指出的,目前这套系统还有两个明显局限:其一,整个流水线的上限仍然受CAD检索质量制约,在真实场景中零样本检索到精确匹配模型依然很难;其二,SUFLECA目前主要针对室内常见物体类别,户外场景和长尾类别的覆盖有待扩展。这两个方向,也自然地成为了下一步研究的路标。
对这个话题感兴趣的朋友,可以通过论文编号arXiv:2607.15058查阅完整论文,项目代码也已在GitHub上的snt-arg/SUFLECA仓库公开。
Q&A
Q1:SUFLECA是什么,和普通的物体姿态估计方法有什么区别?
A:SUFLECA是一种零样本的CAD模型与图像对齐方法,无需任何位姿标注数据就能估计物体的三维旋转、位移和尺寸。与普通方法相比,它通过在67万张真实和合成图像上学习几何感知特征,再配合几何一致性筛选算法,在不做迭代优化的情况下实现了更高精度和更低显存占用,是目前在ScanNet25k基准上首个超越有监督方法的零样本框架。
Q2:SUFLECA在实际机器人应用中能用吗,速度够快吗?
A:目前SUFLECA处理每个物体实例只需约0.53秒,显存占用约2178 MB,在零样本方法中效率最高,基本满足机器人实时感知的需求。不过,整个系统还依赖CAD检索等上游模块,在真实部署中如果CAD检索不准确,对齐精度会有明显下降,这是目前实际落地时需要注意的瓶颈。
Q3:SUFLECA对从未见过的物体类别也能用吗?
A:可以,但效果有所差异。在CO3D数据集的测试中,对于训练时从未出现的类别(如烤面包机、吹风机等),SUFLECA-blend变体的3D交并比达到约49.5%,仍然显著优于纯视觉基础模型的基线方法。主要原因是NOC监督学习到的几何感知特征具有跨类别迁移能力,但对更陌生的物体泛化能力会有一定下滑。



400-886-5570




