Hana's Blog
Robotic Grasp Detection (7): 不完整几何与主动感知Blur image

抓取需要接触不可见区域(Grasping Requires Hidden Contact Geometry)#

单视角红绿蓝—深度观测(Red–Green–Blue and Depth, RGB-D)只测到朝向相机的表面。平行夹爪(Parallel-Jaw Gripper)的两个夹指需要在物体两侧形成接触,其中一侧可能被自遮挡(Self-Occlusion)或其他物体遮挡(Inter-Object Occlusion)。因此,抓取检测器面对的输入不是完整物体,而是带有系统性缺失的几何观测。

设真实表面为 S⊂R3S\subset\mathbb R^3,观测点云为 Pobs⊂R3P_{\text{obs}}\subset\mathbb R^3,则单视角观测可以写成:

Pobs⊂S.P_{\text{obs}} \subset S.

缺失几何不是普通随机噪声。它与视角、材质、遮挡关系和传感器原理相关:

  • 背面因为视线不可达而缺失;
  • 透明或反光表面因为深度测量失效而缺失;
  • 薄结构和远距离小物体因分辨率不足而稀疏;
  • 杂乱场景中的接触区域可能完全不可见。

处理这类输入有两条路线:在固定观测下推断隐藏几何,或者移动传感器获取新的观测。前者对应形状补全和隐式重建,后者对应多视角融合和主动感知。

方法路线总览(Overview of Method Families)#

下表先给出各类方法的输入、输出和典型抓取接口。后文再解释每种表示如何训练,以及它怎样进入抓取候选生成和排序。

方法路线主要输入主要输出典型代表抓取接口
点云补全(Point Completion)单视角点云补全点集或完整点表示Beyond Top-Grasps、CompletePoints、PCF-Grasp在补全几何上生成或评分 6-DoF 抓取
隐式联合重建(Implicit Reconstruction)RGB-D / 物体裁剪Occupancy、SDF 或抓取场CenterGrasp、Local Occupancy-Enhanced Grasping查询局部几何并解码抓取
神经渲染(Neural Rendering)多视角 RGB / RGB-D辐射场、表面和三维特征GraspNeRF、Any-View从三维表示生成或优化抓取
主动视角规划(Active View Planning)当前观测与候选视角下一相机位姿和更新观测VISO-Grasp、Cross-View Fusion以抓取收益选择下一视角
不确定性传播(Uncertainty Propagation)多个几何假设或模型预测抓取质量分布和碰撞概率采样式补全、网络集成对候选执行风险感知排序

场景与点云补全(Scene and Point-Cloud Completion)#

形状补全(Shape Completion)学习条件分布:

p(Shidden∣Pobs),Shidden⊂R3.p(S_{\text{hidden}}\mid P_{\text{obs}}), \qquad S_{\text{hidden}}\subset\mathbb R^3.

实际系统通常先输出一个确定性补全结果 S^\hat S,再把它送入抓取检测器。Beyond Top-Grasps Through Scene Completion 使用场景补全支持非顶抓姿态 [1];CompletePoints 通过模拟完整点表示改善单视角六自由度(Six Degrees of Freedom, 6-DoF)检测 [2]。

补全表示决定了训练目标和后端如何查询几何,常见形式有点集、占据场和符号距离场。

**点集补全(Point-Set Completion)**直接预测点集 P^⊂R3\hat P\subset\mathbb R^3。给定完整点集 P∗⊂R3P^*\subset\mathbb R^3,常用双向倒角距离(Chamfer Distance, CD)为:

LCD=1∣P^∣∑x∈P^min⁡y∈P∗∥x−y∥22+1∣P∗∣∑y∈P∗min⁡x∈P^∥y−x∥22.\mathcal L_{\text{CD}}= \frac{1}{|\hat P|}\sum_{x\in\hat P}\min_{y\in P^*}\lVert x-y\rVert_2^2 +\frac{1}{|P^*|}\sum_{y\in P^*}\min_{x\in\hat P}\lVert y-x\rVert_2^2.

第一项让预测点靠近真实表面,第二项让预测点覆盖真实点集。训练时,网络编码 PobsP_{\text{obs}},解码器逐步生成缺失点或完整点集;推理时,补全点与观测点合并,再进入法线估计、候选生成和碰撞检测。CD 只比较点到点的距离,因此工程实现通常还会关注法线、薄结构和夹爪闭合区域的局部几何。

**占据场(Occupancy Field)**对查询点 x∈R3x\in\mathbb R^3 和观测编码 z∈Rdz\in\mathbb R^d 输出占据概率 oθ(x,z)∈[0,1]o_\theta(x,z)\in[0,1]。训练样本由空间查询点和内外标签组成,二元交叉熵(Binary Cross-Entropy, BCE)可以写成:

Locc=−1K∑k=1K[yklog⁡oθ(xk,z)+(1−yk)log⁡(1−oθ(xk,z))],\mathcal L_{\text{occ}} =-\frac{1}{K}\sum_{k=1}^{K} \left[y_k\log o_\theta(x_k,z) +(1-y_k)\log(1-o_\theta(x_k,z))\right],

其中 KK 是查询点数量,xk∈R3x_k\in\mathbb R^3,yk∈{0,1}y_k\in\{0,1\} 表示该点位于物体内部还是外部。推理时,在三维网格上查询 oθo_\theta,再用阈值提取表面;在接触区域直接查询占据值,则可以判断夹爪指尖或闭合通道是否进入物体内部。训练查询点不能全部均匀采样,因为大多数点会远离表面,通常还要加入表面附近的扰动点。**截断符号距离场(Truncated Signed Distance Field, TSDF)**则为每个查询点提供到表面的有符号距离,适合碰撞检查和梯度优化。

点集补全的后端处理通常可以分成四步:

  1. 将观测点与补全点变换到同一坐标系;
  2. 从表面法线、局部邻域或隐式场查询中生成抓取候选;
  3. 在夹爪闭合区域和接近通道中执行碰撞检查;
  4. 用抓取质量、碰撞结果和机器人可达性对候选排序。

PCF-Grasp 将点云补全结果转换为几何特征,作为 6-DoF 抓取检测器的辅助输入,而不是直接把补全点作为唯一几何来源 [6]。这类接口让网络同时利用观测几何和补全先验。


联合重建与抓取(Joint Reconstruction and Grasping)#

CenterGrasp 使用对象中心隐式表示(Object-Centric Implicit Representation)同时进行形状重建和六自由度抓取估计 [3]。它先从 RGB-D 观测中提取对象级特征,再在对象坐标系中查询几何和抓取相关信息。

可以用下面的抽象形式理解这类网络:

fθ(x,z)→(oθ(x,z),dθ(x,z),hθ(x,z)),f_\theta(x,z)\rightarrow (o_\theta(x,z),d_\theta(x,z),h_\theta(x,z)),

其中 x∈R3x\in\mathbb R^3 是对象坐标系中的查询位置,z∈Rdz\in\mathbb R^d 是观测编码,oθo_\theta 是占据预测,dθd_\theta 是距离或表面相关量,hθh_\theta 是用于抓取预测的局部特征。抓取姿态仍可统一写为 g=(R,t,w)g=(R,\boldsymbol t,w),其中 R∈SO(3)R\in SO(3)、t∈R3\boldsymbol t\in\mathbb R^3,w∈R≥0w\in\mathbb R_{\geq0} 分别表示夹爪旋转、位置和开口宽度。

连续隐式表示的推理过程是:估计对象坐标系,在三维查询点上计算占据和特征,再从高响应区域解码 gg,最后进行碰撞与可达性检查。它不需要把完整物体固定成相同数量的点,但查询分辨率和对象坐标估计会直接影响候选质量。

Local Occupancy-Enhanced Grasping 使用多平面投影(Multiple Triplanar Projection)编码局部占据几何 [7]。三张相互正交的二维特征平面分别存储局部空间信息,查询点投影到各平面后取样并融合特征,再预测抓取。相比直接在稀疏点上回归,它为接触区域提供了连续局部表示;全局场景关系仍由前端分割、坐标变换和后端碰撞检查处理。


神经渲染与多视角几何(Neural Rendering and Multi-View Geometry)#

神经辐射场(Neural Radiance Field, NeRF)和相关神经表面表示可以融合多张 RGB 图像,从不同视角恢复几何与外观。GraspNeRF 使用可泛化 NeRF 处理透明和高反光物体的多视角六自由度抓取 [4]。

NeRF 沿相机射线查询场函数。设射线原点 o∈R3o\in\mathbb R^3,单位方向 d∈R3d\in\mathbb R^3,则 r(t)=o+tdr(t)=o+td;在采样位置 tit_i 处,网络输出密度 σi∈R≥0\sigma_i\in\mathbb R_{\geq0} 和颜色 ci∈R3c_i\in\mathbb R^3。离散体渲染(Volume Rendering)为:

C^(r)=∑iTiαici,Ti=∏j<i(1−αj),αi=1−e−σiδi.\hat C(r)=\sum_i T_i\alpha_i c_i, \qquad T_i=\prod_{j<i}(1-\alpha_j), \qquad \alpha_i=1-e^{-\sigma_i\delta_i}.

其中 δi=ti+1−ti\delta_i=t_{i+1}-t_i 是相邻采样点的距离,TiT_i 是光线到达第 ii 个采样点时仍未被吸收的透射率,αi\alpha_i 是该区间的不透明度。期望深度可写成 D^(r)=∑iTiαiti\hat D(r)=\sum_iT_i\alpha_i t_i。抓取系统通常从密度场提取网格或点云,也可以直接读取三维特征来评价候选。实际解码时还要进行尺度标定、表面阈值选择和夹爪碰撞检查。

Any-View 6DoF Grasping 通过神经表面渲染,使模型能够从不同观察视角推断抓取 [5]。NeRF Grasp Pose Optimization 则利用 NeRF 特征评价和优化已有候选 [8]。

多视角抓取的实现通常包含以下环节:

  1. 通过相机外参标定(Extrinsic Calibration)将各视角变换到统一坐标系;
  2. 编码每张图像并聚合跨视角特征;
  3. 由聚合特征预测密度、表面或三维抓取特征;
  4. 提取候选抓取 g=(R,t,w)g=(R,\boldsymbol t,w),执行碰撞过滤和机器人可达性检查。

You Only Scan Once 面向动态场景构建一次扫描与重建流水线,再生成六自由度抓取 [9];这类方法还需要在扫描期间维护相机、物体和机器人之间的时空关系。


透明与高反光物体(Transparent and Specular Objects)#

普通结构光或双目深度相机可能在玻璃、透明塑料和高反光金属上产生孔洞或错误深度。此时物体在 RGB 中可见,但深度图中缺少稳定的接触表面。

主动立体(Active Stereo)相机投射红外纹理并通过左右图匹配估计视差。设焦距为 ff、双目基线为 bb、视差为 dd,相机坐标系中的深度近似为:

z=fbd,f,b,d,z∈R>0.z=\frac{fb}{d}, \qquad f,b,d,z\in\mathbb R_{>0}.

透明表面会折射投影纹理,使匹配位置不再对应同一物理表面;高反光表面则可能造成饱和或错误匹配。因此,透明物体方法通常结合 RGB 轮廓、多视角一致性、主动照明或神经渲染来恢复几何。

这类实验需要同时记录:

  • 光照与背景;
  • 相机类型和主动投射设置;
  • 视角数量;
  • 重建误差与抓取成功分别如何测量;
  • 方法在普通不透明物体上的表现。

透明性改变的是观测模型(Observation Model):同一个抓取检测器在输入端接收到的深度证据不同。GraspNeRF 通过多视角神经渲染恢复透明/高反光几何 [4];ASGrasp 使用 RGB-D 主动立体相机(Active Stereo Camera)进行可泛化透明物体重建和抓取 [10]。


主动视角选择(Active View Selection)#

形状补全在固定观测下推断隐藏几何;主动感知(Active Perception)通过相机或机器人动作获得新证据。设历史观测为 HtH_t,候选相机位姿为 v∈Vv\in\mathcal V,新观测为 ot+1(v)o_{t+1}(v),主动策略可以选择最大化预期抓取收益的视角:

v∗=arg⁡max⁡vE[U(G∣Ht,ot+1(v))−C(v)],v^*=\arg\max_v \mathbb{E}\left[U(G\mid H_t,o_{t+1}(v))-C(v)\right],

其中 UU 是观测更新后的抓取效用,C(v)C(v) 是移动时间、路径长度和碰撞风险组成的成本。

下一最佳视角(Next-Best View, NBV)的目标是减少抓取相关的不确定性,例如暴露目标把手、被遮挡接触面或夹爪接近通道。实际系统通常从有限位姿集合 V\mathcal V 中选择视角,并在评分前删除机器人不可达或相机将与场景碰撞的位姿。

设 ZZ 表示待估计的三维占据状态,H(⋅)H(\cdot) 表示其熵。对每个 v∈Vv\in\mathcal V,可以用当前占据模型预测新观测带来的信息增益(Information Gain, IG):

IG⁡(v)=H(Z∣Ht)−Eot+1∼p(o∣v,Ht)[H(Z∣Ht,ot+1)].\operatorname{IG}(v)= H(Z\mid H_t)- \mathbb E_{o_{t+1}\sim p(o\mid v,H_t)} [H(Z\mid H_t,o_{t+1})].

抓取相关策略可以只统计候选接触区和接近通道内的熵,或者直接估计观测后最高可行抓取分数的提升。一个具体的视角效用为:

J(v)=IG⁡(v)−λtT(v)−λmCmotion(v),J(v)=\operatorname{IG}(v)-\lambda_tT(v)-\lambda_mC_{\text{motion}}(v),

其中 T(v)T(v) 是预计采集时间,Cmotion(v)C_{\text{motion}}(v) 是机器人运动成本,λt,λm≥0\lambda_t,\lambda_m\geq0 是权重。

Algorithm 1 不完整几何下的主动抓取流程
输入:
当前 RGB-D 观测、候选视角集合、几何重建模型、抓取检测器和机器人运动模型
输出:
最终抓取姿态,或下一步需要获取的相机视角
  1. require

    初始化历史观测 HtH_t 和待评估视角集合 V\mathcal V

  2. for 在当前观测历史下循环
  3. 估计可见几何、补全几何及其不确定性
  4. 生成抓取候选,并计算抓取质量、碰撞概率和机器人可达性
  5. 若存在满足执行约束的候选,则返回质量最高的抓取
  6. 否则,计算每个可行视角的预期信息增益、抓取收益和运动成本
  7. 选择效用最高的视角,获取新观测并更新 HtH_t
  8. end for 直到返回抓取或达到观测预算
  9. return 最终抓取姿态或失败状态

VISO-Grasp 将视觉语言目标、对象中心空间表示、主动视角规划和六自由度抓取结合起来,用于杂乱与不可见目标 [11]。Cross-View Fusion 则通过跨视角融合增强姿态估计,目前仍是 arXiv 预印本 [12]。


不确定性应当传递到候选(Propagating Uncertainty to Grasps)#

补全和主动观测都会改变后端候选的置信度。需要分别考虑:

  • 传感器噪声(Sensor Noise);
  • 未观测区域的不确定性(Occlusion Uncertainty);
  • 补全模型不确定性(Model Uncertainty);
  • 多视角标定误差(Calibration Error);
  • 执行过程中的姿态误差(Execution Error)。

如果多个隐藏形状都合理,可以保留多个几何假设,并将每个假设分别送入抓取评分和碰撞检测。

设补全模型产生 MM 个表面样本 {S^m}m=1M\{\hat S_m\}_{m=1}^{M},同一候选抓取为 g=(R,t,w)g=(R,\boldsymbol t,w)。分别计算质量与碰撞,再得到期望质量和碰撞概率:

qˉ(g)=1M∑m=1Mq(g;S^m),pcoll(g)=1M∑m=1M1[collision⁡(g,S^m)].\bar q(g)=\frac{1}{M}\sum_{m=1}^{M}q(g;\hat S_m), \qquad p_{\text{coll}}(g)=\frac{1}{M}\sum_{m=1}^{M} \mathbf 1[\operatorname{collision}(g,\hat S_m)].

选择时可以要求 pcoll(g)<δp_{\text{coll}}(g)<\delta,再按 qˉ(g)\bar q(g) 排序。样本可以来自显式生成模型、网络集成(Deep Ensemble)或测试时随机失活(Monte Carlo Dropout)。这样,隐藏表面改变的不只是网络分数,也会反映在候选的碰撞统计中。

方法如何进入抓取系统(Methods in the Grasping Pipeline)#

方法观测策略几何表示抓取接口主要计算
Beyond Top-Grasps单视角场景补全非顶向抓取候选补全 + 抓取规划
CompletePoints单视角完整点表示6-DoF 检测器模拟完整点 + 检测
CenterGrasp单视角 RGB-D对象中心隐式场6-DoF 抓取估计重建 + 抓取联合学习
GraspNeRF多视角 RGB可泛化 NeRF透明/高反光物体抓取神经渲染 + 几何查询
Any-View 6DoF多视角神经表面表示6-DoF 抓取跨视角融合 + 解码
ASGraspRGB-D 主动立体透明物体重建6-DoF 抓取主动立体 + 重建
VISO-Grasp腕部 RGB-D + 语言对象中心空间表示目标条件抓取视角规划 + 抓取检测
PCF-Grasp单视角点云补全几何特征6-DoF 抓取补全特征 + 检测器

从系统角度看,方法的差别可以归结为两个接口:它是改变几何输入,还是改变观测过程;它是直接生成抓取,还是为抓取检测器提供特征和候选。评价时应同时记录观测数量、重建/检测耗时、有效候选覆盖率、碰撞过滤后的候选数和最终执行成功率。


参考文献(References)#

  1. J. Lundell, F. Verdoja, and V. Kyrki, “Beyond Top-Grasps through Scene Completion,” 2020 IEEE International Conference on Robotics and Automation, 2020. DOI ↗
  2. Z. Liu, Z. Chen, and W.-S. Zheng, “Simulating Complete Points Representations for Single-View 6-DoF Grasp Detection,” IEEE Robotics and Automation Letters, 2024. DOI ↗
  3. E. Chisari, N. Heppert, T. Welschehold, W. Burgard, and A. Valada, “CenterGrasp: Object-Aware Implicit Representation Learning for Simultaneous Shape Reconstruction and 6-DoF Grasp Estimation,” IEEE Robotics and Automation Letters, 2024. DOI ↗
  4. Q. Dai et al., “GraspNeRF: Multiview-Based 6-DoF Grasp Detection for Transparent and Specular Objects Using Generalizable NeRF,” 2023 IEEE International Conference on Robotics and Automation, 2023. DOI ↗
  5. S. Jauhri, I. Lunawat, and G. Chalvatzaki, “Learning Any-View 6DoF Robotic Grasping in Cluttered Scenes via Neural Surface Rendering,” Robotics: Science and Systems XX, 2024. DOI ↗
  6. Y. Cheng et al., “PCF-Grasp: Converting Point Completion to Geometry Feature to Enhance 6-DoF Grasp,” IEEE Transactions on Systems, Man, and Cybernetics: Systems, 2025. DOI ↗
  7. K. Ma, H. Dong, and Y. Mu, “Local Occupancy-Enhanced Object Grasping with Multiple Triplanar Projection,” Computer Vision – ECCV 2024, 2024. DOI ↗
  8. G. Soti, X. Huang, C. Wurll, and B. Hein, “6-DoF Grasp Pose Evaluation and Optimization via Transfer Learning from NeRFs,” 2024 IEEE International Conference on Robotics and Automation, 2024. DOI ↗
  9. L. Zhou et al., “You Only Scan Once: A Dynamic Scene Reconstruction Pipeline for 6-DoF Robotic Grasping of Novel Objects,” 2024 IEEE International Conference on Robotics and Automation, 2024. DOI ↗
  10. J. Shi et al., “ASGrasp: Generalizable Transparent Object Reconstruction and 6-DoF Grasp Detection from RGB-D Active Stereo Camera,” 2024 IEEE International Conference on Robotics and Automation, 2024. DOI ↗
  11. Y. Shi et al., “VISO-Grasp: Vision-Language Informed Spatial Object-Centric 6-DoF Active View Planning and Grasping in Clutter and Invisibility,” 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2025. DOI ↗
  12. K. Zhu, H. Jiang, J. Qian, and J. Xie, “A Cross-View Fusion Framework for Robust 6-DoF Grasp Pose Estimation,” arXiv preprint arXiv:2606.06878, 2026. arXiv ↗
Robotic Grasp Detection (7): 不完整几何与主动感知
https://hana-blog.top/blog/robotic-grasp-detection-7
Author 菊花花
Published at August 14, 2026
Comment seems to stuck. Try to refresh?✨