Hana's Blog
Robotic Grasp Detection (12): 执行感知评估与开放问题Blur image

检测分数与执行成功之间的距离(From Detection Score to Execution)#

抓取检测器输出的姿态要经过碰撞检查(Collision Checking)、逆运动学(Inverse Kinematics, IK)、轨迹规划(Trajectory Planning)、夹爪闭合、抬升和任务执行。每个阶段对应一个可记录的状态和失败标签。

设候选抓取为 g=(R,t⃗,w)g=(R,\vec t,w),其中 R∈SO(3)R\in SO(3)、t⃗∈R3\vec t\in\mathbb R^3、w∈R≥0w\in\mathbb R_{\geq0}。从检测到任务的评测链路为:

Algorithm 1 从抓取检测到执行结果的评测流程
输入:
场景观测、抓取候选集合、平行夹爪模型、机器人模型和执行协议
输出:
分阶段执行记录、失败标签和任务结果
  1. require 保存全部候选、检测分数和候选生成时间
  2. 执行夹爪终态、接近扫掠体积和场景碰撞检查
  3. 对几何可行候选求 IK,检查关节限制和自碰撞
  4. 规划预抓取到接触、闭合和抬升轨迹
  5. 执行闭合和抬升,记录接触、力、夹爪状态和物体高度
  6. 在保持和任务阶段检测稳定、滑移、放置与恢复状态
  7. 将失败归类到检测、几何、可达、接触、稳定或任务阶段
  8. return 分阶段指标和最终任务结果

离线平均精度(Offline Average Precision, AP)覆盖候选与标注的匹配;执行协议再测量几何、规划、接触、稳定和任务结果。


评价阶梯(Evaluation Ladder)#

1. 离线姿态评价(Offline Pose Evaluation)#

常见指标包括矩形交并比(Intersection over Union, IoU)、姿态距离、AP、前 kk 项召回率(Recall@kk)和候选覆盖率(Candidate Coverage)。每项结果同时注明标注集合、匹配阈值和候选预算。

空间姿态匹配通常分别计算平移与旋转误差:

dt=∥t⃗^−t⃗∗∥2,dR=min⁡S∈Scos⁡−1 ⁣(tr⁡((R∗S)TR^)−12),d_t=\lVert\hat{\vec t}-\vec t^*\rVert_2, \qquad d_R=\min_{S\in\mathcal S} \cos^{-1}\!\left( \frac{\operatorname{tr}((R^*S)^{\mathsf T}\hat R)-1}{2} \right),

其中 t⃗^,t⃗∗∈R3\hat{\vec t},\vec t^*\in\mathbb R^3,R^,R∗∈SO(3)\hat R,R^*\in SO(3),S\mathcal S 是夹爪对称集合,τt\tau_t 和 τR\tau_R 是平移、旋转阈值。预测在 dt<τtd_t<\tau_t 且 dR<τRd_R<\tau_R 时与真值匹配,并采用一对一匹配。

2. 几何与解析有效性(Geometric and Analytic Validity)#

力闭合(Force Closure)、对向条件(Antipodal Condition)和碰撞检测(Collision Checking)验证候选在给定摩擦、几何和夹爪模型下的解析有效性。

几何有效性拆成四个布尔量:闭合区是否有物体、夹指/手掌终点是否碰撞、预抓取到终点的扫掠体积是否碰撞、候选宽度是否在硬件范围。日志分别保存这四个结果,并记录摩擦系数、法线来源、质心和力矩归一化方式。

3. 仿真执行(Simulated Execution)#

物理仿真加入重力、动力学、碰撞和扰动,结果由网格、接触求解器、控制器和随机化范围共同决定。

仿真试验使用固定状态机:移动到预抓取位姿、沿接近轴进入、闭合到力/位置阈值、抬升指定高度、保持指定时间,并在每一步记录碰撞、接触和物体高度。初始位姿、摩擦、质量和控制噪声按固定分布随机化,接近路径与闭合控制纳入同一执行协议。

4. 物理抬升与清空(Physical Lift and Clearing)#

抬升成功率(Lift Success Rate)记录物体是否离开支撑面,清空率(Clearing Rate)记录杂乱场景中的连续抓取。AnyGrasp 在其动态场景协议中报告超过 300 个未见物体上的 93.3% 箱体清空成功率 [1];报告时同时给出机器人、传感器和场景设置。

5. 稳定、滑移与可达(Stability, Slip, and Reachability)#

稳定性关注物体在扰动或运动后是否仍被持有;滑移评价接触相对运动;可达性评价机器人是否存在合法关节配置和轨迹。它们比首次抬升更接近部署。

6. 任务成功与恢复(Task Success and Recovery)#

最终任务可能包括放置、递交、倾倒、清理指定目标或避开脆弱部件。任务成功率同时包含语义、抓取、规划和控制。恢复策略还允许机器人在失败后获取新信息并再次尝试。


保留失败归因(Preserving Failure Attribution)#

执行日志按阶段保留失败归因。记录内容包括:

  • 所有候选及原始分数;
  • 碰撞和可达性过滤结果;
  • 最终选择与运动规划结果;
  • 接触、夹紧力、滑移和抬升轨迹;
  • 目标或部件是否正确;
  • 失败类别与恢复动作。

检测正确而规划失败标记为规划/可达失败;规划成功而接触不稳定标记为接触/稳定失败。

日志最好为每个尝试分配唯一 attempt_id,并保存候选表而不是只保存最后姿态。候选表的每一行包含原始分数、NMS 前后索引、碰撞原因、IK 解、规划代价与是否被选中;执行表再保存时间戳、夹爪宽度/电流、腕部力矩、物体高度和失败标签。这样可以离线重放“如果使用另一排序器会选哪个候选”,而无需重新执行所有机器人试验。


执行感知数据集(Execution-Aware Benchmarks)#

Supermarket-6DoF 在 20 个物体、1,500 次真实尝试上分别标注抬升成功和抓取后稳定性 [2],将“拿起来”和“稳定拿住”分为两个指标。

GraspIT 提供滑移测试与可达性质量,报告约 316k 组红绿蓝—深度帧(Red–Green–Blue and Depth Frame, RGB-D Frame)、1,035 个仿真和 100 个真实场景,以及约 230 万个候选 [3]。数据同时包含仿真验证和真实场景记录,可用于分析候选生成、可达性和滑移阶段。

GCA-Bench 将语义理解、姿态检测、规划和任务结果分阶段评价,包含 102 个复杂任务场景 [4]。它把检测输出与任务执行日志放在同一评测链路中。

TARGO 将目标身份和遮挡程度加入真实与合成协议,用于研究目标驱动抓取随遮挡变化的性能 [5],对应目标选择、遮挡可见性和 6-DoF 抓取三个接口。


开放问题一:校准不确定性(Calibrated Uncertainty)#

模型需要区分:

  • 传感器噪声引起的偶然不确定性(Aleatoric Sensor Uncertainty);
  • 未见物体与分布偏移(Distribution Shift);
  • 隐藏形状的不确定性(Shape Uncertainty);
  • 姿态和接触不确定性(Pose and Contact Uncertainty);
  • 规划与执行不确定性(Planning and Execution Uncertainty)。

vMF-Contact 使用概率接触方向与证据学习处理噪声杂乱场景 [6];Shape Completion Uncertainty 将补全不确定性用于抓取质量 [7];ActiveGrasp 用校准能量模型和信息选择主动观测 [8]。

校准评价使用可靠性图(Reliability Diagram)、期望校准误差(Expected Calibration Error, ECE)和风险—覆盖曲线(Risk–Coverage Curve),并把置信度连接到真实执行结果。

把预测成功概率分成 MM 个置信区间 BmB_m,ECE 定义为:

ECE⁡=∑m=1M∣Bm∣n∣acc⁡(Bm)−conf⁡(Bm)∣.\operatorname{ECE}=\sum_{m=1}^{M} \frac{|B_m|}{n} \left| \operatorname{acc}(B_m)-\operatorname{conf}(B_m) \right|.

其中 acc⁡\operatorname{acc} 是该桶真实执行成功率,conf⁡\operatorname{conf} 是平均预测概率。实验同时报告分桶设置、可靠性图、负对数似然或 Brier 分数(Brier Score),并在碰撞/可达性过滤前后分别计算校准结果。


开放问题二:跨传感器与跨具身迁移(Cross-Sensor and Cross-Embodiment Transfer)#

Seen/Novel 物体划分通常固定相机、夹爪和机器人。部署变化还包括:

  • 深度相机类型与噪声;
  • 视角、安装高度和手眼标定;
  • 夹爪开口、指尖厚度和摩擦;
  • 机械臂工作空间和关节限制;
  • 场景尺度与运动速度。

迁移协议独立改变这些因素,并区分零样本(Zero-Shot)、少样本校准(Few-Shot Calibration)和完整微调(Full Fine-Tuning)。物体类别、传感器、夹爪和机器人分别作为测试变量。


开放问题三:语义与物理兼容(Semantic–Physical Compatibility)#

语言模型定位“把手”后,抓取候选继续经过:

  • 夹爪开口与指尖几何检查;
  • 遮挡物和接近扫掠体积碰撞检查;
  • 机械臂 IK 与轨迹可达性检查;
  • 重力下的接触稳定性检查;
  • 后续放置姿态和轨迹检查。

ThinkGrasp 使用视觉语言推理选择部件或清理动作,再调用几何抓取模块 [9]。PhyGrasp 将材料、质量、脆弱性和语言偏好加入部件级选择 [10]。语义条件进入目标区域、禁区、力限制和任务轨迹后,分别统计每一级的通过率。


开放问题四:透明、柔性与关节物体(Transparent, Deformable, and Articulated Objects)#

三类对象对应三种观测和状态变量:

  • 透明物体改变传感器观测;
  • 柔性物体使接触改变几何;
  • 关节物体让状态、部件和动作语义耦合。

共享协议分别控制材质、状态和遮挡,并记录改进来自专用相机、类别先验、几何补全或接触反馈。


开放问题五:统一检测到执行基准(Linked Detection-to-Execution Benchmark)#

统一基准在同一场景和候选集合上保存:

observation→candidates→filters→planner→contact trace→outcome.\text{observation} \rightarrow \text{candidates} \rightarrow \text{filters} \rightarrow \text{planner} \rightarrow \text{contact trace} \rightarrow \text{outcome}.

利用这些记录,可以计算条件概率:

P(task success)=P(D)P(F∣D)P(P∣F,D)P(E∣P,F,D),P(\text{task success}) =P(D)P(F\mid D)P(P\mid F,D)P(E\mid P,F,D),

其中 DD 是检测正确,FF 是物理可行,PP 是规划成功,EE 是执行成功。该分解保留每个阶段在前置条件成立时的失败统计。

实际报告可以直接给出条件计数:

P^(F∣D)=nD∩FnD,P^(P∣D,F)=nD∩F∩PnD∩F,\hat P(F\mid D)=\frac{n_{D\cap F}}{n_D},\qquad \hat P(P\mid D,F)=\frac{n_{D\cap F\cap P}}{n_{D\cap F}},

以及 P^(E∣D,F,P)\hat P(E\mid D,F,P),并同时报告每个条件概率的分母。离线候选有效率和最高分候选的执行成功率分别记录。


开放问题六:闭环恢复与安全适应(Closed-Loop Recovery and Safe Adaptation)#

闭环恢复利用未接触、碰撞、滑移或场景变化等新证据。恢复策略报告:

  • 尝试次数与时间预算;
  • 每次失败获得的信息;
  • 累计成功率;
  • 是否改变候选分布;
  • 是否存在安全回退(Safe Fallback);
  • 对脆弱物体和环境的风险。

恢复策略根据新证据更新下一次候选或动作。

给定最多 KK 次尝试,可以报告经验累计成功率:

S^k=1N∑i=1N1[第 i 个场景在前 k 次内成功],k=1,…,K.\widehat S_k= \frac{1}{N}\sum_{i=1}^{N} \mathbf 1[\text{第 }i\text{ 个场景在前 }k\text{ 次内成功}], \qquad k=1,\ldots,K.

同时报告条件恢复率 P(success at k∣failed before k)P(\text{success at }k\mid\text{failed before }k),区分首次成功能力和失败后的恢复能力。累计成功率直接由闭环试验统计,不从单次成功率推导。


可复现执行报告(Reproducible Execution Reporting)#

真实抓取报告记录:

类别必要信息
夹爪型号、开口、指尖、指垫、力限制
相机型号、视角、标定、深度过滤
候选数量、阈值、非极大值抑制(Non-Maximum Suppression, NMS)、碰撞模型
机器人IK、规划器、速度、加速度、工作空间
成功定义抬升高度、保持时间、稳定/滑移阈值
试验物体、重置方式、重复次数、置信区间(Confidence Interval)
失败感知、碰撞、不可达、未接触、滑移、任务错误
计算推理、过滤、规划和总循环时间

抓取检测结果同时由离线候选、几何有效性、规划、接触稳定和任务完成率构成;不确定性和约束在对应阶段记录。

成功率也需要不确定区间#

若 nn 次独立试验中成功 xx 次,点估计 p^=x/n\hat p=x/n 在小样本下很不稳定。95% Wilson 置信区间(Wilson Confidence Interval)为:

p^+z22n±zp^(1−p^)n+z24n21+z2n,z=1.96.\frac{ \hat p+\frac{z^2}{2n} \pm z\sqrt{\frac{\hat p(1-\hat p)}{n}+\frac{z^2}{4n^2}} }{1+\frac{z^2}{n}}, \qquad z=1.96.

例如“10 次成功 9 次”和“100 次成功 90 次”点估计同为 90%,区间宽度不同。比较两个检测器时,在相同物体—场景重置上做配对试验(Paired Trial),随机化执行顺序,并用配对差异或自助法(Bootstrap)置信区间报告改进。


参考文献(References)#

  1. H.-S. Fang et al., “AnyGrasp: Robust and Efficient Grasp Perception in Spatial and Temporal Domains,” IEEE Transactions on Robotics, 2023. DOI ↗
  2. J. Toskov and A. Cosgun, “Supermarket-6DoF: A Real-World Grasping Dataset and Grasp Pose Representation Analysis,” arXiv preprint arXiv:2502.16311, 2025. arXiv ↗
  3. P. Koch, A. Karakurt, and A. Sers, “GraspIT: A Dataset Bridging the Sim-to-Real Gap and Back for Validated Grasping SE(3) Pose Generation,” arXiv preprint arXiv:2607.05869, 2026. arXiv ↗
  4. H. Zhang et al., “Beyond Visual Grasping: Benchmarking Complex Grasping from Detection to Execution,” arXiv preprint arXiv:2607.14341, 2026. arXiv ↗
  5. Y. Xia et al., “TARGO and TARGO-Net: Benchmarking Target-Driven Object Grasping under Occlusions,” International Journal of Computer Vision, 2026. DOI ↗
  6. Y. Shi, E. Welte, M. Gilles, and R. Rayyes, “vMF-Contact: Uncertainty-Aware Evidential Learning for Probabilistic Contact-Grasp in Noisy Clutter,” 2025 IEEE International Conference on Robotics and Automation, 2025. DOI ↗
  7. N. F. Duarte et al., “Measuring Uncertainty in Shape Completion to Improve Grasp Quality,” 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2025. DOI ↗
  8. B. Lei, W. Jiang, and K. Daniilidis, “ActiveGrasp: Information-Guided Active Grasping with Calibrated Energy-Based Model,” arXiv preprint arXiv:2511.12795, 2025. arXiv ↗
  9. Y. Qian et al., “ThinkGrasp: A Vision-Language System for Strategic Part Grasping in Clutter,” Proceedings of the 8th Conference on Robot Learning, 2024. PMLR ↗
  10. D. Guo et al., “PhyGrasp: Generalizing Robotic Grasping with Physics-Informed Large Multimodal Models,” 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2025. DOI ↗
Robotic Grasp Detection (12): 执行感知评估与开放问题
https://hana-blog.top/blog/robotic-grasp-detection-12
Author 菊花花
Published at August 14, 2026
Comment seems to stuck. Try to refresh?✨