Published
2026-08-04
Section
Articles
How to Cite
基于 Point Transformer 的条件扩散六自由度位姿生成
雷 啸天
北方工业大学人工智能与计算机学院/大规模流数据集成与分析技术北京市重点实验室
王 菁
北方工业大学人工智能与计算机学院/大规模流数据集成与分析技术北京市重点实验室
DOI: https://doi.org/10.59429/kxjsyy.v3i3.14797
Keywords: 六自由度抓取;多模态融合;交叉注意力
Abstract
随着深度学习的发展,基于点云的六自由度抓取感知与生成方法取得了显著进展。传统主要侧重于几何与物 理稳定性评价,在面向自然语言指令驱动的抓取任务时,难以在候选生成阶段有效融入语义约束。为此,本文提出 一种基于 Point Transformer 条件扩散六自由度抓取生成方法,利用 Point Transformer 对场景点云进行特征提取,在条 件扩散去噪网络中引入交叉注意力机制,实现语言指令与点云特征的深层对齐与融合,进而在连续抓取空间中生成 任务相关的抓取候选,设计联合一致性评分对候选抓取进行评估与筛选,在保证物理可执行性的同时提升语义匹配 性与抓取完成质量。实验结果表明,该方法在语义一致性与抓取成功率等指标上优于对比方法,具备良好的泛化能 力与应用潜力。
References
[1] Suárez-Ruiz F, Zhou X, Pham Q C. Can robots assemble an IKEA chair?[J]. Science Robotics, 2018, 3(17):eaat6385.
[2] Dantam N T, Kingston Z K, Chaudhuri S, et al.Incremental task and motion planning: A constraint-based approach[C]//Robotics: Science and systems. 2016, 12: 00052.
[3] Ten Pas A, Gualtieri M, Saenko K, et al. Grasp pose detection in point clouds[J]. The International Journal of Robotics Research, 2017, 36(13-14): 1455-1473.
[4] Liang H, Ma X, Li S, et al. Pointnetgpd: Detecting grasp configurations from point sets[C]//2019 international conference on robotics and automation (ICRA). IEEE, 2019:3629-3635.
[5] Fang H S, Wang C, Gou M, et al. Graspnet-1billion: A large-scale benchmark for general object grasping[C]// Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. 2020: 11444-11453.
[6] Li M, Zhao Q, Lyu S, et al. Ovgnet: A unified visual-linguistic framework for open-vocabulary robotic grasping[C]//2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). IEEE, 2024: 7507-7513.
[7] Achiam J, Adler S, Agarwal S, et al. Gpt-4 technical report[J]. arXiv preprint arXiv:2303.08774, 2023.