摘要

山东大学控制科学与工程学院李可教授团队提出了面向仿人五指灵巧手抓取的统一学习框架。在人类示范数据采集阶段,研究团队利用NOKOV度量动作捕捉系统记录示范者的自然五指抓取运动,获得抓取行为三维运动轨迹,并经后处理得到关节角轨迹。这些数据用于 DM-KMP 生成期望关节轨迹,并为后续 PWS-MADDPG 多智能体强化学习提供运动先验。该研究将人类示范轨迹生成与多智能体强化学习相结合:NOKOV度量动作捕捉系统用于采集自然五指抓取运动,DM-KMP从有限示范中生成期望关节轨迹,PWS-MADDPG进一步学习多指协同抓取策略。研究结果显示PWS-MADDPG 在 11 类物体上的平均抓取成功率为 85.48%。

案例概览

内容

研究团队

山东大学控制科学与工程学院李可教授团队

论文

Humanoid Five-Digit Robotic Grasping via Multi-Agent Reinforcement Learning With Potential-Guided Optimization and Weight Scheduling

研究对象

仿人五指灵巧手

研究任务

多类物体协调抓取控制

动作捕捉系统

NOKOV度量动作捕捉系统

被捕捉对象

人类示范者的自然五指抓取运动

输出数据

抓取行为三维运动轨迹;经后处理得到关节角轨迹

数据用途

用于 DM-KMP 学习生成期望关节轨迹,并为 PWS-MADDPG 提供运动先验

一、为什么五指灵巧手抓取需要示范运动数据?

仿人五指灵巧手在未知形状、重量和材质的物体上抓取时,需要同时处理多指协同、异步关节运动接触力调节。传统基于演示的方法需要为不同物体分别训练轨迹,泛化能力有限;单智能体强化学习又难以协调拇指和其他手指这类异质关节,容易导致探索效率低和收敛速度慢。人类自然抓取示范为策略学习提供了一个更接近有效动作的起点。

二、研究方法如何连接示范学习与强化学习?

本文聚焦仿人五指灵巧手的多指协调抓取问题,提出将示范学习与多智能体强化学习相结合的统一框架。论文作者指出,该研究据其所知首次将多智能体强化学习(MARL)框架应用于仿人五指灵巧手抓取控制。整体框架由三个紧密相连的阶段组成:

1、基于演示的策略初始化:本文提出了一种新颖的DM-KMP算法,它结合了动态运动基元(DMP)的全局泛化能力和核化运动基元(KMP)的局部适应性。该模块能够从有限的人类演示中学习平滑且灵活的抓取轨迹,作为结构化的初始策略。

2、用于协调的多智能体强化学习:认识到演示学习在处理环境动态和异步控制方面的局限性,本文采用多智能体强化学习(MARL)方法。人形手的每个手指都被建模为一个独立的智能体,通过MADDPG框架进行训练。这种结构允许去中心化的策略学习,同时通过集中式训练确保指间协同。

3、两种用于引导优化的机制:为提高策略优化过程中的学习效率和稳定性,本文引入了两种新颖的机制:a. 一个势能引导的动作精炼组件,它基于特定任务势场的梯度动态调整每个智能体的动作,引导探索朝向期望的控制方向;b. 一个权重调度的奖励塑形策略,它在整个训练过程中自适应地平衡个体和团队奖励,促进更平滑的收敛和更好的整体性能。

本文提出的框架(a)示教学习模块(b)拇指与手指模块(c)多智能体强化学习模块(d)权重调度模块。

三、NOKOV度量动作捕捉系统在本研究中的作用

项目

内容

被捕捉对象

进行自然抓取示范的人手五指运动

输出数据

人类抓取行为的三维运动轨迹;经后处理得到关节角轨迹

数据用途

供 DM-KMP 学习生成期望关节运动轨迹,并为后续多智能体强化学习提供运动先验

实验中,研究团队利用NOKOV度量动作捕捉系统记录人类示范者的五指自然抓取运动,获得抓取行为三维运动轨迹,并通过后处理得到关节角轨迹。这些轨迹数据被用于 DM-KMP 学习并生成期望关节轨迹,再作为后续多智能体强化学习的运动先验。

四、实验验证

实验设置。(a) 示范;(b) 仿真环境;(c) 真实环境。

实验系统由三个主要部分组成:

a)人类示范数据采集:由 NOKOV 度量动作捕捉系统记录人类自然抓取行为;

b)基于 Gazebo 物理引擎(ODE)的仿真环境:包含机械臂与五指仿人灵巧手的完整仿真模型,虚拟桌面上放置多种物体,支持大规模策略训练与调试;

c)实体机器人抓取平台:由 KUKA LBR iiwa 机械臂、仿人五指灵巧手(Shadow 灵巧手)与集成的感知-控制抓取系统组成,手与臂控制器之间通过 TCP 协议通信,控制流程与仿真训练一致。

其中,仿真中的 UR 机械臂与实体平台的 KUKA 机械臂均只负责将灵巧手移动到抓取位置,不参与策略训练。

1.经 DM-KMP 处理的人类示范轨迹

下图展示了人类示范者抓取泡沫砖时五指关节角轨迹经 DM-KMP 处理后的结果。结果表明,经 DM-KMP 处理后,关节轨迹变得更平滑、更连续,可作为多智能体强化学习的高质量运动参考。

DM-KMP 处理后,五指仿人灵巧手抓取泡沫砖过程中的关节角轨迹。

2. DM-KMP 的性能(消融实验)

通过比较无示范、仅 DMP、仅 KMP 和 DM-KMP 四种初始化方式的消融研究,结果表明 DM-KMP 整体表现最优。

3. PWS-MADDPG 的性能

与多种强化学习方法对比,PWS-MADDPG 在 11 类物体上的平均抓取成功率为 85.48%,相对 DDPG 提升 40.31%,相对 MADDPG 提升 20.05%。

4. 基于定制力传感杯的抓取力测试

通过在抓取过程中逐步增加外部负载测试力调节能力,结果表明系统能够自适应调整各指 grip force和 load force 并维持稳定抓取。

5. 可变形纸杯抓取实验

使用不同载荷的可变形纸杯测试力控制,结果表明在不同负载下均实现了稳定抓取并满足无明显或仅轻微形变的约束。

五、论文信息

引用格式:

Wang, Jiashuai, et al. "Humanoid Five-Digit Robotic Grasping via Multi-Agent Reinforcement Learning With Potential-Guided Optimization and Weight Scheduling." IEEE Transactions on Automation Science and Engineering (2026).

论文DOI:10.1109/TASE.2026.3672621  

六、FAQ

Q1:NOKOV度量动作捕捉系统在这项研究中输出了什么数据?

A1: NOKOV度量动作捕捉提供抓取行为的三维运动轨迹,以及经后处理得到的关节角轨迹。

Q2:论文中PWS-MADDPG方法的的抓取成功率是多少?

A2: PWS-MADDPG框架在 11 类物体上的平均抓取成功率为 85.48%。

Q3:该研究中,人类示范数据最终如何用于五指灵巧手抓取?

A3:NOKOV采集人类自然抓取运动后,经后处理得到关节角轨迹;这些示范数据用于DM-KMP学习期望关节轨迹,并为后续PWS-MADDPG提供运动先验。

Logo

一站式 AI 云服务平台

更多推荐