《MicroDuck RL:训练机器鸭从仿真走到真机》 系列课程 · 第 01 集 / 共 14 集
上一集:【系列课程】MicroDuck 强化学习:训练机器鸭从仿真走到真机 · 课程目录与导读 |课程目录 | 下一集:【MicroDuck RL 02】背景概念:MuJoCo、强化学习、PPO 与 Sim2Real
一句话:在仿真里用强化学习(RL)训练一只小鸭子机器人走路、站立、翻滚、滑轮滑,然后把训练好的策略导出,直接部署到真机上。
| 项目 | 说明 |
|---|---|
| 机器人 | Microduck(Pollen Robotics),约 800 g、25 cm 高的双足机器人,14 个 Dynamixel XL330 舵机 |
| 仿真器 | MuJoCo(通过 MuJoCo Warp GPU 并行版运行) |
| 训练框架 | mjlab(MuJoCo Warp 的 RL 封装)+ rsl_rl(PPO 算法库) |
| 控制频率 | 50 Hz(物理步长 5 ms × decimation 4) |
| 交付物 | ONNX 格式策略网络,由真机运行时加载,支持多个策略热切换 |
仓库里包含 13+ 个任务:走路、跌倒爬起、坐下站起、捡东西、踢球、前滚翻、滑轮滑、原地旋转……本系列训练的是主任务 Mjlab-Velocity-Flat-MicroDuck(平地速度跟踪行走)。
这个仓库最有价值的地方
它是一份完整的、踩过无数坑的 sim2real(仿真到现实)配方,包括:
- 高保真电机模型:不是把舵机当理想马达,而是建模到电压控制律级别(第 06 集细讲)
- 域随机化:物理参数全面随机,逼策略适应现实世界的不确定性(第 05 集细讲)
- 齿隙(backlash)仿真:连齿轮旷量都仿真进去
- 一整套用失败换来的奖励设计经验:写在仓库的
AGENTS.md里,每条都是真实事故的教训(第 10 集讲其中精华)
学完这个系列你能得到什么
- 一套在消费级 GPU(16 GB 显存)上完整跑通的机器人 RL 训练流程,训练一只会走路的机器鸭只需 1–2 小时
- 读懂一份工业级任务配置的能力:观测空间、奖励函数、域随机化、课程学习分别怎么设计
- 从仿真导出 ONNX、在 CPU 仿真里彩排、直到真机部署的完整路线
下一集我们补齐背景概念:MuJoCo 是什么、强化学习怎么循环、Sim2Real 为什么靠"随机化"而不是"精确建模"。