45 lines
3.0 KiB
Markdown
45 lines
3.0 KiB
Markdown
> 本教程复现的是基于西安交通大学的研究成果--https://robogauge.github.io/complete/,把训练的对象从go2修改了成go1之后进行训练,并完成sim2sim、sim2real,旨在梳理四足机器人强化学习全流程部署教程
|
||
|
||
# 研究解读
|
||
|
||
从[Toward Reliable Sim-to-Real Predictability for MoE-based Robust Quadrupedal Locomotion](https://robogauge.github.io/static/files/arxiv.pdf)提取关键的信息(与我们的训练相关的流程设计框架,奖励函数的设计,环境的设计,评估方法等)
|
||
|
||
# train--训练
|
||
|
||
### step1 准备环境:
|
||
|
||
首先我们需要一个可以承载训练任务的计算平台
|
||
|
||
这部分可以直接在robogo平台拉取对应的镜像:,这样可以直接跳过下面的修改部分直接开始go1的训练啦
|
||
|
||
1. 拉取训练的仓库
|
||
|
||
```Bash
|
||
git clone https://github.com/wertyuilife2/go2_rl_robotlab
|
||
```
|
||
|
||
2. 新建isaaclab的go1任务
|
||
这部分要注意写好我具体是怎么修改的,[cyy/go2_rl_robotlab - go2_rl_robotlab - Gitea: Git with a cup of tea](https://gitea.qingruxu.xyz/cyy/go2_rl_robotlab/commits/branch/go1)这个是我的私有仓库,实际的公开的仓库是git clone https://github.com/wertyuilife2/go2_rl_robotlab,我私有的分支在go1分支,参看git提交记录即可
|
||
|
||
### step2 开始训练:
|
||
|
||
这部分需要讲下怎么根据自己的设备调整训练的并行环境数量还有采样点数之类的
|
||
|
||
还需要补充使用tensorboard查看奖励,以及大概是如何计算奖励的好坏和数值区间方便通过borad来评价我们的训练结果
|
||
|
||
# Sim2sim--测试环境的搭建
|
||
|
||
这部分我是参考的roboguage的评估结果,需要讲的是怎么去导出onnx,以及怎么在训练过程中不中断的导出onnx,roboguage也是我修改的,查看对应git的提交记录就可以知道修改了哪些,位置在E:\race_save\doge\RoboGauge
|
||
我的本地的测试其实使用的是:E:\race_save\doge\go1_pro_deploy\deploy_45dim_rl_gym这里面的部署到mujoco的文件来实现的sim2sim,可以说一下实现方法和使用的按键上下左右,以及,。控制的转向
|
||
|
||
# deploy--部署
|
||
|
||
本次我们部署的平台是在s100/rdk x5上进行部署,需要进行量化到bpu测试,E:\race_save\doge\go1_pro_deploy\deploy_45dim_rl_gym这里面也有关于bpu量化的部分的说明
|
||
|
||
实际部署的时候使用的sdk是我自己研发的需要保密,所以这部分主要讲部署时候的注意事项,比如需要注意软件的限制电机力矩的大小,电机的运动速度,等等,可以把我的安全策略中比较详细的内容写上去,
|
||
我的私有sdk在"E:\race_save\doge\go1_pro_sdk"
|
||
官方的sdk在[unitreerobotics/unitree_legged_sdk: SDK tools for control robots.](https://github.com/unitreerobotics/unitree_legged_sdk)
|
||
使用官方的sdk的示例在E:\race_save\go1\GO1\walk-these-ways这里面有
|
||
|
||
以及部署测试的时候为了安全,我进行了很多的分步测试,也可以作为参考,
|
||
还有实际的硬件章节,接线等,你单独留空给我自己写就行 |