fix: terrain start level 0, clear ep_report after consume
This commit is contained in:
@@ -410,7 +410,7 @@ class DreamWaQTask(Go1WalkTask):
|
|||||||
all_indices = np.tile(np.arange(self._num_cols), self._num_rows)
|
all_indices = np.tile(np.arange(self._num_cols), self._num_rows)
|
||||||
all_origins = self._make_origins(all_levels, all_indices)
|
all_origins = self._make_origins(all_levels, all_indices)
|
||||||
self._terrain_origins = all_origins.reshape(self._num_rows, self._num_cols, 2)
|
self._terrain_origins = all_origins.reshape(self._num_rows, self._num_cols, 2)
|
||||||
self._max_init_level = 5
|
self._max_init_level = 0 # 从平地起步,靠课程升级
|
||||||
|
|
||||||
if num_reset > 0 and self._init_done and state is not None and hasattr(state, 'info'):
|
if num_reset > 0 and self._init_done and state is not None and hasattr(state, 'info'):
|
||||||
old_info = state.info
|
old_info = state.info
|
||||||
|
|||||||
@@ -127,9 +127,10 @@ class RslrlNpEnvWrap(VecEnv):
|
|||||||
if "time_outs" in state.info:
|
if "time_outs" in state.info:
|
||||||
extras["time_outs"] = torch.from_numpy(state.info["time_outs"]).to(self._device)
|
extras["time_outs"] = torch.from_numpy(state.info["time_outs"]).to(self._device)
|
||||||
|
|
||||||
# 将 episode 各项奖励传入 TensorBoard
|
# 将 episode 各项奖励传入 TensorBoard(消费后清除,防止重复上报)
|
||||||
if "ep_report" in state.info:
|
if "ep_report" in state.info:
|
||||||
extras["episode"] = state.info["ep_report"]
|
extras["episode"] = dict(state.info["ep_report"])
|
||||||
|
del state.info["ep_report"]
|
||||||
|
|
||||||
return obs, rewards, dones, extras
|
return obs, rewards, dones, extras
|
||||||
|
|
||||||
|
|||||||
@@ -135,7 +135,7 @@ class rslrl:
|
|||||||
runner.actor.class_name = (
|
runner.actor.class_name = (
|
||||||
"motrix_rl.rslrl.torch.models.cenet_actor:CENetActorModel")
|
"motrix_rl.rslrl.torch.models.cenet_actor:CENetActorModel")
|
||||||
runner.actor.hidden_dims = [512, 256, 128]
|
runner.actor.hidden_dims = [512, 256, 128]
|
||||||
runner.actor.init_noise_std = 0.5 # 降噪声先学站稳,再探索行走
|
runner.actor.init_noise_std = 1.0 # 上游原值
|
||||||
|
|
||||||
# Critic:标准 MLPModel,输入 privileged_obs
|
# Critic:标准 MLPModel,输入 privileged_obs
|
||||||
runner.critic.class_name = "MLPModel"
|
runner.critic.class_name = "MLPModel"
|
||||||
|
|||||||
Reference in New Issue
Block a user