强化学习算法专家
8小时前
长沙市上海市, 中国
中科云谷
全职
工作职责
1、负责公司强化学习整体技术路线规划、算法框架设计及持续迭代优化; 2、主导Online RL、Offline RL、Imitation Learning、Human-in-the-loop RL、Model-based RL研发; 3、负责奖励函数设计、课程学习、探索策略、策略优化; 4、建立大规模并行训练系统,优化Sim-to-Real Gap; 5、与VLA/世界模型团队共同设计RL融合方案等。
1、负责公司强化学习整体技术路线规划、算法框架设计及持续迭代优化; 2、主导Online RL、Offline RL、Imitation Learning、Human-in-the-loop RL、Model-based RL研发; 3、负责奖励函数设计、课程学习、探索策略、策略优化; 4、建立大规模并行训练系统,优化Sim-to-Real Gap; 5、与VLA/世界模型团队共同设计RL融合方案等。
任职要求
1、硕士及以上学历(博士优先),RL/控制/机器人方向; 2、精通PPO/SAC/DDPG/TD3等连续控制算法; 3、熟练使用MuJoCo/Isaac Gym/Isaac Sim; 4、具备机器人真机部署经验(双足行走/灵巧操作/双臂协同); 5、CoRL/RSS/ICRA/IROS论文优先等。
1、硕士及以上学历(博士优先),RL/控制/机器人方向; 2、精通PPO/SAC/DDPG/TD3等连续控制算法; 3、熟练使用MuJoCo/Isaac Gym/Isaac Sim; 4、具备机器人真机部署经验(双足行走/灵巧操作/双臂协同); 5、CoRL/RSS/ICRA/IROS论文优先等。