岗位职责
- 【岗位职责】 模块方向:具身大模型方向 课题方向:人形机器人交互式强化学习 方向内容:样本效率与真实物理的矛盾。通过人类反馈等高效监督,解决传统真机RL时间和经济成本太高的问题。 奖励函数的 "对齐难题"。开放式任务面临reward hacking问题、稀疏奖励问题。 安全探索的硬约束。探索过程中面临损坏等风险。 岗位职责 高效交互式 RL 算法研究。基于大模型先验的样本提效探索,离线 RL + 在线微调的混合范式,高效冷启动。 人类反馈对齐与交互式奖励建模。设计支持多模态人类反馈的奖励学习框架,研究大语言模型作为 "奖励评论家"(Reward Critic)的方案。 安全强化学习与约束探索。设计人形机器人安全探索框架,研究不确定性估计与风险敏感策略。 【任职要求】 专业要求: 计算机、自动化、机器人、数学等相关专业硕士及以上学历 深入掌握强化学习理论,精通 PPO、SAC、离线 RL、偏好学习等核心算法 有 RL 算法从 0 到 1 的实现经验,不只是调库,而是能推导公式、改写底层 加分项: 有人形机器人 / 机械臂 RL 真实部署经验,踩过 sim-to-real 的坑 有人类反馈强化学习(RLHF)、偏好学习、逆强化学习相关研究 熟悉最优控制、轨迹优化、MPC 等经典机器人控制方法 有安全 RL、约束优化、鲁棒控制相关研究背景
DeepCampus 提醒:官网投递前请确认个人信息与简历版本。建议在投递前检查简历最新版本,确保教育经历、实习经历、项目经历等信息完整准确,提升通过率。