⚠️ 该岗位已下线
此岗位在招聘官网已不再展示,可能已招满或关闭。以下信息为历史存档,仅供参考;请返回首页查看最新在招岗位。
此岗位在招聘官网已不再展示,可能已招满或关闭。以下信息为历史存档,仅供参考;请返回首页查看最新在招岗位。
混元多模态强化学习(RL)算法研究员(北京/上海)
产品线:AI
发布时间:
岗位职责
1.针对多模态模型开展强化学习算法研究,包括面向图像、视频生成的扩散模型,面向多模态理解的自回归模型,以及前沿统一多模态框架;
2.设计并开发强化学习训练框架与奖励建模策略,实现高效的大规模训练,提升训练稳定性,并解决奖励作弊等相关问题;
3.探索下一代强化学习范式,使其能更直接、更高效地从环境反馈中学习。