招聘信息分享 招聘信息分享 ← 返回岗位列表

agent后训练算法实习生-2027届

小米📍北京集团技术委员会
发布时间:

岗位职责

工作内容 1. Agent 后训练全流程建设: 负责基于大语言模型的通用 Agent 的后训练(Post-training)工作,覆盖 SFT、偏好对齐(DPO/ORPO/KTO 等)、RLHF/RLAIF、RLVR 等阶段,针对 Tool-use、多轮规划、长程推理、错误恢复等核心能力进行定向训练; 2. Agentic SFT 数据工程: 构建高质量 Agent 轨迹数据生产线,包括真实交互轨迹采集、模型自博弈(Self-play)生成、轨迹筛选与清洗、拒绝采样(Rejection Sampling)、多样性增强等策略,持续迭代数据配方与课程学习方案; 3. Preference & Reward Modeling: 训练面向 Agent 行为的 Reward Model / Preference Model,覆盖任务完成率、工具调用正确性、推理链质量、步骤效率、安全性等多维信号;探索 Process Reward Model(PRM)对中间推理/动作步骤的细粒度建模; 4. RL for Agent: 研究并落地适合 Agent 场景的强化学习算法,解决长 horizon 信用分配、稀疏奖励、工具环境交互不稳定、离线-在线 RL 融合等关键问题;在代码执行、浏览器操作、API 调用等交互式环境中训练 agent 策略; 5. 多轮交互与记忆能力训练: 针对 Agent 的多轮对话记忆、长上下文工具使用、从反馈中学习(online adaptation)等能力,设计专项训练任务与对齐方案; 6. 训练 Infrastructure 优化: 基于 DeepSpeed / Megatron / vLLM / SGLang / veRL 等框架,优化大规模分布式后训练 pipeline 的稳定性、吞吐效率和显存利用率,支撑百亿到千亿参数模型的训推一体迭代; 7. 评测与归因: 建立系统化的 Agent 能力评测基准(覆盖工具使用、规划、推理、鲁棒性、安全性等维度),结合自动评测与人工评估对训练效果进行量化分析,badcase 归因后驱动下一轮数据与训练策略迭代; 8. 前沿复现与创新: 跟踪并复现 Agent 后训练方向的最新工作(如 OpenAI o-series、DeepSeek-R1、Tool-integrated Reasoning、Agent Q*、Reinforced Fine-tuning 等),结合业务场景提出创新方案并落地验证。

任职要求

基本要求 - 计算机、人工智能、数学、统计等相关专业在读硕士/博士(优秀本科生亦可); - 扎实的机器学习与深度学习基础,深入理解 Transformer 架构与 LLM 训练/推理原理; - 熟悉强化学习基础算法(PPO、DQN、Policy Gradient、Actor-Critic 等),了解 LLM 对齐算法(RLHF、DPO、GRPO、KTO 等)的原理与实现细节; - 熟练使用 Python 与 PyTorch,有实际的大模型训练/微调经验(SFT、LoRA、RLHF 任一); - 了解分布式训练相关技术(数据并行、张量并行、流水线并行、ZeRO 等),具备多卡/多机训练实操经验; - 数学功底扎实,能独立推导优化目标、分析 loss 设计与梯度行为。
前往官网申请 →