招聘信息分享 招聘信息分享 ← 返回岗位列表

达摩院-医疗AI Agent 算法工程师-杭州

阿里巴巴📍杭州1年以上doctorate
发布时间:

岗位职责

● 主导临床诊疗 Agent 核心算法研发:任务规划(Planning)、工具调用(Tool Use / MCP)、多轮决策、记忆与反思(Memory & Reflection),构建稳定可靠的 Agent 执行框架。 ● 探索 Agentic RL 训练范式(PPO / GRPO / RLVR、过程奖励模型 PRM、Self-play、多轮 rollout),提升 Agent 在长程诊疗路径中的策略优化与自我纠错能力。 ● 设计多智能体协作机制(Planner–Executor–Critic、会诊式 Debate、跨模态编排),支撑复杂病例的分层推理与共识决策。 ● 研发医疗级 RAG:知识库路由、Query 改写、结构化过滤、引用审计与证据可追溯,保障结论的临床可信度。 ● 打通大小模型协同流水线:将病灶检测、异常分类等专科模型输出作为大模型的高价值上下文,形成层级化可解释推理系统。 ● 负责 Agent 后训练与对齐:面向轨迹的 SFT / DPO / RLHF、多目标奖励融合,解决 Reward Hacking、安全对齐与医疗偏好优化。 ● 构建数据飞轮与合成数据体系:工具调用轨迹、多轮诊疗仿真、病例路径生成,驱动 Agent 能力持续迭代。 ● 建设 Agent 评测基准与自动化评估:任务成功率、工具调用准确性、多轮一致性、安全性、合规性与临床有效性。 ● 推动 Agent 在疾病筛查、辅助诊断、临床决策支持等场景的产品化落地,与医院、科研机构合作开展临床验证。

任职要求

● 计算机、人工智能、生物医学工程、数学等相关专业硕士及以上。 ● 精通 Python 与 PyTorch,具备分布式训练与推理优化的工程能力。 ● 在以下至少一个方向具备扎实的理论与实战经验: ● Agent 系统:任务规划、工具调用、多轮决策与编排框架;熟悉 ReAct、Plan-and-Execute、Reflexion 等主流范式。 ● Agentic RL:PPO / GRPO / DPO / RLVR、奖励建模、过程奖励(PRM)、Self-play、多轮 rollout 训练。 ● 大模型训练与对齐全流程:SFT → RLHF / RL,熟悉主流架构、推理机制与 Test-time Scaling / Reasoning Model。 ● RAG 与对话系统:检索、召回、重排、引用生成、多轮对话状态管理。 ● 模型协同与系统工程:大小模型协同、层级推理、多模态 Agent 流水线设计。 ● 优秀的问题抽象与算法设计能力,能从临床需求提炼技术方向并推动创新方案落地。 ● 良好的跨团队协作能力,对 Agent 与医疗 AI 有强烈兴趣与落地责任感。
前往官网申请 →