招聘信息分享 招聘信息分享 ← 返回岗位列表

Agent资深评测工程师

滴滴📍北京市AI Dev技术
发布时间:

岗位职责

1、定义 Coding Agent、Skill、Harness 的评测目标与适用范围,识别哪些变化需要系统评测,明确成功标准、基线、关键场景及质量和成本约束。 2、从真实研发任务、产品反馈和失败案例中建设评测集,设计采样、标注、专家复核、去重、版本管理和持续维护机制,使数据能够代表目标用户与任务。 3、设计并实现评估方法,结合编译测试、规则验证、模型裁判与人工评审,验证评估标准的有效性,处理裁判偏差、标注分歧和不同任务的评分差异。 4、设计对照实验、重复运行和分层分析,区分模型、Prompt、Skill、上下文、工具与运行环境的影响,识别统计波动、关键回归及效果与成本的取舍。 5、与工程同学共同交付评测工具,亲自承担关键评估模块和实验原型;完善执行隔离、配置记录、运行证据、失败分类和结果报告,使评测可追溯、可重复执行。 6、优先接入内部重点产品,与产品团队共同分析问题、提出改进假设、复测效果,形成能支持业务判断的案例及可复用方法。 7、基于实际评测结果探索模型合作方向,梳理能力短板、数据需求和可行实验;与算法或模型团队沟通优化方案,依据证据判断是否值得进一步投入。 8、保持小团队中的一线技术贡献,推动数据、产品和工程协作,并将有效实践沉淀为文档、接口和工具能力。

任职要求

1、有模型、LLM 应用、Agent 或复杂智能系统的评测与效果优化实践,能说明问题定义、数据来源、评估方法、实验设计、个人贡献和结果。来自质量工程或开发者工具领域的候选人,需提供同等深度的相关证据。 2、具备数据集建设能力,理解代表性、覆盖度、标注质量、数据泄漏、重复样本和分布变化对评测结论的影响,能够设计持续维护方式。 3、具备扎实的实验分析与评估策略能力,能够合理使用抽样、对照、重复实验及不确定性分析,避免仅凭单次总分或主观体验下结论。 4、理解自动评估与人工判断的适用边界,能够验证模型裁判与专家判断的一致性,并使用确定性验证支持代码相关任务的评估。 5、理解 Coding Agent 的任务执行机制,以及模型、规则、Skill、工具、上下文和运行环境对结果的影响;能够通过代码、测试和执行记录定位问题。 6、具备扎实的软件工程能力,熟练使用 Python 或其他适合评测系统的语言,能够独立实现数据处理、评估器、实验原型和必要的服务集成,处理失败、重试与证据缺失。 7、有从 0 到 1 交付并持续改进的经历,能在有限资源下收敛范围,与现有平台协作,形成真实产品采用和效果验证。 8、能将实验结果转化为产品与技术决策,清楚表达结论、限制和下一步行动,并推动跨团队落实。
前往官网申请 →