共 2454 个在招岗位 · 阿里巴巴在杭州的最新招聘信息
【团队介绍】 阿里巴巴中间件团队是集团基础技术的核心支撑力量,负责消息、服务发现与软负载、分布式协调、任务调度)、配置管理等核心中间件产品在集团内部的稳定性保障与运维体系建设。 这些中间件承载了阿里集团几乎所有在线业务的流量调度、服务通信与数据流转,覆盖电商、物流、本地生活、云计算、大文娱等 BU,日均处理万亿级消息、百万级服务节点调度,是每年双 11 大促的底层生命线。 团队当前重点方向: 1、稳定性工程 — 从准入规范、变更管控到容灾演练的全链路保障体系,目标全年中间件可用性 99.99%; 2、AI 智能运维(Agentic SRE) — 将运维经验沉淀为 Agent Skills,通过 LLM + MCP 实现告警自愈、风险治理、架构演进,通过 AI 提升中间件产品的稳定性 我们相信:下一代 SRE 不只是运维工程师,更是用 AI 重新定义运维的人。 如果你既有系统功底,又对用技术杠杆 10x 提效充满热情,这里是你的主场。 【职责描述】 1. 负责阿里巴巴集团核心中间件(软负载 / 消息 / ZooKeeper / 配置中心等)的稳定性保障,包括故障定位、性能调优、容量规划与成本治理; 2. 主导中间件重大风险识别、应急预案设计与容灾演练,确保分钟级恢复能力; 3. 建设中间件 + AI 智能运维体系(Agent / Skills / MCP),实现 10x 效率提升,将人工经验沉淀为可复用的自动化能力; 4. 面向业务需求提供中间件选型建议与架构方案,联动产品和开发推动落地; 5. 参与大规模集群建站、大促备容及架构升级,支撑集团业务持续增长。
我们是 AI 时代的 Serverless / FaaS 平台核心研发团队,承担集团内 AI 生码、Agent 触发、CDN 边缘计算、AI 前端渲染等高价值业务的运行时与流量入口。日均函数调用规模在百亿级,对接 HTTP、Mtop、MetaQ、HSF、SSE、MCP、A2A 等多协议触发链路,负责让函数应用"既能极致弹性,又能稳态承接高流量"。 我们正在建设: ● 面向 AI Agent 与 AI 生码场景的统一函数运行时; ● 多协议、可灰度、可观测的高流量函数触发网关; ● VPC 隔离、身份联通、SRE 护栏完备的平台底座。 我们需要你和我们一起,把"函数 + 网关"这条主链路做成集团级的稳定基础设施。 【岗位职责】 1. 函数应用架构与运行时演进 ○ 协同推进函数应用模型(Function Application)的设计、演进与平台落地,支撑 AI 生码、AI Agent、边缘渲染等核心场景; ○ 推进多语言 Runtime 的能力建设:冷启动优化、并发模型、隔离机制、资源调度; 2. 高流量函数触发网关研发 ○ 负责函数触发网关的核心链路研发:HTTP / Mtop / MetaQ / SSE / MCP 等多协议接入、路由、鉴权、限流、降级、灰度; ○ 优化网关在百亿级日调用、突发流量、长连接(SSE / WebSocket)等场景下的稳定性与吞吐; 3. 稳定性与可观测能力 ○ 建设网关与函数运行时的全链路监控、调用链、SLO 体系; ○ 推动 SRE 护栏(diff、CF Gate、预发校验)落地,保障 P 级业务变更"零事故"; 4. 跨团队协同与技术布道 ○ 与 AI 平台、CDN、SRE、安全、阿里集团研发平台Aone / O2 发布等团队协同,沉淀平台级最佳实践; ○ 输出技术方案、架构评审、团队分享,推动 FaaS / 网关在集团内的标准化与生态建设。
• 需求对接与方案交付:作为集团AI业务算力需求的核心对接人,深入理解业务场景,将模型部署需求转化为算力规格(TPM、MU等)和SLO性能指标,输出可落地的需求应答和交付方案。协调应用团队、推理引擎团队与SRE团队,组织方案评审、跟进交付进度,确保服务保质保量上线。 • 资源效能分析与治理:建立AI算力资源的效能监控体系,围绕GPU利用率等核心指标进行数据分析,识别资源浪费和瓶颈场景,推动治理方案落地执行。跟踪核心业务推理性能表现,发现偏差时协同引擎团队调优,保障业务侧感知的推理速度与稳定性。 • 服务流程与标准化建设:建立并持续优化集团内部算力服务流程,沉淀标准化的需求受理、方案评审、交付验收规范。结合服务过程中的共性问题,利用AI Agent或自动化工具提升服务效率,沉淀最佳实践。
1. 负责阿里集团大规模 Kubernetes 调度集群与 AI 资源池资源管理系统的设计、研发与运维 2. 负责 K8s Master、etcd、节点管理、弹性能力、数据体系、风控体系等核心组件的设计、研发与运维,保障管控面的高可用与可扩展 3. 负责 K8s 调度集群与节点基础环境的稳定性能力建设,构建可观测性、监控告警、异常检测与自愈恢复、研发质量等 DevOps 基础平台 4. 负责海量 GPU / XPU 服务器的稳定性和自动化运维能力建设,包括健康检测、故障自动隔离与自愈、在线率保障等,保障资源高效率、高质量交付 5. 探索 AI 驱动的智能化运维能力,结合 LLM / Agent 等技术持续提升资源管控平台的自动化、智能化与自愈水平
● 岗位定位: 你将作为AI视频生产应用与Agent系统的核心建造者,负责打造这个时代最具创造力的“自主智能体”。我们正在用Agent重新定义视频生产的工作方式——不是让AI辅助人类操作,这个Agent将能够理解人类的创意意图,自主规划、调度并执行从创意到成片的整个视频创作流程。你将站在AI技术与视频创意的交汇点,设计并落地驱动这一切的Agent系统,让每个人都能指挥一个“AI制作团队”,让AI成为真正的"视频生产者"。 ● 核心职责 1. AI视频生产Agent架构设计 ● 主导设计面向视频全链路生产的Multi-Agent系统架构,拆解并定义不同角色Agent的能力边界与协作协议。 ● 构建支持复杂任务分解、动态规划、自主决策、异常恢复的Agent运行框架。 ● 设计Agent间的通信机制、状态管理与记忆体系,保障长链路生产任务的一致性、可追溯性与可干预性。 2. 多模态模型集成调优 ● 持续跟踪并将最新的图片生成、视频生成、音频生成、VL等多模态大模型集成进Agent生产链路,保持Agent能力的持续技术领先。 ● 对模型输出质量进行系统性调优,针对视频生产场景的语义一致性、运动合理性、视觉/音频质量、叙事逻辑性、指令遵循度、情绪传达力等关键指标进行专项优化。 ● 建立模型能力评测基准体系,定义质量基线与模型SLA,构建覆盖模型选型、版本对比、回归验证的数据化决策链路。 3. 任务规划与工作流编排 ● 设计基于LLM的动态任务规划引擎,支持自然语言输入→任务图生成→并行/串行执行→结果聚合的完整链路。 ● 在平台层统一工作流引擎之上,根据不同创作意图、内容类型、生产规格,在运行时动态构建差异化的视频生产工作流。 ● 攻关长链路任务的可靠性保障:任务断点续传、局部重试、人机协同介入点设计等核心工程难题,确保复杂任务在动态工作流下依然稳定可控。 4. 提示词工程与效果优化 ● 系统性构建面向视频生产各环节的Prompt工程体系,包括分层结构化、动态上下文、领域知识、多模态提示协同对齐等精细化设计。 ● 建立Prompt版本管理、A/B评测、自动优化机制,通过数据驱动持续提升Agent各节点输出质量。 ● 探索基于RLHF、DPO等技术的偏好对齐方法,让Agent的生产风格与用户意图高度契合,逼近"零修改直出"。 5. 视频生成流程自动化 ● 端到端打通从"创意"到"成片输出"的全自动化生产流水线,以最小化人工干预节点为终极目标。 ● 构建智能质检Agent,对生成视频进行自动化质量评估、问题定位与修复决策,形成自我纠错的生产闭环。 ● 设计支持批量生产、个性化定制、多风格并行的自动化调度体系,支撑规模化内容生产的工业级需求。
1. 与SAP销售团队对接,挖掘SAP Cloud ERP在阿里云上的商机,并协调双方销售团队共同跟进并落单; 2. 组织阿里云各销售组织,主动挖掘企业客户SAP Cloud ERP的商机,并协同SAP销售团队协同跟进并落单; 3. 与SI生态伙伴协作,推动SAP、阿里云和SI伙伴多方协同,确保SAP Cloud ERP商机挖掘、落单、至成功交付; 4. 协助公司构建并制定SAP Cloud ERP GTM的整体体系及策略,推动SAP Cloud ERP在SAP和阿里云双方销售组织中的GTM,并取得数字结果; 5. 协助探索并建立起:双方销售组织对联合销售的业绩计收管理规范,确保销售的满意度,并促进长期合作; 6. 参与公司整体业务战略的讨论,确保产品策略与公司发展方向一致。
1.基于模型内部评测和错误案例,系统性分析模型能力边界和短板;建立能力拆解框架(如代码生成可拆分为理解、规划、实现、调试等子能力) 2.主导高质量数据的获取、清洗、增强和验证;探索先进的数据合成技术(如基于强模型的蒸馏、多智能体协作生成)。 3.设计小规模实验验证数据有效性,建立数据-效果关联分析机制,量化数据投入产出比。
1、配送团队组建,有效进行运力管理,保证大促或异常天气时配送运营正常; 2、与三方供应商对接配送员日常的入离职及招聘,与三方供应商保持良好的沟通与配合; 3、处理配送中的突发重大异常并能及时给出有效的解决方案,重大异常事件要第一时间进行上报; 4、监控配送数据及异常情况,执行日报、周报及月报制度,针对所发生的客诉要及时跟进并反馈结果; 5、对本门店的配送考核指标KPI完成结果负责,推动配送管理组快速落实成本控制及服务质量提升要求; 6、新门店的配送商圈预跑、路由地址基础信息采集及上报,配送范围定期回顾并视需要及时调整; 7、负责本门店的社会众包拉新、引入、培训及日常运营管理; 8、与本门店其它部门保持良好的沟通,保证跨部门协调与合作顺畅进行。
1、负责高德【SKA商户】运维成长及营收(包含但不限于 效果广告、CPS、年费续签等),针对高德到店行业(家装/到店零售等行业),完成品牌的收入提升和行业先锋案例; 2、负责【行业增长策略】,与业务团队、产品运营 三个角色形成合力,明确行业增长策略,完成行业方法论沉淀,产出行业宝典等相关内容; ; 3、负责行业产品优化、推动和设计,为产品GTM指标和业务增长指标负责,推动高德经营经营产品和广告产品行业化落地;
1. 建设超大规模训练的稳定性治理体系,围绕有效训练时长(ETTR)与 Goodput 做端到端度量与优化,量化并持续压缩因故障、回滚、启动带来的无效算力(Badput)。 2. 构建覆盖软硬件异常的故障可观测能力,完善日志、指标、事件的采集与关联分析;研发智能诊断能力,实现训练 slow / hang / OOM / 通信异常等故障的快速定界与根因追溯,沉淀故障模式库与自动诊断规则。 3. 研发自动容错与快速恢复机制,支持断点续训、Pod 级快速重启、节点自动自愈、动态降级与局部重试;优化 failover、本地盘 / 缓存与 Checkpoint 恢复链路,缩短故障恢复时延。 4. 建设节点健康度评估与主动巡检体系,覆盖 GPU、网络、存储等软硬件健康,实现故障节点的快速隔离与自愈;支持 Ray 等分布式框架下的作业级故障感知与处理。 5. 与算法及框架团队协同保障训练全生命周期稳定交付,沉淀可复用的稳定性平台能力,推动变更灰度与自动化运维。
1. 评测平台架构与框架建设。设计并研发面向大模型与Agent的通用评测框架,支持多模态输入输出、长程任务执行、工具调用链路、执行反馈等评估维度;推动评测流水线标准化,打通数据集管理、环境隔离、任务调度、指标计算、结果归档与可视化各环节;对评测结果做数据清洗、统计分析与可视化,向算法团队输出分析报告与洞察。 2. 评测集适配与建设。吃透业界主流评测集(如SWE-bench、Terminal-Bench、JobBench等),完成向平台的精准适配;面向代码生成、工具使用、推理、多轮对话、多模态生成等任务场景,设计可量化的评估方式与指标体系;建立Benchmark版本管理机制,让评测过程与结果可追踪、可对比、可复现,支撑模型迭代决策。 3. 评测任务Agent化与Harness Engineering。以Harness Engineering思路把评测任务本身Agent化,提升评测集接入效率与执行的智能化水平;开发自动化诊断工具,定位评测适配异常、指标抖动、环境漂移等问题,降低人工排查成本;探索LLM-as-Judge、多智能体评判、人类偏好对齐等前沿评测范式,提升评估的客观性与覆盖度。
1. 负责阿里集团评测平台的整体架构设计与核心能力建设,覆盖基座模型、Agent与Skills等评测对象,支撑文本/生图/音频/视频等多模态模型,Agent以及集团内各类Skills的评测需求。 2. 搭建评测诊断、归因分析与报告生成能力,沉淀一套可复用的评测分析方法论;针对评测失败原因、得分分布、执行轨迹与Badcase做深度归因,为基座模型、Agent与Skills的能力迭代提供依据。 3. 跟进业界模型与Benchmark的最新进展,制定评测实施计划与应急预案,推进评测任务落地、验收评测结果并产出高质量分析报告,把评测元信息、结果与报告沉淀为可管理、可检索的数据资产。 4. 与领域专家团队协作,支撑评测集的制作、验收与上架,配合完成敏捷评测与全面评测,提升评测全链路的自动化程度与工程效率。 5. 支撑集团内各类Agent及竞品接入EVA+自动化评测体系,开发Agent接入诊断与提效工具,建设业务评测集的自动化生成能力,降低业务方的接入与维护成本。
1. 1年以上销售工作经验,有TOB方面销售经验者优先考虑 2. 敢于挑战,善于学习,抗压性强,有销售的韧性和要性 3. 内心热爱销售工作,热爱与客户打交道,有高度的责任心和客户服务意识
1. CPU 开发工具链全栈软件测试方案和测试执行,覆盖编译器、调试器、模拟器等核心组件的功能、性能及可靠性验证; 2. 分析定位跨组件的系统性问题,推动工具链各模块协同优化和问题闭环; 3. 设计并实现自动化测试框架与CI质量看护体系,构建跨组件的端到端验证流程; 4. 结合CPU开发工具测试业务开发对应的AI skill和agent。
1,负责协助客户完成智能网卡的技术评估和导入,及时定位并解决落地过程中的各类技术问题,确保产品在客户业务场景中顺利落地。 2,收集并分析客户需求,形成可落地的产品改进建议,与产品和研发团队合作推动需求落地与产品迭代升级。 3,与研发工程师合作,完成面向客户的技术文档输出与版本交付支持。
1. 负责研发AI类算法的计算性能优化能力,解决大模型等情境的算力和访存瓶颈,提升AI模型在GPU、AI加速器等硬件上部署性能和效率,推动大模型普惠应用和高性价比的竞争力; 2. 负责研发业界SOTA的计算性能优化算法创新和工程落地,增强技术壁垒,并在云的商业业务中产生核心价值; 3. 负责高性能AI基础设施的构建,基于软硬结合的计算性能优化能力,在AI类业务场景尤其是大模型场景下,通过结合模型算法和硬件来充分挖掘软硬协同的组合优化潜力,实现单一领域无法达到的优化边界和收益,带来高价值的性能和成本优势。
1、服务器软硬件结合系统、模块设计与开发:基于服务器产品进行软硬件模块需求分析、技术方案设计、开发和验证交付。 2、服务器系统与场景应用优化:对服务器进行软硬件一体场景化性能优化和分析,实现软件系统稳定性/性能的提升;基于不同应用场景进行性能分析和调优,实现客户场景性能提升。 3、服务器系统测试与维护:基于服务器软硬件系统以及应用场景进行集成验证,对系统性问题进行分析定位,快速解决,保证满足系统性能、稳定性等要求。
1. 负责服务器产品、部件及芯片相关研发项目的项目管理工作,保证项目端到端的高效交付。 2. 制定并执行服务器研发项目的总体计划,包括进度、质量、成本和风险控制等。 3. 在项目研发过程中识别关键瓶颈与问题,推动问题闭环解决,确保项目按时、保质、保量完成。 4. 持续优化项目研发流程,改进流程中的薄弱环节,形成标准化的组织资产,提升团队整体效率。 5. 协调跨部门合作,包括研发、测试、采购、生产等相关方,确保项目顺利推进。
1. 负责大模型全模态后训练能力线的产品规划与设计,覆盖文本、视觉、语音、多模态等方向的训练解决方案,定义产品路线图与迭代节奏,推动后训练能力持续演进与行业领先。 2. 主导"开箱即用"CPT/SFT/RL 微调训练平台的产品设计与落地,联动算法与工程团队,将通义模型训练和评测算法沉淀为平台化能力,支撑用户使用自有数据高效完成个性化模型定制。 3. 搭建面向定制的数据工程能力,规划模型蒸馏与压缩产品,负责定制产物的全生命周期管理,设计微调任务的版本管理、任务进度与资源监控、微调模型评估、以及一键部署上线的链路,打通"训练—评估—部署"闭环。 4. 深入洞察 MaaS 平台客户的模型定制化需求,面向行业场景设计模型定制解决方案,推动通义基础模型与训练数据能力的产品化、商业化落地,服务高净值客户并实现规模化复制。 5. 跟踪大模型训练平台与 MaaS 行业趋势,分析竞品动态与客户反馈,建立产品效果评估与数据分析体系,持续优化产品竞争力、客户体验与商业收入。
1. 负责MaaS网关的产品规划与设计,构建模型服务统一接入层,覆盖鉴权、限流、路由、计量计费等能力,支撑企业客户稳定高效地调用模型服务。 2. 负责MaaS企业级能力的产品设计与迭代,包括多租户管理、权限管控、审计合规、数据安全等模块,满足大型企业客户在大模型落地过程中的企业级治理要求。 3. 负责MaaS 平台功能的产品规划,保障模型浏览、试用、开通、部署、监控的全链路用户体验,持续提升开发者与企业用户的使用效率与满意度。 4. 负责MaaS CLI与Agent工具链的产品设计,打造开发者友好的接入与调用体验,降低模型集成门槛,推动模型能力在Agent场景中的规模化和自动化应用。 5. 协同研发、算法、解决方案与运营团队推动产品落地,制定可量化的产品指标并基于数据持续优化迭代。
1. 负责 MaaS 模型托管部署产品的整体规划与全生命周期管理,定义模型接入、部署上线、运维迭代全流程的产品方案,持续降低客户使用门槛,提升托管模式的市场渗透率。 2. 深入理解企业级客户在性能确定性、资源与数据隔离、稳定性及合规等方面的核心诉求,定义产品形态、功能与交付标准。与基础设施、算法、工程团队紧密协作,将底层算力与推理能力抽象为客户易理解、可自助、可观测的产品。 3. 定义专属部署的 SLA 与可用性保障体系,与运营、SRE 团队协同落地,保障企业级服务的稳定与可信。设计专属部署的计费与商业化模式,输出有竞争力的定价策略与售卖组合,支撑 MaaS 业务商业化目标达成。 4. 制定部署产品的 GTM 策略,联动解决方案、销售与运营团队打造行业标杆案例,沉淀销售工具包与可复制打法,推动在重点行业客户中的规模化落地。 5. 对标国内外竞品的部署产品形态,持续跟踪 MaaS 赛道竞品动态与大模型客户需求变化,输出竞品分析与市场洞察,驱动产品功能与商业化策略的快速迭代。
1、负责和参与DPU芯片的应用场景与需求分析; 2、负责和参与DPU芯片架构方案的讨论与设计; 3、负责和参与DPU芯片各子系统微架构的方案设计与编码; 4、与验证团队协同完成芯片BUG收敛,包括芯片问题定位分析、Corner点识别和覆盖率分析等; 5、负责和参与模块的物理综合和设计。 Job responsibilities: 1. Be responsible for and participate in the analysis of application scenarios and requirements of DPU chips; 2. Be responsible for and participate in the discussion and design of DPU chip architecture; 3. Be responsible for and participate in the scheme design and coding of the microarchitecture of DPU chip subsystem; 4. Cooperate with the verification team to complete chip BUG convergence, including chip problem location analysis, Corner point identification and coverage analysis, etc; 5. Be responsible for and participate in the physical synthesis and design of modules.
职位描述 1. 运用科学的方法,分析业务与技术中的问题和机会,形成具有前瞻性和可操作性的结论或行动项。 2. 针对广告业务和技术进行数科体系建设,包括但不限于数据体系、分析方法论和分析工具。 3. 与产研团队合作,对业务结果负责。
1. 负责俄罗斯进口关和3PL配送的日常运营及方案完善; 2. 负责俄罗斯进口关和配送时效、成本及体验相关指标,跟踪日常运营数据,跟进日常运营事项,确保各项运营指标平稳持续提升; 3. 协同前中后台各团队及各供应商,做好俄罗斯关务和配送相关运营需求的承接及落地; 4. 负责俄罗斯关务和配送大促保障,支持各平台及中小商家客户的大中小促销,保障大促服务不降级;具备承担全链路大促保障的能力。 5. 支持其他业务团队、产品团队、技术团队、财务结算、法务等团队,输出关务和配送业务判断和决策等。
1. 负责泛俄跨境小包的产品设计及产品运营 2. 协调上下游资源方和产品技术团队推进俄向跨境解决方案和产品优化,提升和完善泛俄跨境产品竞争力 3. 协同质控运营快速响应系统调整,支持销售团队和服务团队保障客户体验 4. 处理日常信息下发、数据处理、分单路由、组网调整等产品实施工作
1. 负责1688平台AI客服Agent的架构设计、智能化对话系统构建; 2. 设计并优化电商场景下的意图理解、上下文记忆管理、wiki知识库应用,提升用户交互体验与AI客服的服务能力; 3. 联合产品、算法团队推进AI客服系统落地,通过数据驱动持续迭代模型性能并保障业务目标达成。
1、负责千问智能体开放平台的技术架构与演进方向,面向各类商业场景完成 Agent 端到端的系统接入与优化,制定垂直场景专家服务的接入技术规范与标准,让业务接入成本持续下降、迭代持续加速; 2、负责 Agent Infra 核心能力建设。把千问的核心能力整合成标准化服务,包括知识库、Skill 中心、Tool-Use 环境等,对基建的可用性、扩展性与使用体验负责。 3、负责高复杂度 Agent 场景的全链路技术方案,主导千万级系统的架构设计、稳定性保障与性能优化,对线上质量和业务结果负责; 4、判断并推动前沿技术落地,跟踪 Agent 框架、多模态与推理模型、Tool-Use 等方向进展,决定投入优先级,将有价值的技术转化为平台能力; 5、负责团队建设与管理,完成目标拆解、项目推进、能力建设与人才培养;与产品、算法、运营、业务团队协同,推动复杂项目高质量落地。
1. 负责跨境业务的业务规划和落地实施, 对指标敏感,有针对性的方法优化指标,制定用户增长、留存及转化路径,带领团队达成业务目标; 2. 探索跨境业务新场景与商业模式创新,尤其设计和落地生态业务,有突破性的策略,快速扩展海外市场,建立影响力; 3. 管理并培养业务团队,通过AI应用、数据驱动和敏捷迭代方法,确保团队目标与个人能力的持续提升。
我们正在从 0 到 1 搭建 Work(AI 协同办公)方向的 RL/RFT 训练数据体系,覆盖多个专业领域。端到端负责一个(或多个)领域的数据集从任务定义、instance 构造、reasoning 生成到分层验证的全链路,是模型训练飞轮里承上启下的关键位置。 1. 领域任务体系搭建(Taxonomy 设计) 对陌生专业领域做结构化拆解:一级领域 → 二级场景 → 任务类型 → instance 模板,产出可复用、可扩展的标注体系。 2. Instance 与 Reasoning 构造 设计 instance 结构(instruction + context + reasoning + output),并针对不同任务选择合适的 reasoning 获取路径(强模型蒸馏、模板化拆解、真实文本抽取、人机协作等)。保证 reasoning 是 SFT/RFT 训练可直接使用的高质量推理链。 3. 分层验证方案设计 针对不同任务定义分层校验机制:规则硬匹配 → 结构完整性 → LLM-as-judge(将主观判断拆解为 yes/no 子问题)。把"评价推理质量"这类模糊问题降维为可自动化、可追溯的子任务。 4. Rubric 与评分标准建设 制定各方向 Rubric、评分分级与标注案例库,定义黄金集(golden sets)和奖励信号(reward signals),确保训练数据质量可量化、可迭代。擅长大批量生成高质量 rubric,而不是拍脑袋写几条规则。 5. 轨迹标注与 Bad Case 归因 对模型 Rollout 产出的多步执行轨迹进行逐步标注(正确性 / 必要性 / 思考质量 / 整体 Reward),并对失败步骤做根因分类(模型能力不足 / 评测标准缺陷 / 任务定义模糊 / 运行依赖缺失),输出结构化改进清单驱动训练数据补充与评测体系修正。 6. 标注质量管控 建立双标一致性校验、金标抽检、系统性偏差检测与分歧仲裁机制,管理外部数据供应商交付质量、运营内部专家产能,确保标注间一致率 ≥80%,数据可直接用于 Reward Model 训练。 7. 外部协作与专家资源整合 与高校老师、领域专家协作定义验收标准、评审样本、迭代规范,把外部资源转化为规模化精标数据;管理供应商时能给出清晰的标注规范、边界案例和仲裁依据。 8. 数据 → 模型 → 评测 闭环 周期性输出数据质量报告,识别模型能力薄弱区间,指导算法团队调整 Rollout 抽样策略与难度分布;随模型迭代补充更高难度标注数据,保持 Reward Model 区分度。
1、根据公司业务发展战略,建立和完善公司产品知识库及培训体系,包括新员工入职培训、产品更新培训、销售技巧培训等; 2、深入研究数码产品(如AI眼镜、智能手机、可穿戴设备、智能家居等)的技术参数、核心卖点及竞品分析,开发生动、实用的产品培训课件和销售话术; 3、 组织并实施线上线下相结合的培训活动,包括但不限于产品发布会后的全员培训、区域销售团队巡讲、线上直播培训等,确保培训效果落地; 4、 建立培训效果评估机制,通过考核、问卷、销售数据对比等方式,持续优化培训内容和形式; 5、深入一线,了解销售团队在产品知识方面的痛点和难点,提供针对性的辅导和支持,协助解决客户异议; 6、密切关注智能眼镜行业发展趋势、新技术应用及竞品动态,及时更新培训内容,保持团队的市场敏锐度。