共 1119 个在招岗位 · 阿里巴巴在北京的最新招聘信息
1. 媒体处理核心系统架构与研发 ● 主导视频转码、截图、Meta 、媒体工作流、切片打包等核心媒体处理能力的架构设计与持续优化,保障高并发、高可用、低成本。 ● 负责转码增强方向(超分辨率、窄带高清、画质修复、音频增强等)的技术探索与工程落地,结合 AI 提升媒体处理效果与效率。 ● 设计并优化大规模媒体处理任务调度、状态流转、数据一致性与资源利用率,支撑日均千万级媒体处理任务。 ● 负责媒体处理服务的稳定性建设,包括 API 5XX 治理、可观测性、容灾降级、自动化运维与灾难恢复预案,系统可用性目标 99.9% 以上。 2. AI 原生应用落地(Agent & RAG) ● 深入媒体处理业务场景,利用 Agent 技术拆解复杂业务需求,设计包含记忆管理、推理策略、工具调用的智能系统,实现媒体生产与运维的自动化闭环。 ● 搭建基于 RAG 的视频与媒体处理领域知识库,优化向量检索、召回质量及上下文注入策略,为大模型提供精准的编解码参数、业务规则等知识支撑,有效抑制模型幻觉。 ● 负责意图识别、步骤规划、反思纠错等 Agent 关键模块的工程化落地;封装标准化 SDK/API,构建 Agent 观测体系,实现全链路追踪与多维效果归因。 ● 探索大模型在智能运维、自动化问题定位、智能文档生成、智能转码参数推荐等场景的落地。 3. 技术融合与效能提升 ● 将传统媒体处理技术与大模型能力结合,探索基于自然语言指令的视频编辑、智能摘要、自动化质检、智能封面、内容审核等创新功能。 ● 作为 AI 编程工具重度用户(如 Qoder、Cursor、通义灵码),通过高阶 Prompt Engineering 和自动化代码生成提升研发效率;建立自动化评测与回测机制,推动 AI 能力从单点验证走向规模化落地。 4. 前沿技术探索与团队影响 ● 跟踪业界在多模态大模型、智能媒体生产、分布式计算、云原生方向的最新进展,将其转化为可落地的技术方案。 ● 每季度输出至少 1 篇高质量技术沉淀(架构设计文档、专利或技术博客),持续提升产品行业影响力。
1、与算法团队对接,协助多模态理解大模型训练数据的评测体系设计,参与评测数据集构建及后续摸底报告产出,将算法团队的图文交织、高精度OCR、精细化图像描述等研究需求,转化为具体的评测任务 2、负责大模型训练及评测所需的数据标注任务全流程管理,包括需求拆解、规范制定、任务分发、进度监控及质量验收。 3、管理评测标注团队(专家社区&供应商等),制定培训计划与绩效考核方案,并负责项目结算。
1.技术战略与路线决策 (Technical Strategy & Roadmap) 定义 Agentic AI 业务的整体技术演进路线,对技术选型的前瞻性与落地性同时负责。 主导核心技术路线的战略级取舍,避免因归因错误导致的规模化资源浪费。 与业务及产品负责人共同定义技术目标与节奏,确保投入与业务北极星指标强对齐。 2.Agent 质量体系与评测飞轮 (Quality System & Eval Flywheel) 对线上 Agent 的端到端质量直接负责。建立系统级的 Agent 标准,让"好不好"成为可度量、可归因、可迭代的工程问题。 构建从数据清洗、Bad Case 挖掘、评测执行到修复上线的自动化闭环飞轮,持续压缩问题发现到修复的周期。 解决离线评测与线上体验的错位问题,建立离线 Eval、在线指标与人工抽检三者互相校准的质量体系。 3.平台化与基础设施 (Platform & AgentOps) 统筹 Agent Infra & Platform 建设,包括 Agent 框架、Eval 平台、Sandbox、可观测性 (Observability) 以及统一的工具调用 (Tool-use) 能力。 主导 Context Engine 的架构演进:RAG、Memory、上下文组织与数据供给,确保 Agent 在真实业务数据上的准确性与新鲜度。 对平台建设保持克制与判断力,清楚区分"应该沉淀为平台的共性能力"与"应该留在业务侧快速迭代的能力",以平台采用率而非平台数量作为衡量标准。 4.工程效率与成本经营 (Engineering Efficiency & FinOps) 对单位任务成本、推理效率与资源利用率负责,将成本能力建设为业务的结构性优势而非事后补救。 主导 Agent Ops、FinOps 与资源调度体系建设,把成本账算到可归因的粒度,支撑技术决策与商业化定价。 持续投入研发效率工具与工程基建,让团队的产出效率随规模增长而不是被规模稀释。 5.应用交付与端到端体验 (Applied AI & Delivery) 统筹 Applied AI 与产品功能的交付,对从模型能力到用户手中体验的完整链路负责。 在不确定性极高的底层模型之上,交付具备生产力级别稳定性的用户体验:定义 Agent 的自主权边界、错误恢复机制与人机协作范式的工程实现。 建立跨方向的联合作战机制,避免 Infra、Applied AI、Context 各自为战,确保同一个质量问题有统一的归因和裁决路径。 6.组织建设与人才培养 (Org Building & Leadership) 带领团队下多个技术方向,搭建下一层组织人才,定义技术标准与人才梯队。 打造兼具工程师文化与良好 AI 技术直觉的复合型团队,让工程与算法能够在同一套语言体系下决策。 在高速迭代、充满不确定性的 AI 浪潮中保持团队的战略定力,建立容错、鼓励验证、以结果为准的技术文化
1. Agent Harness与长时任务 负责生产级 Agent Harness 核心算法与系统研发,包括上下文工程、工具调用、任务编排、状态持久化、权限控制、异常恢复和轨迹回放。 构建面向长时任务的分层记忆系统,包括工作记忆、情景记忆、语义记忆、经验记忆及长期 Artifact 管理。 重点突破 Long-horizon Planning 中的目标漂移、错误累积、上下文膨胀和决策不稳定问题。 2. Agent RL与后训练 负责 Agent RL 训练和策略优化,提升 Agent 在复杂工具调用、代码生成、多步推理及多模态创作任务中的成功率与鲁棒性。 构建长轨迹任务环境与 Benchmark,建立从任务生成、轨迹采集、结果验证到策略训练的完整闭环。 开展 SFT、Reward Modeling、DPO、PPO、GRPO等训练工作,结合成功与失败轨迹实现持续策略改进。 3. 多模态创作和World Model 创作链路 搭建高可用的多模态智能创作链路,实现从创意理解、文本脚本、分镜规划到图像、视频、语音和交互式世界生成的完整闭环。 结合世界模型开展 Agent 决策应用,利用世界模型进行多步前瞻、动作仿真,在执行前评估不同动作序列的潜在结果。 推动世界模型在 AI 视频、互动内容、数字人、3D场景和可交互虚拟环境中的产品化落地。 4. 前沿技术预研 跟踪 Agent RL、World Models、多模态生成和交互式智能体等方向的最新进展。 快速复现和评估学术界及开源社区的前沿方法,推动有效方案在工业场景中的落地。 输出有影响力的学术或开源工作
1. 主导多模态理解大模型评测体系设计,从真实用户场景出发定义核心能力维度,将体验痛点转化为可量化的评测指标。 2. 设计覆盖信息检索、内容理解、文档分析、视频摘要、富媒体问答等高频场景的评测任务,推动评测从"学术任务"向"产品体验"演进。 3. 持续挖掘真实使用中的 Bad Case,做系统性分类与归因,形成问题清单与改进优先级。 4. 建立评测数据质量管控与版本管理机制,定期更新评测集以覆盖新场景与新模态组合。 5. 与产品、算法团队紧密协作,在新模型上线前完成评测,提供数据驱动的优先级建议。
1、从事RISC-V CPU 编译器的研发工作,包括编译器架构设计、优化遍开发、应用程序性能分析调优等工作。 2、从事RISC-V CPU的ISA、硬件微架构的软硬件协同设计和优化工作,给每款处理器提供高效的编译后端,同时通过Benchmark和应用负载特征优化CPU的ISA及微架构设计。 3、参与编译领域前沿技术、开源社区的跟踪,并负责编译器领域关键社区的代码维护工作。 4、参与RISC-V 国际基金会的技术跟踪和讨论,推进RISC-V 扩展指令集的优化演进。
团队负责阿里巴巴多模态基础模型的数据体系建设,支撑行业领先的视频生成模型训练,处理百亿级图像、视频及图文数据。 本岗位聚焦复杂多模态数据管线建设,持续提升大规模数据处理的吞吐、正确性与数据质量,为 Pretrain、SFT、RL 提供高效、可靠的数据供给。 职位描述 1. 设计和建设百亿级多模态数据处理管线,覆盖数据清洗、解码、转换、过滤、标注及训练加载等环节。 2. 深入分析 CPU、内存、网络、存储、编解码及任务调度瓶颈,提升端到端吞吐、资源利用率和系统稳定性。 3. 建设数据校验与质量评估体系,保障数据完整、一致、可追溯,持续提升数据的准确性、多样性和有效性。 4. 基于 Ray、FFmpeg、PyTorch、vLLM 等技术建设高性能数据处理与模型推理组件,优化任务切分、批量推理、资源调度、数据传输及容错恢复。 5. 面向 Pretrain、SFT、RL 等训练阶段,协同设计数据格式、分片策略、存储布局和读取链路,提升训练数据供给效率。 6. 建立数据管线可观测体系,持续监控吞吐、延迟、资源利用率、失败率及数据质量,并分析数据特征与模型效果的关联。 7. 与算法、训练框架及基础设施团队协作,完成复杂数据链路的架构设计、性能优化和规模化落地。
岗位定位 高德地图家装行业(家居、家具、家电类目)资深专家,通过LBS+AI能力帮助品牌商家实现本地化营销增长,对辖区收入目标负责。 核心职责 1. 负责辖区内家居/家具/家电品牌客户的日常运营,包括年费续签、效果广告消耗、品牌广告拓展 2. 推动新签客户入驻,从0到1搭建品牌在高德地图的营销阵地 3. 为商家提供本地生活营销方案,打通"搜索曝光-导航到店-AI咨询-团购留资-到店核销"全链路 4. 配合营销节点(315家装节、618、双11等)策划品牌营销活动
1.负责 UC 信息流核心推荐算法,包括召回、排序、用户画像、推荐策略及生成式推荐创新;对信息流 DAU、留存、时长、分发效率等核心指标负责。 2.制定并落地 UC 信息流推荐技术路线图,深入迭代生成式召回、HSTU 精排、LLM 画像、跨场景建模等方向。 3. 应用机器学习/深度学习技术(如DNN、Graph Neural Networks、多任务学习、序列建模、生成式推荐等)改善用户体验。
1. 负责音视频 Caption 中音频内容的评测体系建设,覆盖语音、环境声、声音事件、音乐、复杂声景及声画关系。 2. 主导评测数据集建设,包括任务定义、场景设计、样本采集、标注规范、质量控制和难例补充。 3. 建立 Caption 评测标准,重点评估内容正确性、信息完整性、描述粒度、时间与声源定位、声画一致性,以及幻觉、遗漏和错误归因等问题。 4. 设计人工评测与自动评测相结合的方案,建设自动化评测链路,并持续验证自动评分与人工判断的一致性。 5. 开展模型对比、版本回归和典型案例分析,识别模型能力边界,输出清晰、专业、可执行的评测报告。 6. 与模型研发、数据和产品团队协作,将评测结论转化为数据补强、模型训练及产品体验优化建议。
搜索正迈向大模型驱动、多模态融合、自主任务执行的新范式。团队专注LLM/VLM与经典搜索内核、分布式引擎的深度融合,打造面向C端海量用户与B端政企客户的下一代智能搜索及对话式Agent产品。 1. AI Search与Agent核心架构及算法:制定AI Search与企业Agent中长期技术战略。主导传统搜索向AI原生架构的融合重构,全链路设计Query理解、多模态召回、精排、生成式答案与Agent编排。推进长文本/多模态检索与RAG体系优化,突破意图拆解、长上下文管理、工具调用与多步规划,建立知识连接器与安全护栏。 2. 底层引擎攻坚与AI系统基建:攻坚底层存储与分布式检索引擎,优化内核、索引结构与向量存储。通过存算分离、冷热分层、集群调度等手段,系统性解决延迟、成本与高并发稳定性问题。打通数据治理、向量嵌入、模型实验到灰度发布的标准化闭环,保障高吞吐与低成本。 3. 数据飞轮、模型训练与评测体系:构建“数据飞轮—场景微调(SFT/DPO)—自动化评测”的闭环体系,以检索导向的奖励信号与数据生态从源头强化事实忠实度,依托高置信度评测基线与动态消融实验,精准归因并系统性压制幻觉,保障企业级交付效果可靠性。 4. 商业化落地与政企交付闭环(聚焦业务结果与ToB交付):联动产研销团队,主导政企客户AI搜索与Agent方案落地。负责客户知识库结构化接入、向量化治理与记忆体系搭建,结合模型适配微调,推进工程化交付与评测,拿下KA客户。并沉淀行业解决方案与微调范式,实现标准化、规模化复制。 5. 团队管理、跨部门协同与技术影响力(聚焦组织发展与行业发声):管理跨方向技术团队,打造以存储工程为核心、模型定制与算法协同为延伸的复合型技术团队。
具体职责包括: 1. 模型服务架构:负责 AIGC 模型服务框架的设计与研发,建设统一的模型接入协议、Stage 编排、Engine 管理和 Runtime 能力,支持图像、视频生成等模型快速接入,降低能力形态与硬件组合增长带来的交付复杂度。 2. 分布式推理与性能优化:围绕 DiT 等计算密集型模型,参与并行方案设计,分析计算、通信、显存和 Pipeline Bubble 等核心瓶颈;结合 Profiling、通信计算重叠、Batching、CUDA Graph、算子融合等手段,持续优化任务时延、吞吐、显存占用、GPU 利用率和单位推理成本。 3. 调度与资源效率:面向分辨率、视频时长、采样步数等差异化请求,建设请求调度队列、批处理、QoS、流量路由和弹性伸缩能力;探索 Cohort Scheduling、动态 Pipeline、异构资源池调度等方案,在保障服务质量的前提下提升闲置资源和低成本资源的使用效率。 4. 下一代推理架构:参与 NVLink/NVSwitch等高速互联环境下的 Supernode-Native Serving 探索,建设拓扑感知的进程组管理、角色编排、进程生命周期和请求调度能力,推动新硬件、新并行方案在更大并行域下继续scale的平台能力。
岗位描述:面向"电脑操作智能体"(自主操作 GUI、浏览器、桌面 / 移动端软件完成任务的大模型 Agent),独立负责其能力提升的完整闭环。 岗位职责 1. 设计 CUA 评测任务与轨迹级评分体系(GUI grounding、任务规划、多步操作、长程任务成功率等),定位模型失败模式(误点击、幻觉操作、状态误判、循环卡死等)。对标并扩展业界 benchmark:OSWorld、WebArena / VisualWebArena、AndroidWorld、ScreenSpot-Pro等,并维护内部私有测试集防污染。 2. 针对短板设计操作轨迹合成、环境(沙箱 OS / 浏览器 / 移动端 / 专业软件)合成、拒绝采样等方案,产出高质量训练数据。 3. 主导 SFT / RL 训练消化数据,用评测复测验证短板是否被优化,推动闭环持续迭代。
1、安全评测运营管理:维护评测集的分类体系与质量校验,持续补充高风险场景与新型攻击样本,负责日常评测、上线前评测、竞品对比等不同场景下的评测执行与结果复核,保障评测数据的完整性与可追溯性; 2、评测报告输出:整合评测数据并进行结构化呈现,面向管理层与协作团队输出安全评测报告,清晰呈现安全水位、竞品对比、风险趋势及重点问题,形成周期性沉淀机制; 3、归因分析与问题闭环:结合模型输入输出链路、审核策略与训练数据特征,对 badcase 进行归因分析,并推动相关团队优化修复并跟进闭环; 4、安全策略共建与迭代:基于评测发现和线上 badcase 积累,参与安全审核策略的制定与迭代;将归因分析结论转化为评测集补充、策略规则优化或模型训练数据建议; 5、前沿动态跟踪:关注业界安全事件、新型攻击手法和监管政策变化,及时将外部风险信息转化为内部评测场景和策略调整建议。
1、负责大模型内容安全审核与安全评测平台建设,包括审核平台、自动化评测平台、风险挖掘平台等能力设计与迭代; 2、深入理解大模型业务场景(聊天、创作、生图、生视频、Agent等),结合安全策略与业务需求,设计安全治理与评测产品方案; 3、推动AI Native工作流建设,结合 Agent、AI Coding等工具,设计并落地多Agent协同与自动化Workflow,推动平台模块化与可扩展能力建设,持续提升安全审核与评测效率、风险发现能力及平台自动化水平; 4、联动研发等其他团队,推进安全能力工程化与平台化落地; 5、持续跟进大模型技术在内容安全领域的应用趋势,结合业务实际场景迭代系统、Agent。
1、负责公司业务渠道拓展,挖掘新的合作客户,拓展多元化商务合作模式,完成公司既定的商务拓展及业绩目标; 2、主动调研行业市场动态、竞品商业模式及客户需求,收集市场信息、行业政策、合作商机,输出市场调研分析报告,为公司业务发展、合作策略调整提供有效依据; 3、对接合作方、客户的商务洽谈、合作方案制定、合同谈判及签约落地工作,跟进合作全流程,保障合作顺利推进,维护良好的商务合作关系。深度维护存量客户及合作渠道,定期开展客情回访,挖掘客户二次合作、增值合作机会与合作产值; 4、负责业务日常运营数据的统计、整理与监控,涵盖渠道数据、业绩数据、客户数据、转化数据等,建立常态化数据台账并定期开展运营数据分析,拆解业务转化链路,精准定位业务增长亮点、短板及运营问题,输出双周运营数据分析报告; 5、统筹业务运营全流程,协同内部产品、研发等团队,落地运营优化动作,解决业务推进过程中的各类运营问题,提升整体业务运营效率。同时基于数据分析结果,拉通多部门配合,针对性优化商务运营策略,提出可落地的业务优化方案并跟进执行,驱动业务业绩增长。定期复盘商务拓展、合作运营项目效果,总结成功经验与失败问题,迭代优化商务合作模式与运营体系。
1、 酒店拓展:拓展区域优质酒店,保证区域供应链完整、拿回优势价库; 2、价库运营:结合平台工具和资源,做好基础信息维护、工单处理、平台重点项目的落地执行,提高间夜产出; 3、商户问题处理及关系维护:解决商家遇到的如操作、财务、订单、商品优化等方面的问题,并通过高频次拜访,帮商家解决具体问题及维护与商家的关系; 4、结合区域酒店情况做好售卡目标的规划和执行,以此提升酒店间夜产出。
1. 负责端内用户全生命周期的活跃运营,从拉新、促活、留存到召回,设计并落地精细化运营策略,系统性提升用户粘性与长期价值; 2. 围绕 Chat 产品核心场景,结合大模型能力迭代,持续优化交互路径与内容推荐机制,驱动用户行为规模(如对话频次、会话深度、功能使用率)稳步增长; 3. 协同算法、产品、数据团队,推动策略在 AI 对话场景中的落地应用,提升用户发现效率与使用黏性; 4. 建立用户活跃度监测体系与指标看板,定期输出洞察报告,为产品决策提供数据支撑。
1.深度挖掘AI产品的应用场景(如:办公、学习、创作等),并将其转化为易传播的内容运营产品和方案。 2.负责AI产品的日常用户运营,策划并执行拉新、促活、留存方案,通过活动提高用户对话频次和使用深度。 3.搭建并维护核心用户画像体系,结合用户人群形成有效运营策略和方案。 4.热点营销与内容运营:紧跟国内外AI行业热点(如GPT新功能, 社交媒体上的AI梗),结合产品功能快速输出热点内容或营销方案,实现破圈传播。
1、负责千问办公/学习场景的AI产品功能与场景策略的探索和落地,围绕用户核心需求定义场景解决方案,完成产品方案落地 2、聚焦大模型场景应用创新,规划 AI Agent 产品发展路线,跟踪行业动态洞察技术发展趋势,输出前瞻性的产品解决方案 3、结合用户数据设计产品机制与算法策略,制定可持续迭代的数据评估体系,协同上下游团队提升用户转化效率与产品体验上限。
1.负责夸克浏览器业务的产品规划与迭代,围绕用户消费主链路持续打磨,提升用户规模、活跃度与使用时长。 2.深入理解浏览器用户诉求与行为路径,从用户价值场景出发设计产品功能与体验优化,提升用户满意度与留存。 3.探索 AI 原生产品范式:定义并落地对话式搜索、页面智能、AI 助手、浏览器 Agent 等新形态体验,把大模型能力转化为用户可感知、离不开的价值。 4.建立用户分层与生命周期运营机制,通过数据洞察定位体验与转化瓶颈;结合大模型能力推动消费体验从「千人千面」到「千人千答」的升级。 5.建立 AI 产品的新迭代闭环:以场景定义、评测集构建、badcase 分析为核心抓手,与算法共同打磨模型在真实场景中的表现,做 AI 能力的「场景定义者」和「体验守门人」。 6.与内容、算法、运营、研发等团队紧密协作,保障产品方案高质量落地。
1.场景化问答策略,定义场景识别逻辑和对应的策略切换规则。 2.问答质量策略,持续优化问答质量的评估体系,以及与算法团队持续优化机制。 3.问答策略与体验设计,定义医生的提问方式和AI回复策略。 4.指标体系与数据驱动,定义问答主链路的核心指标,通过数据驱动制导迭代。
1.负责 MaaS(Model as a Service)推理平台及大模型应用系统的架构设计与建设,打造面向大规模模型服务场景的高性能、低延迟、高吞吐推理基础设施,支撑稳定可靠的 AI 服务运行。 2.负责推理服务核心能力建设,包括请求调度、批处理优化、上下文管理等关键模块的设计与实现,持续提升推理系统的性能、稳定性和资源利用效率。 3.负责大规模模型服务平台建设,包括模型部署、服务治理、流量调度、容量管理、弹性伸缩等核心能力,支撑海量模型的全生命周期管理与稳定运行。 4.推动平台 DevInfra 能力建设,完善 CI/CD、灰度发布、可观测性、异常诊断及系统治理等基础设施,持续优化平台架构与工程实践,不断提升系统在性能、稳定性、可扩展性及成本效率等方面的能力,推动 AI 基础设施持续演进。
1、根据平台经营目标及广告产品特性,负责外部流量的资源拓展及运营等工作,尤其SDK变现方向; 2、持续挖掘流量侧业务特性与流量价值,关注业务节奏并持续优化运营手段,拿到业务结果; 3、监控、分析广告投放的效果分析,围绕数据分析持续优化调整广告投放方案;对投放数据和日常数据进行监控和分析,通过流量策略方式提升营收和ROI; 4、负责建立与各类媒体商务合作关系,针对性挖掘各类资源潜力,通过各种流量合作为平台带来精准的目标用户。
1. 基于公司战略需要,与集团算法团队密切合作,理解算法需求,对LLM模型训练所需的数据样本集进行标注管理、行业调研、安全合规保障等,与上游产品技术通力合作,提供满足算法研发需求的数据,共同推进业务目标达成; 2. 负责高质量的数据标注,结合算法知识优化标注流程,推进使用算法技术(如数据增强、自动化标注等)提升数据标注的质量 3. 设计和实现大语言模型方向AI训练流程,并不断优化迭代,带领团队高效完成标注和内容生产项目,推动标注工具的智能化升级优化,协助产品与开发团队将更智能的标注产品落地 4. 构建并维护一套完善的AI内容质量管理体系,全面把控内容质量并对结果负责,并不断进行优化迭代; 5. 负责管理标注团队,积极推动组织流程及交付流程优化,对接数据标注供应商。负责组织培训、试标、通过持续培训和反馈提升供应商标注质量与效率
1. 主导多模态理解大模型训练数据的标注体系设计,对接多模态算法团队,将算法团队的图文交织、高精度OCR、精细化图像描述等研究需求,转化为可执行、无歧义、可规模化的标注规范与执行流程。 2. 管理并培训视觉标注团队/供应商,拆解图文对齐任务,优化复杂的“多层级标注”的生产效率。 3. 建立严格的图像质量过滤标准(模糊、过度曝光、低俗涉黄、隐私违规等),确保进入训练集的图片在执行层做到100%合规与高清。 4. 承接评测团队和线上反馈的BadCase,针对多模态模型常见的视觉幻觉,设计针对性的反幻觉标注模版,并沉淀高质的“真/伪”对比范例。
1. 面向端到端原生多模态大模型(如流式语音通话),制定关于音频特征、情绪语气、环境背景音、实时插话(Interruption)和语气词(如喘气、叹气、笑声)的复合标注标准。 2. 参与生产高质量的音视频文本三维交织样本。不仅标注“说了什么”,更要精准标注“什么时间点说、用什么情绪说、背景有什么声音”。 3. 负责对供应商交付的音频分段、音乐流派标签、节奏打点、人声分离数据的合格率进行硬核把控,通过盲听与多轮复审杜绝错标。 4. 参与产品团队在执行层不断试验、重组标注工具的UI界面与交互逻辑,降低标注员的听觉疲劳,提升人效。
1. 用户治理体验体系搭建:运用NPS、CCR、BHT等指标构建消费者体验衡量体系,能够基于此进行体验驱动,协同各域提升体验指标 2. 治理体系搭建:结合业务特色,搭建商家、商品、渠道商等治理体系,降低用户CPO,监管投诉及舆情 3. 数据驱动监控与洞察:搭建用户体验监控看板与告警机制,定义口径与指标,定期产出TOP问题榜与月度体验洞察报告,支持专项立项优先级判断; 4. 项目统筹与资源整合:针对TOP高频问题发起立项,组织产研/运营/客服/风控等跨部门攻关,推动灰度验证与落地,完成效果验证与固化
1. 负责千问对话效果优化,围绕复杂问题分析、知识理解、辅助决策等场景,提升回答的准确性、分析深度和实用性,对回复效果与用户体验负责。 2. 基于数据驱动与用户洞察,定义关键指标(如DAU、留存、使用深度等),通过产品创新和策略优化,推动用户规模实现增长。 3. 协同算法、工程团队,通过Prompt优化、对话策略设计和模型能力迭代改善回答效果,平衡思考深度、响应耗时与阅读体验。 4. 深入分析真实对话与用户反馈,建设对话场景评测集,结合人工和自动化评测、线上数据和A/B实验,验证需求和分析数据,通过数据飞轮持续推动产品迭代。 5. 持续体验和研究国内外AI对话产品,理解推理模型的能力与边界,将前沿的AI能力转化为可落地的产品改进。
关于我们: MOS 实验室隶属于阿里 ATH 千问事业群。我们致力于在大模型时代打造具有全球影响力的 AI 原生产品,推动 AI 从“被动对话”向“主动服务与复杂执行”的范式跃迁。 实验室核心业务涵盖 AI 搜索、生成式推荐、主动服务及任务助理 Agent 等前沿领域。依托千问大模型底座,我们深度探索 RAG、Agentic RL、多 Agent 协作及全链路工程自动化技术,旨在构建能够深度理解用户、自主规划路径并闭环交付任务的“最强 AI 助手”。 岗位职责:深耕全链路 AI 搜索与 Agent 技术 1. AI 搜索核心技术研发: 负责 AI 搜索场景下的核心算法研发,包括但不限于索引构建与收录、向量召回、 LLM 相关性模型以及生成式检索与排序的构建与优化。 2. 垂直领域 RAG 落地: 利用大模型技术(LLM)实现行业深度搜索,攻克垂直领域下的语义对齐、知识抽取及结构化数据检索等核心难题。 3. 全链路 Agent 提效: 探索大模型与搜索技术的深度结合,负责 Agent 框架下的全链路效率提升,通过Agent技术重构搜索链路,自动化完成搜索效果优化。 4. 技术前瞻与转化: 跟踪全球大模型与 信息检索领域的最前沿技术,确保搜索产品在生成式时代的领先地位。 职级可看P6-P8