招聘信息分享 招聘信息分享 ← 返回岗位列表

高德-语音生成&交互算法工程师-北京

阿里巴巴📍北京技术类技术类-算法1年以上硕士
发布时间:

岗位职责

团队介绍 负责高德全栈语音技术,能力覆盖语音生成与语音交互两条主线:自研 TTS 基座大模型、多语种与可控语音生成、语音识别与复杂声学理解、端到端对话模型与全双工交互、RTC 流式语音、端侧模型、模型服务与推理优化,以及配套的数据与自动评测体系。业务承载高德全部核心场景:语音导航、AI 领航员、AI 语音助手、室外步行导航与具身交互、IP 语音定制与虚拟陪伴、国际化、智能外呼、语音内容生成(有声书、播客、交互式播客)。团队通过前沿语音技术的研究与落地,支撑下一代 AI 产品创新。 职责 1. 语音交互系统研发 研发多模态对话大模型,实现"边听、边说、边想、边做"的交互形态:流式声学与时空上下文感知、增量语音输出、推理与生成并发、对话中调用工具完成任务。承担语音对话 pipeline、端到端、以及分层解耦(Thinker + Talker)三类方案的选型与实现,攻克全双工下的轮次让渡与抢占时机、打断与恢复、backchannel、流式推理链(reasoning in streaming)、主动发起交互(proactive interaction)。落地语音增值服务、室外步行导航、具身交互、本地生活通用语音入口等场景,并与高德全链路各 Agent 协同优化端到端交互体验。 2. 模型架构与训练方法创新 在首包与端到端延迟约束下提升模型智力上限(实时智能),优化方向包括注意力与状态空间结构、推理期算力动态分配、深度与专家稀疏化;探索文字 / 语音 / 视觉跨模态混合训练的最佳实践,以及面向 speech language model 的后训练技术(指令微调、偏好对齐、蒸馏与能力保持)。 3. 复杂声学理解与拟人化交互 提升复杂声学场景下的语音理解与副语言信息(情感、意图、说话人状态)建模能力,融合时空上下文;优化交互行为的灵活度、时机合理性,以及生成内容与音色的自然度,目标是在盲测中难以与真人区分。 4. 语音生成前沿技术 连续值自回归建模、多码本并行预测与延迟模式、指令驱动的可控合成(音色 / 风格 / 情感 / 韵律解耦与组合)、广义音频生成(T2A:语音 / 音效 / 环境声统一建模)、面向人类偏好与可验证指标(清晰度、说话人相似度、韵律)的强化学习优化、超越 WER 与 MOS 的多维自动化评测体系。 5. 创新业务形态落地 生成侧:长篇小说有声化、播客自动生成、交互式播客(可打断、可追问、按听者兴趣动态改写内容);交互侧:IP 语音包向具备长程记忆、稳定人格与成长感的虚拟陪伴演进。 6. 海量语音数据与评估体系 建立数据的定性分析与定量评估手段,设计自动评估框架,研发 scalable 的数据质量改进方案。以上工作均要求跟进语音理解、语音生成、语音交互三个方向的最新进展,提出新的技术框架或改进现有算法,持续提升技术与业务指标;鼓励撰写论文、申请专利。

任职要求

1. 985/211 高校研究生及以上学历,或表现优异的本科生; 2. 计算机、人工智能、软件、数学等相关专业; 3. 扎实的代码能力,并在以下任一方向有深入研究或工程落地经验:语音生成 / TTS、语音交互 / SLM、大语言模型、多模态大模型、生成模型; 4. 对数据结构与算法设计有良好理解,具备 harness engineering 能力:为模型与 Agent 搭建外围系统——工具与接口定义、上下文组织、评测与验证回路、失败检测与恢复; 5. 熟练使用 PyTorch,了解 Megatron 等分布式训练框架或slime / swift / veRL等新兴后训练框架; 6. 掌握 Transformer 架构、大语言模型基础、diffusion / flow matching 等生成模型基础; 加分项 1. 主导过语音生成或语音对话系统从研究到线上服务的完整闭环,并持续迭代线上指标; 2. 在 ICASSP、Interspeech、TASLP、ICLR、NeurIPS、ICML、ACL 、CVPR 等国际顶级会议或期刊发表论文;或有被业界广泛采用、复现的开源模型 / 框架 / 技术报告等高影响力工作; 3. 在 ACM/ICPC、NOI/IOI、Codeforces、AtCoder、Kaggle 等编程与数据竞赛中获奖;或在 Blizzard Challenge、CHiME、DCASE、ICASSP Grand Challenge 等语音 / 音频领域公开评测中取得优异成绩; 4. 对数据敏感,具备从数据中发现问题的习惯;对新技术、新工具快速上手; 5. 沟通与协作能力好,自我驱动,能在边界不清的问题上主动推进;
前往官网申请 →