招聘信息分享 招聘信息分享 ← 返回岗位列表

阿里云智能-异构计算软硬件结合开发专家-杭州

阿里巴巴📍杭州5年以上本科
发布时间:

岗位职责

1.从推理框架与算子层的视角,参与异构资源 Profiling & Tracing 平台的架构设计与能力建设,覆盖框架调度、算子执行、硬件微观指标等全链路性能诊断能力; 2.能基于主流推理框架(vLLM / SGLang / TRT-LLM)的源码理解,分析调度策略对推理延迟与吞吐的影响,定位性能瓶颈并提出优化方案; 3.负责 GPU 满载运行场景下的稳定性与性能问题排查,包括 RAS 故障(ECC、XID、NCCL 超时)、框架层显存泄漏与 OOM 分析、推理延迟异常等; 4.负责从集群视角优化多卡/多节点的资源利用率与负载均衡; 5.负责建立面向多种异构硬件架构的统一诊断与 Profiling 能力;

任职要求

1.具备 5 年以上 AI Infra 相关工作经验,计算机相关专业背景; 2.拥有扎实的编码功底,精通python/C/C++/Go/Rust等语言,拥有规范的工程化能力; 3.深入理解Linux系统,有大规模生产系统软件的开发与运维经验; 4.熟练掌握CUDA编程技术,掌握常用Profiling工具的使用方法与分析能力; 5.熟练掌握主流AI框架(如PyTorch、TensorFlow)、大模型训练框架(如Megatron、DeepSpeed)和大模型推理框架(如SGLang、vLLM); 6.深入理解常见大模型结构及算法原理,掌握训练推理的主流工程优化技术; 7.具备较强的学习能力和抗压能力,能够适应快速发展的AI行业环境;同时具备出色的跨团队协作能力和沟通能力; 8.能熟练使用主流 AI Coding 工具(如 Codex、Copilot、Cursor 等),熟悉 AI 驱动的现代研发流程,并能将 AI 工具融入日常开发与问题排查工作中; 优先考虑: 1. 熟悉至少一种主流GPU架构(NVIDIA GPU、AMD GPU等)者; 2. 具备Cutlass、Triton等框架的开发与调优经验者; 3. 有大规模GPU集群监控,在线Profiling和稳定性保障经验,有ai agent开发经验或ai agent评测系统开发经验; 4. 具有 GPGPU 微架构分析的实践经验,具有 AI 芯片设计及相关软硬件技术研究成果者;
前往官网申请 →