招聘信息分享 招聘信息分享 ← 返回岗位列表

阿里云智能-服务器软硬件系统架构与解决方案专家-杭州/北京/上海

阿里巴巴📍北京/杭州/上海5年以上other
发布时间:

岗位职责

1. 结合业务发展规划(训练/推理),负责AI算力系统(GPU/CPU/网络设备/存储等)的选型评估与技术路线规划;跟踪行业前沿硬件动态,为AI硬件引入决策提供技术输入; 2. 负责算力系统引入的前置评估与验收,制定并执行硬件验收测试方案,覆盖性能基准、压力稳定性、RAS特性、多机训练/推理单集群多品牌机器混部场景测试,识别潜在风险点并推动问题闭环; 3. 负责AI异构硬件系统OS交付流程的全链路管理,保障BIOS、BMC,CPLD,NIC FW,GPU FW bundle 版本等关键软件栈组件的版本把控和可追溯性; 4. 线上稳定性保障,建立硬件全生命周期监控体系,保障大规模集群上线后的持续稳定运行,参与容量规划、故障预案制定等基础设施保障工作,深入GPU固件、驱动、运行时等多个层面进行问题定位,建立标准化的故障诊断流程(SOP),提升问题定位效率与故障闭环效率; 5. 支撑AI相关业务的异构软硬件系统稳定性,负责大规模分布式训练(万卡级)集群的软硬件问题定位与解决;负责大规模推理服务集群的软硬件稳定性支撑;定位并解决推理场景下的性能劣化、硬件异常、服务稳定性等问题; 6. 持续推进算力项目体系化和系统化建设;

任职要求

1. 熟悉AI异构硬件系统架构,包括GPU/CPU/内存(HBM/DDR)/高速互联(NVLink/PCIe/InfiniBand/RoCE)等核心组件的架构原理和整机系统拓扑; 2. 熟悉主流AI芯片微架构(如SM/Tensor Core、显存子系统、RAS特性等); 3. 熟悉AI异构系统测试方法论,具备CPU/内存/SSD/GPU等核心部件及整机测试工具的开发经验; 4. 熟悉异构硬件诊断工具、NVIDIA驱动源码,具备OS层面问题排查能力; 5. 熟悉大模型训练全流程,包括语言类大模型、视频生成类模型的训练流程;主流分布式训练框架的原理与调优实践;熟悉大模型推理服务的部署与优化; 6. 很强的技术沟通能力,能够与硬件厂商、产品团队、业务团队进行有效的跨团队协作; 7. 很强的问题定位与解决能力,良好的文档规范意识,能够输出高质量的故障分析报告与技术方案文档; 8. 熟练使用主流AI Coding工具,熟悉AI驱动的研发流程并能融入个人工作流;有AI相关开发工具应用研发经验者优先,持有阿里云ACA/ACP/ACE认证证书者优先;
前往官网申请 →