阿里云智能-AI Infra异构软硬件结合研发专家--上海
发布时间:
岗位职责
1. 大模型算子开发与全链路性能优化:负责 GPU 及各类 AI 加速芯片的底层算子研发与调优。针对大模型训练与推理场景,开展全链路性能剖析与瓶颈定位;通过指令级优化、内存访问重构等手段,实现核心算子在异构硬件上的极致性能释放。
2. AI 编译优化、Mega Kernel 与模型量化压缩:参与 AI 编译器栈的深度定制与优化,打通从上层框架到底层硬件的计算图下沉与自动调优链路。主导 Mega Kernel 技术落地,通过多算子深度融合减少全局内存读写与 Kernel Launch 开销;结合量化压缩技术,在保障精度的前提下大幅降低显存占用与延迟,实现低成本部署。
3. 分布式架构设计与计算通信融合:面向大规模集群,设计并优化大模型训练与分布式推理架构。深入实践张量并行、流水线并行等策略,攻克多机多卡网络通信瓶颈;通过计算与通信深度融合(如 Overlap 调度),提升集群算力利用率与扩展性。
4. 前沿技术探索与下一代 Infra 预研:跟进 MoE 高效路由与负载均衡、超大规模并发推理优化、以及基于大模型的自动化 Kernel 生成(Kernel Agent)等前沿方向。将研究成果转化为工程实践,为下一代智能化 AI Infra 演进提供技术储备。
5. 软硬件协同设计与系统可靠性建设:深度参与异构计算软硬件结合技术栈研发,与芯片、驱动及框架团队紧密协作,推动软硬协同设计。建立完善的性能基准测试与监控体系,解决复杂环境下的长尾问题,确保生产级 AI 算力底座的高可用与高可靠。
任职要求
1. 计算机、电子工程或相关专业,具备扎实的编程功底与工程实现能力(精通 C++/Python 等);
2. 对 GPU 或相关 AI 加速芯片的系统结构有深入理解,具备实际的底层开发和极致的性能调优经验;
3. 熟悉 PyTorch 等主流深度学习框架并对其底层实现机制有深刻认知,在大模型训练或推理性能优化方面有丰富的实操经验;
4. 了解主流大模型的网络结构与执行细节,熟悉相关的推理性能优化技术;对 AI Infra 领域充满热情,持续关注 MoE、推理引擎、算子优化等技术演进,学习能力强;
5. 善于利用AI辅助编程、智能代码审查等工具提升研发效率;同时具备优秀的沟通协作与项目组织能力,能够跨团队与不同背景的成员高效合作。
加分项(拥有以下经验者优先)
1. 熟练掌握主流 GPU 算子开发工具链(如 CUDA / CUTLASS / Triton / NVSHMEM)及性能 Profiling 分析工具;
2. 具有深度学习框架或主流 LLM 推理引擎(如 vLLM、SGLang、TensorRT-LLM、PyTorch 等)的源码级开发或深度定制经验;
3. 具备异构计算、AI 编译器(如 TVM、MLIR 等)相关领域的开发经验;
4. 拥有大规模高性能分布式计算系统的架构设计与实战经验。