招聘信息分享 招聘信息分享 ← 返回岗位列表

阿里云智能-服务器超节点内存池化软硬件结合研发专家-上海/北京/深圳

阿里巴巴📍北京/深圳/上海5年以上本科
发布时间:

岗位职责

● AI超节点内存系统的架构设计与研发,面向GPU/NPU、HBM、主机内存及扩展内存构建统一的分层内存体系。 ● 内存池化管理软件研发,包括设备发现、拓扑感知、资源编排、容量分配与回收、隔离与配额管理,以及池化资源的弹性扩缩容;建设故障检测、自愈、降级和数据保护机制,保障系统稳定可靠运行。 ● 高速内存接口相关驱动和系统软件研发,涵盖设备初始化、地址空间映射、内存热插拔、DMA与中断处理、内核态与用户态接口,以及与Linux内存管理子系统的适配和优化。 ● 针对AI大模型训练与推理场景的内存性能调优:深入分析KV Cache、参数与中间结果访问等业务特征,定位并解决性能瓶颈。 ● 针对数据库、缓存、搜索、大数据分析等典型数据中心负载的内存行为分析与优化,适配不同业务池化和数据放置策略。 ● 新型高速接口内存(如CXL内存)的数据面应用优化,包括冷热页识别与迁移、分层内存放置、预取与回收、数据搬移和缓存策略设计,提升内存容量利用率、访问带宽及端到端业务性能。 ● 参与下一代AI基础设施内存架构定义:结合GPU/CPUScale Up互连、CXL等互连技术演进及大模型业务需求,参与分层内存、内存池化和新型高速接口内存方案的设计、原型验证与落地。

任职要求

● 计算机、软件工程、电子科学与技术、芯片设计、人工智能等相关专业。 ● 5年以上系统软件、驱动或基础设施研发经验,熟悉C/C++,熟悉Python,具备扎实的Linux内核、操作系统及底层系统开发能力。 ● 熟悉虚拟内存、页表、NUMA、内存分配与回收、缓存一致性、DMA等机制,具备丰富的性能分析与优化经验,能够独立完成内存瓶颈定位和系统调优。 ● 有强烈的技术热情和好奇心、自驱力和学习力;具备良好的分析与解决问题能力、沟通及团队合作能力;有创新热情,积极乐观,能够持续推动问题解决和技术突破。 ● 掌握AI基础知识,熟练使用主流AI Coding工具,熟悉AI驱动的研发流程并能融入个人工作流;有AI基础设施或开发工具研发经验者优先,持有阿里云ACA/ACP/ACE认证证书者优先。 加分项(满足一个或多个) ● 有内存池化、内存分层、冷热页识别与迁移、远端内存或异构内存管理的设计和优化经验者优先。 ● 有Linux内核、内存管理子系统、PCIe/CXL驱动、热插拔、DAX、DMA或IOMMU相关研发经验者优先。 ● 熟悉数据库、分布式缓存、搜索引擎或大数据分析系统,具备相关分析与调优经验者优先。 ● 有CXL设备驱动研发、缓存系统或相关软硬件协同研发经验者优先。 ● 熟悉大模型推理执行流程、Attention及KV Cache数据布局,具备KV Cache调度或卸载性能优化能力。 ● 熟悉GPU/CPU内存体系、Unified Memory、Pinned Memory、GPUDirect、RDMA或Scale-Up高速互连技术者优先。 ● 熟悉内存性能监控指标体系、可观测平台、告警治理、故障诊断及性能基线建设者优先。
前往官网申请 →