招聘信息分享 招聘信息分享 ← 返回岗位列表

阿里云智能-服务器超节点ScaleUp软硬件结合专家-北京/上海

阿里巴巴📍北京/上海5年以上本科
发布时间:

岗位职责

● 负责Scale-Up Switch配置与集群管控软件研发,包括交换机自动发现与纳管、拓扑及端口配置、转发策略与QoS下发、状态采集、配置一致性校验、批量升级和故障联动,建设统一、自动化、可观测的超节点管控平台。 ● 负责Scale-Up交换机软件设计、研发与交付,涵盖交换芯片SDK适配、端口与链路管理、转发与路由配置、QoS及拥塞控制、遥测与诊断、高可用和在线升级,保障交换系统高性能、稳定运行。 ● 参与Scale-Up Benchmark与测评机制建设,设计互连Micro Benchmark、集合通信及端到端AI业务测试,建立带宽、时延、消息率、扩展效率、拓扑敏感度和故障降级等指标与基线,建设自动化测试、持续回归及多架构横向评估能力。 ● 参与AI大模型训练与推理性能调优,围绕Tensor Parallel、Expert Parallel、集合通信、KV Cache传输等典型流量,分析通信模式和关键路径,优化通信时延、带宽利用率及计算通信重叠效率。 ● 建设超节点系统可靠性和质量保障体系,完善链路异常检测、故障隔离、自愈与降级机制,搭建功能、性能、稳定性和极限压力测试平台,形成可观测、可回归、可量化的软件交付标准。 ● 参与下一代AI超节点架构定义:结合GPU/NPU互连、交换芯片和大模型业务演进,参与Scale-Up Fabric、集群管理、交换机控制与数据面协议的设计、原型验证及产品化落地。

任职要求

● 计算机、软件工程、通信工程、电子科学与技术、人工智能等相关专业。 ● 5年以上系统软件、网络软件或基础设施研发经验,精通C/C++,熟悉Python或Go,具备扎实的Linux系统、网络协议及底层软件开发能力。 ● 熟悉分布式系统、设备管理、拓扑与路由、配置管理、并发编程和软硬件接口,能够独立承担复杂子系统设计、问题定位、性能优化及工程交付。 ● 具备良好的系统架构和质量意识,熟悉需求分析、方案设计、代码评审、CI/CD、自动化测试和版本发布流程,有跨芯片、整机、驱动及上层框架协同经验。 ● 有强烈的技术热情和好奇心、自驱力和学习力;具备良好的分析与解决问题能力、沟通及团队合作能力;有创新热情,积极乐观,能够持续推动问题解决和技术突破。 ● 掌握AI基础知识,熟练使用主流AI Coding工具,熟悉AI驱动的研发流程并能融入个人工作流;有AI基础设施或开发工具研发经验者优先,持有阿里云ACA/ACP/ACE认证证书者优先。 加分项(满足一个或多个) ● 熟悉交换芯片架构及SDK,具备交换机控制面、数据面、端口管理、转发路由、QoS或拥塞控制研发经验者优先。 ● 有集群配置管理、拓扑发现、自动化部署、固件与驱动协同升级、设备生命周期管理平台研发经验者优先。 ● 有AI超节点、Scale-Up互连、GPU/NPU服务器或异构计算系统的软件架构、研发和规模化交付经验者优先。 ● 熟悉PCIe、CXL、RDMA、RoCE、InfiniBand、NVLink、UALink等高速互连技术及Fabric组网方案者优先。 ● 具备交换芯片系统性能、功能测评机制建设经验者优先。 ● 具备大规模集群性能调优、故障诊断、稳定性治理及实际生产交付经验者优先。
前往官网申请 →