招聘信息分享 招聘信息分享 JOBHUNTER

聚合各大厂 / 国企官网招聘信息,实时同步官方数据

共找到 34361 个岗位

阿里云智能-数据中心网络架构师-DCN架构团队

阿里巴巴📍北京/杭州3年以上

负责数据中心网络相关前沿技术的洞察和网络架构的设计,尤其是灵骏 AI 计算领域,作为 PD 和架构师,设计和落地数据中心新架构、新产品。 网络架构团队所设计的集群架构承载了阿里云上的 AI 计算、高性能存储、大数据等各类业务;近年专注灵骏 AI 训练高性能网络架构,设计了业界领先的 HPN 7.0,HPN 8.0以及新时代的TPN架构,完成了诸多 AI 场景中的网络架构优化设计。 团队对外面向内部业务与云产品场景,洞悉分析各类内部业务与云产品对网络的诉求,设计网络架构方案;对内规划数据中心网络发展方向,实现各代架构的 HLD/LLD 设计,带领研发、运营等团队共同落地新架构。 核心职责|网络规划与架构设计 与灵骏、ECS、存储等云产品团队,以及电商等内部业务团队对接,将业务需求转化为涵盖 AIDC 内部网络顶层设计,并制定前瞻性的网络演进路线图。 ● AIDC 内网架构:主导端到端设计,涵盖 GPU 集群互联、Spine-Leaf / Clos 拓扑、前端业务网络及带外管理网络; ● 拥塞控制与标准制定:负责超大规模集群网络的拥塞控制调优与标准制定,包括 PFC、ECN 及带内网络遥测(INT); ● 架构交付物:输出架构文档(HLD / LLD)、网络拓扑图、配置规范及 SOP等; ● 存量架构优化:识别现有网络架构中的风险,制定改进路线图并推动落地执行。

阿里云智能-异构计算软硬件结合开发专家-杭州/深圳

阿里巴巴📍深圳/杭州5年以上

1. 负责异构AI芯片算子优化领域的技术规划与核心研发,制定面向大模型推理的算子技术路线,主导震旦算子库架构及持续演进。 2. 深入分析芯片计算、存储和互联特征,研发核心算子及融合方案,解决异构AI服务器在不同模型和部署形态下的性能瓶颈。 3. 推动震旦算子库与SGLang、vLLM等推理框架及业务系统深度集成,将算子优化转化为端到端时延、吞吐和资源效率收益。 4. 交付可复用的算子库、关键算子实现、性能模型和优化方案,并从软件实践中提炼对推理框架及下一代硬件的技术需求。

阿里云智能-异构计算软硬件结合开发高级工程师-深圳/杭州

阿里巴巴📍深圳/杭州3年以上

1. 负责大模型推理系统与全链路仿真领域的技术规划与核心研发,制定仿真技术路线,主导震旦从模型、算子到调度和服务的仿真架构演进。 2. 构建请求调度、KV Cache、并行计算、通信及分离架构的系统模型,刻画异构AI服务器在真实业务负载下的时延、吞吐和资源效率。 3. 贯通流量画像、算子性能模型和系统仿真,形成异构AI服务器的部署策略、容量规划方案、瓶颈归因及系统优化方案,并推动业务应用。 4. 交付仿真引擎、系统模型库、标准接口和方案分析结论,并推动核心技术进入主流推理框架及开源社区。

阿里云智能-异构计算软硬件结合开发专家-杭州

阿里巴巴📍杭州5年以上

1.从推理框架与算子层的视角,参与异构资源 Profiling & Tracing 平台的架构设计与能力建设,覆盖框架调度、算子执行、硬件微观指标等全链路性能诊断能力; 2.能基于主流推理框架(vLLM / SGLang / TRT-LLM)的源码理解,分析调度策略对推理延迟与吞吐的影响,定位性能瓶颈并提出优化方案; 3.负责 GPU 满载运行场景下的稳定性与性能问题排查,包括 RAS 故障(ECC、XID、NCCL 超时)、框架层显存泄漏与 OOM 分析、推理延迟异常等; 4.负责从集群视角优化多卡/多节点的资源利用率与负载均衡; 5.负责建立面向多种异构硬件架构的统一诊断与 Profiling 能力;

阿里云智能-SoC 微架构高级专家-北京/上海/杭州

阿里巴巴📍北京/杭州/上海8年以上

主导 SoC 基础设施(NOC、CRG、Memory subsystem 等)的微架构设计与优化,在架构早期锁定延迟与 PPA 目标。 作为微架构评审 owner,review 团队 RTL 与设计方案,识别流水线级数、关键路径、仲裁/缓冲、访存路径等影响延迟与 PPA 的问题,把关PPA目标。 建立微架构设计规范与评审流程,指导培养团队,系统性提升微架构设计水平。 协调设计、验证、物理实现、DFT 跨领域工作,主导 PPA/timing 问题的根因分析与收敛。

阿里云智能-异构计算软硬件结合开发高级工程师-杭州/深圳

阿里巴巴📍深圳/杭州3年以上

1. 负责AI硬件系统仿真和CoDesign领域的技术规划与核心研发,制定面向异构AI服务器的仿真技术路线,主导软硬协同仿真模型和设计方法演进。 2. 构建覆盖芯片计算、KV Cache存储层次、片间互联、多卡服务器及集群拓扑的参数化模型,支撑AF分离等异构系统架构分析与设计。 3. 从模型负载和业务SLA出发开展设计空间分析,量化算力、带宽、容量、互联、卡间配比和服务器形态的关键取舍,收敛芯片、互联及服务器规格。 4. 交付硬件系统仿真工具、异构服务器方案、芯片与互联需求及服务器规格建议,支撑下一代AI硬件及服务器规格定义。

阿里云智能-服务器基础固件高级工程师-深圳

阿里巴巴📍深圳3年以上

1、负责服务器 PCIe Switch 固件的自主研发、定制及产品交付和维护,能主导需求分析、版本管理、功能开发与测试、线上运维全生命周期研发,保障产品高质量交付。 2、负责海量 AI 异构服务器 PCIe Switch 固件的统一化定制,与芯片厂商协同研发并指导其开展工作,推动 PCIe Switch 固件研发标准化、测试自动化。 3、负责 PCIe Switch 领域 PCIe/CXL 链路 RAS、故障定位系统、链路性能调优、安全启动与安全升级、BMC 管理互连(MCTP/I2C/SPI 等)等竞争力特性的策略制定、方案落地。 4、结合阿里 AI 业务应用场景,开拓 PCIe Switch / CXL 互连技术发展方向,引领行业标准建设,并推动相关技术产品化落地。

阿里云智能-服务器硬件系统架构-深圳/杭州

阿里巴巴📍深圳/杭州5年以上

1. 架构设计与技术规划 承担服务器/整机柜产品的硬件系统架构设计,输出系统方案、产品规格书、配置规则等关键文档 主导 EVT/DVT/PVT 各阶段架构评审,对架构决策的质量与进度负责 跟踪 CPU、GPU、内存、互连、供电、散热等领域的技术趋势,规划新技术在自研产品中的落地路径 端到端研发交付 2. 覆盖需求分析 → 方案设计 → 原理图/Layout 审查 → BOM 选型 → DFx 评审 → 测试验证 → 量产导入的完整链路 与 BIOS/BMC、结构、热设计、SI/PI、系统测试、供应链等团队协同,闭环解决跨领域问题 对存量机型的硬件质量与运营稳定性负责,主导线上疑难问题的定位与复盘 3. 关键技术攻关 独立或牵头攻克高速互连、大功率供电、液冷散热、超高功耗芯片散热、EMC 等方向的工程难题 主导专业实验验证,沉淀测试用例、设计规范、复用资产 4. 供应商与生态协同 深入供应商研发端审核设计过程,管理需求匹配性与质量风险 参与核心器件国产化选型的架构适配与验证

阿里云智能-服务器系统设计-杭州/深圳

阿里巴巴📍深圳/杭州5年以上

1. 架构设计与技术规划 承担服务器/整机柜产品的硬件系统架构设计,输出系统方案、产品规格书、配置规则等关键文档 主导 EVT/DVT/PVT 各阶段架构评审,对架构决策的质量与进度负责 跟踪 CPU、GPU、内存、互连、供电、散热等领域的技术趋势,规划新技术在自研产品中的落地路径 端到端研发交付 2. 覆盖需求分析 → 方案设计 → 原理图/Layout 审查 → BOM 选型 → DFx 评审 → 测试验证 → 量产导入的完整链路 与 BIOS/BMC、结构、热设计、SI/PI、系统测试、供应链等团队协同,闭环解决跨领域问题 对存量机型的硬件质量与运营稳定性负责,主导线上疑难问题的定位与复盘 3. 关键技术攻关 独立或牵头攻克高速互连、大功率供电、液冷散热、超高功耗芯片散热、EMC 等方向的工程难题 主导专业实验验证,沉淀测试用例、设计规范、复用资产 4. 供应商与生态协同 深入供应商研发端审核设计过程,管理需求匹配性与质量风险 参与核心器件国产化选型的架构适配与验证

阿里云智能-服务器系统硬件架构设计-杭州/深圳

阿里巴巴📍深圳/杭州5年以上

1. 架构设计与技术规划 承担服务器/整机柜产品的硬件系统架构设计,输出系统方案、产品规格书、配置规则等关键文档 主导 EVT/DVT/PVT 各阶段架构评审,对架构决策的质量与进度负责 跟踪 CPU、GPU、内存、互连、供电、散热等领域的技术趋势,规划新技术在自研产品中的落地路径 端到端研发交付 2. 覆盖需求分析 → 方案设计 → 原理图/Layout 审查 → BOM 选型 → DFx 评审 → 测试验证 → 量产导入的完整链路 与 BIOS/BMC、结构、热设计、SI/PI、系统测试、供应链等团队协同,闭环解决跨领域问题 对存量机型的硬件质量与运营稳定性负责,主导线上疑难问题的定位与复盘 3. 关键技术攻关 独立或牵头攻克高速互连、大功率供电、液冷散热、超高功耗芯片散热、EMC 等方向的工程难题 主导专业实验验证,沉淀测试用例、设计规范、复用资产 4. 供应商与生态协同 深入供应商研发端审核设计过程,管理需求匹配性与质量风险 参与核心器件国产化选型的架构适配与验证

阿里云智能-服务器结构系统技术专家-深圳/杭州

阿里巴巴📍深圳/杭州5年以上

1. 负责服务器整机和液冷整机柜产品的系统设计、开发、交付; 2. 根据项目需求,进行服务器结构方案的制定和技术评估,提供可行性分析报告,为项目决策提供技术支持; 3. 与服务器ODM厂家紧密合作,负责服务器整机规格制定、负责整机设计过程质量管控,整机测试,整机交付质量管控; 4. 负责服务器结构相关的技术文档编写和维护,包括设计文档、测试报告、用户手册等; 5. 负责服务器产品的测试和验证工作,以及过程管理,解决测试过程中出现的结构问题,确保产品质量; 6. 跟踪行业新技术动态,研究新技术在服务器结构设计中的应用,不断提升产品竞争力;

阿里云智能-存储SSD部件产品化专家-杭州/深圳

阿里巴巴📍深圳/杭州5年以上

1、负责SSD 端到端产品化交付:从产品规划、业务需求收集、分析需求、产品转化、供应商合作、定制开发落地、引入交付、系统级测试交付、推动产品上线和解决线上问题 2、基于业务需求,分析行业的控制器、SSD产品,设计对应的方案,并实施引入SSD部件,交付上线;支撑自研SSD产品化交付。 3、持续跟踪SSD相关领域的技术发展趋势,结合对业务应用场景的深入分析,并推动相关技术的产品化实现。 4、负责系统化的解决全闪存存储系统的稳定性问题,系统化设计报错方案,优化监控和诊断,提升诊断的准确率。 5、负责SSD产品需求测试规格,测试策略、测试方案,测试用例,测试标准的定义和输出。对标业界标杆,引入先进的测试方法。负责SSD相关测试和验证新技术的调研,预研和推广落地工作。

阿里云智能-服务器BIOS开发工程师-深圳/杭州

阿里巴巴📍深圳/杭州5年以上

1、负责服务器BIOS 自主研发及产品交付和维护,能主导需求分析、版本管理、功能开发与测试,线上运维全生命周期研发,保障产品高质量交付。 2、负责海量服务器硬件组件的BIOS 统一化定制, 与厂商协同研发并指导其开展工作,推动 BIOS 研发标准化,测试自动化。 3、负责服务器BIOS/CPU领域RAS、故障定位系统、系统性能调优、安全、功耗等竞争力特性的策略制定、方案落地。 4、结合阿里业务应用场景,开拓BIOS技术发展方向,引领行业标准建设,并推动相关技术产品化落地。

阿里云智能-服务器智能网卡测试开发专家-杭州/深圳

阿里巴巴📍深圳/杭州5年以上

1、负责服务器网卡(普通网卡/智能网卡/DPU)的引入测试全流程,包括功能、性能、兼容性、可靠性及长稳测试;主导测试方案设计与验收标准制定,确保产品满足交付质量要求。 2、负责服务器网卡在生产环境的稳定性保障,建立线上风险识别、故障预警及应急响应机制;主导疑难问题定位与根因分析,协同多方推动问题闭环,持续提升线上质量。 3、负责服务器网卡测试工具、自动化测试框架及诊断工具的设计与开发,提升测试效率与问题定位能力。

阿里云智能-服务器软硬件结合开发专家-深圳/杭州

阿里巴巴📍深圳/杭州5年以上

1. 主导或参与智能网卡/DPU相关系统软件和驱动软件的开发、功能验证,产品化落地以及上线运维。 2. 根据云产品业务特点,通过软硬件结合技术,进行业务软件优化,持续创造客户价值。 3. 通过智能网卡的创新应用,帮助云产品基础设施持续提升技术竞争力。

阿里云智能-服务器软硬件结合开发专家--杭州/深圳

阿里巴巴📍深圳/杭州5年以上

1. 主导或参与智能网卡/DPU相关系统软件和驱动软件的开发、功能验证,产品化落地以及上线运维。 2. 根据云产品业务特点,通过软硬件结合技术,进行业务软件优化,持续创造客户价值。 3. 通过智能网卡的创新应用,帮助云产品基础设施持续提升技术竞争力。

阿里云智能-服务器超节点内存池化软硬件结合研发专家-上海/北京/深圳

阿里巴巴📍北京/深圳/上海5年以上

● AI超节点内存系统的架构设计与研发,面向GPU/NPU、HBM、主机内存及扩展内存构建统一的分层内存体系。 ● 内存池化管理软件研发,包括设备发现、拓扑感知、资源编排、容量分配与回收、隔离与配额管理,以及池化资源的弹性扩缩容;建设故障检测、自愈、降级和数据保护机制,保障系统稳定可靠运行。 ● 高速内存接口相关驱动和系统软件研发,涵盖设备初始化、地址空间映射、内存热插拔、DMA与中断处理、内核态与用户态接口,以及与Linux内存管理子系统的适配和优化。 ● 针对AI大模型训练与推理场景的内存性能调优:深入分析KV Cache、参数与中间结果访问等业务特征,定位并解决性能瓶颈。 ● 针对数据库、缓存、搜索、大数据分析等典型数据中心负载的内存行为分析与优化,适配不同业务池化和数据放置策略。 ● 新型高速接口内存(如CXL内存)的数据面应用优化,包括冷热页识别与迁移、分层内存放置、预取与回收、数据搬移和缓存策略设计,提升内存容量利用率、访问带宽及端到端业务性能。 ● 参与下一代AI基础设施内存架构定义:结合GPU/CPUScale Up互连、CXL等互连技术演进及大模型业务需求,参与分层内存、内存池化和新型高速接口内存方案的设计、原型验证与落地。

阿里云智能-服务器超节点内存池化软硬件结合研发专家-北京/深圳/上海

阿里巴巴📍北京/深圳/上海5年以上

● AI超节点内存系统的架构设计与研发,面向GPU/NPU、HBM、主机内存及扩展内存构建统一的分层内存体系。 ● 内存池化管理软件研发,包括设备发现、拓扑感知、资源编排、容量分配与回收、隔离与配额管理,以及池化资源的弹性扩缩容;建设故障检测、自愈、降级和数据保护机制,保障系统稳定可靠运行。 ● 高速内存接口相关驱动和系统软件研发,涵盖设备初始化、地址空间映射、内存热插拔、DMA与中断处理、内核态与用户态接口,以及与Linux内存管理子系统的适配和优化。 ● 针对AI大模型训练与推理场景的内存性能调优:深入分析KV Cache、参数与中间结果访问等业务特征,定位并解决性能瓶颈。 ● 针对数据库、缓存、搜索、大数据分析等典型数据中心负载的内存行为分析与优化,适配不同业务池化和数据放置策略。 ● 新型高速接口内存(如CXL内存)的数据面应用优化,包括冷热页识别与迁移、分层内存放置、预取与回收、数据搬移和缓存策略设计,提升内存容量利用率、访问带宽及端到端业务性能。 ● 参与下一代AI基础设施内存架构定义:结合GPU/CPUScale Up互连、CXL等互连技术演进及大模型业务需求,参与分层内存、内存池化和新型高速接口内存方案的设计、原型验证与落地。

阿里云智能-服务器超节点ScaleUp软硬件结合专家-上海/北京

阿里巴巴📍北京/上海5年以上

● 负责Scale-Up Switch配置与集群管控软件研发,包括交换机自动发现与纳管、拓扑及端口配置、转发策略与QoS下发、状态采集、配置一致性校验、批量升级和故障联动,建设统一、自动化、可观测的超节点管控平台。 ● 负责Scale-Up交换机软件设计、研发与交付,涵盖交换芯片SDK适配、端口与链路管理、转发与路由配置、QoS及拥塞控制、遥测与诊断、高可用和在线升级,保障交换系统高性能、稳定运行。 ● 参与Scale-Up Benchmark与测评机制建设,设计互连Micro Benchmark、集合通信及端到端AI业务测试,建立带宽、时延、消息率、扩展效率、拓扑敏感度和故障降级等指标与基线,建设自动化测试、持续回归及多架构横向评估能力。 ● 参与AI大模型训练与推理性能调优,围绕Tensor Parallel、Expert Parallel、集合通信、KV Cache传输等典型流量,分析通信模式和关键路径,优化通信时延、带宽利用率及计算通信重叠效率。 ● 建设超节点系统可靠性和质量保障体系,完善链路异常检测、故障隔离、自愈与降级机制,搭建功能、性能、稳定性和极限压力测试平台,形成可观测、可回归、可量化的软件交付标准。 ● 参与下一代AI超节点架构定义:结合GPU/NPU互连、交换芯片和大模型业务演进,参与Scale-Up Fabric、集群管理、交换机控制与数据面协议的设计、原型验证及产品化落地。

阿里云智能-服务器超节点内存池化软硬件结合研发专家-上海/北京

阿里巴巴📍北京/上海5年以上

● AI超节点内存系统的架构设计与研发,面向GPU/NPU、HBM、主机内存及扩展内存构建统一的分层内存体系。 ● 内存池化管理软件研发,包括设备发现、拓扑感知、资源编排、容量分配与回收、隔离与配额管理,以及池化资源的弹性扩缩容;建设故障检测、自愈、降级和数据保护机制,保障系统稳定可靠运行。 ● 高速内存接口相关驱动和系统软件研发,涵盖设备初始化、地址空间映射、内存热插拔、DMA与中断处理、内核态与用户态接口,以及与Linux内存管理子系统的适配和优化。 ● 针对AI大模型训练与推理场景的内存性能调优:深入分析KV Cache、参数与中间结果访问等业务特征,定位并解决性能瓶颈。 ● 针对数据库、缓存、搜索、大数据分析等典型数据中心负载的内存行为分析与优化,适配不同业务池化和数据放置策略。 ● 新型高速接口内存(如CXL内存)的数据面应用优化,包括冷热页识别与迁移、分层内存放置、预取与回收、数据搬移和缓存策略设计,提升内存容量利用率、访问带宽及端到端业务性能。 ● 参与下一代AI基础设施内存架构定义:结合GPU/CPUScale Up互连、CXL等互连技术演进及大模型业务需求,参与分层内存、内存池化和新型高速接口内存方案的设计、原型验证与落地。