聚合各大厂 / 国企官网招聘信息,实时同步官方数据
主导 SoC 基础设施(NOC、CRG、Memory subsystem 等)的微架构设计与优化,在架构早期锁定延迟与 PPA 目标。 作为微架构评审 owner,review 团队 RTL 与设计方案,识别流水线级数、关键路径、仲裁/缓冲、访存路径等影响延迟与 PPA 的问题,把关PPA目标。 建立微架构设计规范与评审流程,指导培养团队,系统性提升微架构设计水平。 协调设计、验证、物理实现、DFT 跨领域工作,主导 PPA/timing 问题的根因分析与收敛。
1. 负责AI硬件系统仿真和CoDesign领域的技术规划与核心研发,制定面向异构AI服务器的仿真技术路线,主导软硬协同仿真模型和设计方法演进。 2. 构建覆盖芯片计算、KV Cache存储层次、片间互联、多卡服务器及集群拓扑的参数化模型,支撑AF分离等异构系统架构分析与设计。 3. 从模型负载和业务SLA出发开展设计空间分析,量化算力、带宽、容量、互联、卡间配比和服务器形态的关键取舍,收敛芯片、互联及服务器规格。 4. 交付硬件系统仿真工具、异构服务器方案、芯片与互联需求及服务器规格建议,支撑下一代AI硬件及服务器规格定义。
1、负责服务器 PCIe Switch 固件的自主研发、定制及产品交付和维护,能主导需求分析、版本管理、功能开发与测试、线上运维全生命周期研发,保障产品高质量交付。 2、负责海量 AI 异构服务器 PCIe Switch 固件的统一化定制,与芯片厂商协同研发并指导其开展工作,推动 PCIe Switch 固件研发标准化、测试自动化。 3、负责 PCIe Switch 领域 PCIe/CXL 链路 RAS、故障定位系统、链路性能调优、安全启动与安全升级、BMC 管理互连(MCTP/I2C/SPI 等)等竞争力特性的策略制定、方案落地。 4、结合阿里 AI 业务应用场景,开拓 PCIe Switch / CXL 互连技术发展方向,引领行业标准建设,并推动相关技术产品化落地。
1. 架构设计与技术规划 承担服务器/整机柜产品的硬件系统架构设计,输出系统方案、产品规格书、配置规则等关键文档 主导 EVT/DVT/PVT 各阶段架构评审,对架构决策的质量与进度负责 跟踪 CPU、GPU、内存、互连、供电、散热等领域的技术趋势,规划新技术在自研产品中的落地路径 端到端研发交付 2. 覆盖需求分析 → 方案设计 → 原理图/Layout 审查 → BOM 选型 → DFx 评审 → 测试验证 → 量产导入的完整链路 与 BIOS/BMC、结构、热设计、SI/PI、系统测试、供应链等团队协同,闭环解决跨领域问题 对存量机型的硬件质量与运营稳定性负责,主导线上疑难问题的定位与复盘 3. 关键技术攻关 独立或牵头攻克高速互连、大功率供电、液冷散热、超高功耗芯片散热、EMC 等方向的工程难题 主导专业实验验证,沉淀测试用例、设计规范、复用资产 4. 供应商与生态协同 深入供应商研发端审核设计过程,管理需求匹配性与质量风险 参与核心器件国产化选型的架构适配与验证
1. 架构设计与技术规划 承担服务器/整机柜产品的硬件系统架构设计,输出系统方案、产品规格书、配置规则等关键文档 主导 EVT/DVT/PVT 各阶段架构评审,对架构决策的质量与进度负责 跟踪 CPU、GPU、内存、互连、供电、散热等领域的技术趋势,规划新技术在自研产品中的落地路径 端到端研发交付 2. 覆盖需求分析 → 方案设计 → 原理图/Layout 审查 → BOM 选型 → DFx 评审 → 测试验证 → 量产导入的完整链路 与 BIOS/BMC、结构、热设计、SI/PI、系统测试、供应链等团队协同,闭环解决跨领域问题 对存量机型的硬件质量与运营稳定性负责,主导线上疑难问题的定位与复盘 3. 关键技术攻关 独立或牵头攻克高速互连、大功率供电、液冷散热、超高功耗芯片散热、EMC 等方向的工程难题 主导专业实验验证,沉淀测试用例、设计规范、复用资产 4. 供应商与生态协同 深入供应商研发端审核设计过程,管理需求匹配性与质量风险 参与核心器件国产化选型的架构适配与验证
1. 架构设计与技术规划 承担服务器/整机柜产品的硬件系统架构设计,输出系统方案、产品规格书、配置规则等关键文档 主导 EVT/DVT/PVT 各阶段架构评审,对架构决策的质量与进度负责 跟踪 CPU、GPU、内存、互连、供电、散热等领域的技术趋势,规划新技术在自研产品中的落地路径 端到端研发交付 2. 覆盖需求分析 → 方案设计 → 原理图/Layout 审查 → BOM 选型 → DFx 评审 → 测试验证 → 量产导入的完整链路 与 BIOS/BMC、结构、热设计、SI/PI、系统测试、供应链等团队协同,闭环解决跨领域问题 对存量机型的硬件质量与运营稳定性负责,主导线上疑难问题的定位与复盘 3. 关键技术攻关 独立或牵头攻克高速互连、大功率供电、液冷散热、超高功耗芯片散热、EMC 等方向的工程难题 主导专业实验验证,沉淀测试用例、设计规范、复用资产 4. 供应商与生态协同 深入供应商研发端审核设计过程,管理需求匹配性与质量风险 参与核心器件国产化选型的架构适配与验证
1. 负责服务器整机和液冷整机柜产品的系统设计、开发、交付; 2. 根据项目需求,进行服务器结构方案的制定和技术评估,提供可行性分析报告,为项目决策提供技术支持; 3. 与服务器ODM厂家紧密合作,负责服务器整机规格制定、负责整机设计过程质量管控,整机测试,整机交付质量管控; 4. 负责服务器结构相关的技术文档编写和维护,包括设计文档、测试报告、用户手册等; 5. 负责服务器产品的测试和验证工作,以及过程管理,解决测试过程中出现的结构问题,确保产品质量; 6. 跟踪行业新技术动态,研究新技术在服务器结构设计中的应用,不断提升产品竞争力;
1、负责SSD 端到端产品化交付:从产品规划、业务需求收集、分析需求、产品转化、供应商合作、定制开发落地、引入交付、系统级测试交付、推动产品上线和解决线上问题 2、基于业务需求,分析行业的控制器、SSD产品,设计对应的方案,并实施引入SSD部件,交付上线;支撑自研SSD产品化交付。 3、持续跟踪SSD相关领域的技术发展趋势,结合对业务应用场景的深入分析,并推动相关技术的产品化实现。 4、负责系统化的解决全闪存存储系统的稳定性问题,系统化设计报错方案,优化监控和诊断,提升诊断的准确率。 5、负责SSD产品需求测试规格,测试策略、测试方案,测试用例,测试标准的定义和输出。对标业界标杆,引入先进的测试方法。负责SSD相关测试和验证新技术的调研,预研和推广落地工作。
1、负责服务器BIOS 自主研发及产品交付和维护,能主导需求分析、版本管理、功能开发与测试,线上运维全生命周期研发,保障产品高质量交付。 2、负责海量服务器硬件组件的BIOS 统一化定制, 与厂商协同研发并指导其开展工作,推动 BIOS 研发标准化,测试自动化。 3、负责服务器BIOS/CPU领域RAS、故障定位系统、系统性能调优、安全、功耗等竞争力特性的策略制定、方案落地。 4、结合阿里业务应用场景,开拓BIOS技术发展方向,引领行业标准建设,并推动相关技术产品化落地。
1、负责服务器网卡(普通网卡/智能网卡/DPU)的引入测试全流程,包括功能、性能、兼容性、可靠性及长稳测试;主导测试方案设计与验收标准制定,确保产品满足交付质量要求。 2、负责服务器网卡在生产环境的稳定性保障,建立线上风险识别、故障预警及应急响应机制;主导疑难问题定位与根因分析,协同多方推动问题闭环,持续提升线上质量。 3、负责服务器网卡测试工具、自动化测试框架及诊断工具的设计与开发,提升测试效率与问题定位能力。
1. 主导或参与智能网卡/DPU相关系统软件和驱动软件的开发、功能验证,产品化落地以及上线运维。 2. 根据云产品业务特点,通过软硬件结合技术,进行业务软件优化,持续创造客户价值。 3. 通过智能网卡的创新应用,帮助云产品基础设施持续提升技术竞争力。
1. 主导或参与智能网卡/DPU相关系统软件和驱动软件的开发、功能验证,产品化落地以及上线运维。 2. 根据云产品业务特点,通过软硬件结合技术,进行业务软件优化,持续创造客户价值。 3. 通过智能网卡的创新应用,帮助云产品基础设施持续提升技术竞争力。
● AI超节点内存系统的架构设计与研发,面向GPU/NPU、HBM、主机内存及扩展内存构建统一的分层内存体系。 ● 内存池化管理软件研发,包括设备发现、拓扑感知、资源编排、容量分配与回收、隔离与配额管理,以及池化资源的弹性扩缩容;建设故障检测、自愈、降级和数据保护机制,保障系统稳定可靠运行。 ● 高速内存接口相关驱动和系统软件研发,涵盖设备初始化、地址空间映射、内存热插拔、DMA与中断处理、内核态与用户态接口,以及与Linux内存管理子系统的适配和优化。 ● 针对AI大模型训练与推理场景的内存性能调优:深入分析KV Cache、参数与中间结果访问等业务特征,定位并解决性能瓶颈。 ● 针对数据库、缓存、搜索、大数据分析等典型数据中心负载的内存行为分析与优化,适配不同业务池化和数据放置策略。 ● 新型高速接口内存(如CXL内存)的数据面应用优化,包括冷热页识别与迁移、分层内存放置、预取与回收、数据搬移和缓存策略设计,提升内存容量利用率、访问带宽及端到端业务性能。 ● 参与下一代AI基础设施内存架构定义:结合GPU/CPUScale Up互连、CXL等互连技术演进及大模型业务需求,参与分层内存、内存池化和新型高速接口内存方案的设计、原型验证与落地。
● AI超节点内存系统的架构设计与研发,面向GPU/NPU、HBM、主机内存及扩展内存构建统一的分层内存体系。 ● 内存池化管理软件研发,包括设备发现、拓扑感知、资源编排、容量分配与回收、隔离与配额管理,以及池化资源的弹性扩缩容;建设故障检测、自愈、降级和数据保护机制,保障系统稳定可靠运行。 ● 高速内存接口相关驱动和系统软件研发,涵盖设备初始化、地址空间映射、内存热插拔、DMA与中断处理、内核态与用户态接口,以及与Linux内存管理子系统的适配和优化。 ● 针对AI大模型训练与推理场景的内存性能调优:深入分析KV Cache、参数与中间结果访问等业务特征,定位并解决性能瓶颈。 ● 针对数据库、缓存、搜索、大数据分析等典型数据中心负载的内存行为分析与优化,适配不同业务池化和数据放置策略。 ● 新型高速接口内存(如CXL内存)的数据面应用优化,包括冷热页识别与迁移、分层内存放置、预取与回收、数据搬移和缓存策略设计,提升内存容量利用率、访问带宽及端到端业务性能。 ● 参与下一代AI基础设施内存架构定义:结合GPU/CPUScale Up互连、CXL等互连技术演进及大模型业务需求,参与分层内存、内存池化和新型高速接口内存方案的设计、原型验证与落地。
● 负责Scale-Up Switch配置与集群管控软件研发,包括交换机自动发现与纳管、拓扑及端口配置、转发策略与QoS下发、状态采集、配置一致性校验、批量升级和故障联动,建设统一、自动化、可观测的超节点管控平台。 ● 负责Scale-Up交换机软件设计、研发与交付,涵盖交换芯片SDK适配、端口与链路管理、转发与路由配置、QoS及拥塞控制、遥测与诊断、高可用和在线升级,保障交换系统高性能、稳定运行。 ● 参与Scale-Up Benchmark与测评机制建设,设计互连Micro Benchmark、集合通信及端到端AI业务测试,建立带宽、时延、消息率、扩展效率、拓扑敏感度和故障降级等指标与基线,建设自动化测试、持续回归及多架构横向评估能力。 ● 参与AI大模型训练与推理性能调优,围绕Tensor Parallel、Expert Parallel、集合通信、KV Cache传输等典型流量,分析通信模式和关键路径,优化通信时延、带宽利用率及计算通信重叠效率。 ● 建设超节点系统可靠性和质量保障体系,完善链路异常检测、故障隔离、自愈与降级机制,搭建功能、性能、稳定性和极限压力测试平台,形成可观测、可回归、可量化的软件交付标准。 ● 参与下一代AI超节点架构定义:结合GPU/NPU互连、交换芯片和大模型业务演进,参与Scale-Up Fabric、集群管理、交换机控制与数据面协议的设计、原型验证及产品化落地。
● AI超节点内存系统的架构设计与研发,面向GPU/NPU、HBM、主机内存及扩展内存构建统一的分层内存体系。 ● 内存池化管理软件研发,包括设备发现、拓扑感知、资源编排、容量分配与回收、隔离与配额管理,以及池化资源的弹性扩缩容;建设故障检测、自愈、降级和数据保护机制,保障系统稳定可靠运行。 ● 高速内存接口相关驱动和系统软件研发,涵盖设备初始化、地址空间映射、内存热插拔、DMA与中断处理、内核态与用户态接口,以及与Linux内存管理子系统的适配和优化。 ● 针对AI大模型训练与推理场景的内存性能调优:深入分析KV Cache、参数与中间结果访问等业务特征,定位并解决性能瓶颈。 ● 针对数据库、缓存、搜索、大数据分析等典型数据中心负载的内存行为分析与优化,适配不同业务池化和数据放置策略。 ● 新型高速接口内存(如CXL内存)的数据面应用优化,包括冷热页识别与迁移、分层内存放置、预取与回收、数据搬移和缓存策略设计,提升内存容量利用率、访问带宽及端到端业务性能。 ● 参与下一代AI基础设施内存架构定义:结合GPU/CPUScale Up互连、CXL等互连技术演进及大模型业务需求,参与分层内存、内存池化和新型高速接口内存方案的设计、原型验证与落地。
● 负责Scale-Up Switch配置与集群管控软件研发,包括交换机自动发现与纳管、拓扑及端口配置、转发策略与QoS下发、状态采集、配置一致性校验、批量升级和故障联动,建设统一、自动化、可观测的超节点管控平台。 ● 负责Scale-Up交换机软件设计、研发与交付,涵盖交换芯片SDK适配、端口与链路管理、转发与路由配置、QoS及拥塞控制、遥测与诊断、高可用和在线升级,保障交换系统高性能、稳定运行。 ● 参与Scale-Up Benchmark与测评机制建设,设计互连Micro Benchmark、集合通信及端到端AI业务测试,建立带宽、时延、消息率、扩展效率、拓扑敏感度和故障降级等指标与基线,建设自动化测试、持续回归及多架构横向评估能力。 ● 参与AI大模型训练与推理性能调优,围绕Tensor Parallel、Expert Parallel、集合通信、KV Cache传输等典型流量,分析通信模式和关键路径,优化通信时延、带宽利用率及计算通信重叠效率。 ● 建设超节点系统可靠性和质量保障体系,完善链路异常检测、故障隔离、自愈与降级机制,搭建功能、性能、稳定性和极限压力测试平台,形成可观测、可回归、可量化的软件交付标准。 ● 参与下一代AI超节点架构定义:结合GPU/NPU互连、交换芯片和大模型业务演进,参与Scale-Up Fabric、集群管理、交换机控制与数据面协议的设计、原型验证及产品化落地。
1、参与视觉生成/多模态模型(包括文本、图像、视频生成等)在 GPU、ASIC、FPGA 等异构硬件上的推理/后训练加速开发与软硬件结合的性能优化工作,包括但不限于模型量化、attention优化、显存优化、编译优化、计算与通信优化、内存管理以及多卡或多设备的并行推理方案等; 2、在主流深度学习框架(如 PyTorch)基础上,基于GPU/xPU硬件特点,对关键算子进行软硬件结合优化,提升模型运行效率; 3、与硬件以及算法工程师紧密配合,共同优化整体推理速度与资源占用; 4、跟踪学术界与工业界前沿技术(如扩散模型优化、VAE并行优化、AI编解码、面向机器的编解码等),推动软硬件协同创新。
1. 大模型算子开发与全链路性能优化:负责 GPU 及各类 AI 加速芯片的底层算子研发与调优。针对大模型训练与推理场景,开展全链路性能剖析与瓶颈定位;通过指令级优化、内存访问重构等手段,实现核心算子在异构硬件上的极致性能释放。 2. AI 编译优化、Mega Kernel 与模型量化压缩:参与 AI 编译器栈的深度定制与优化,打通从上层框架到底层硬件的计算图下沉与自动调优链路。主导 Mega Kernel 技术落地,通过多算子深度融合减少全局内存读写与 Kernel Launch 开销;结合量化压缩技术,在保障精度的前提下大幅降低显存占用与延迟,实现低成本部署。 3. 分布式架构设计与计算通信融合:面向大规模集群,设计并优化大模型训练与分布式推理架构。深入实践张量并行、流水线并行等策略,攻克多机多卡网络通信瓶颈;通过计算与通信深度融合(如 Overlap 调度),提升集群算力利用率与扩展性。 4. 前沿技术探索与下一代 Infra 预研:跟进 MoE 高效路由与负载均衡、超大规模并发推理优化、以及基于大模型的自动化 Kernel 生成(Kernel Agent)等前沿方向。将研究成果转化为工程实践,为下一代智能化 AI Infra 演进提供技术储备。 5. 软硬件协同设计与系统可靠性建设:深度参与异构计算软硬件结合技术栈研发,与芯片、驱动及框架团队紧密协作,推动软硬协同设计。建立完善的性能基准测试与监控体系,解决复杂环境下的长尾问题,确保生产级 AI 算力底座的高可用与高可靠。
1. 大模型算子开发与全链路性能优化:负责 GPU 及各类 AI 加速芯片的底层算子研发与调优。针对大模型训练与推理场景,开展全链路性能剖析与瓶颈定位;通过指令级优化、内存访问重构等手段,实现核心算子在异构硬件上的极致性能释放。 2. AI 编译优化、Mega Kernel 与模型量化压缩:参与 AI 编译器栈的深度定制与优化,打通从上层框架到底层硬件的计算图下沉与自动调优链路。主导 Mega Kernel 技术落地,通过多算子深度融合减少全局内存读写与 Kernel Launch 开销;结合量化压缩技术,在保障精度的前提下大幅降低显存占用与延迟,实现低成本部署。 3. 分布式架构设计与计算通信融合:面向大规模集群,设计并优化大模型训练与分布式推理架构。深入实践张量并行、流水线并行等策略,攻克多机多卡网络通信瓶颈;通过计算与通信深度融合(如 Overlap 调度),提升集群算力利用率与扩展性。 4. 前沿技术探索与下一代 Infra 预研:跟进 MoE 高效路由与负载均衡、超大规模并发推理优化、以及基于大模型的自动化 Kernel 生成(Kernel Agent)等前沿方向。将研究成果转化为工程实践,为下一代智能化 AI Infra 演进提供技术储备。 5. 软硬件协同设计与系统可靠性建设:深度参与异构计算软硬件结合技术栈研发,与芯片、驱动及框架团队紧密协作,推动软硬协同设计。建立完善的性能基准测试与监控体系,解决复杂环境下的长尾问题,确保生产级 AI 算力底座的高可用与高可靠。