共 834 个在招岗位 · 阿里巴巴在上海的最新招聘信息
● 基于GPU Profile完成模型算子覆盖率分析,识别必选高性能算子开发路径并评估性能影响。 ● 基于性能仿真建模工具完成性能建模并检查review,输出整网及分层模块性能预期报告,明确关键模块与算子形状、数据类型及切分策略。 ● 结合Profile与建模结果,输出算子开发需求清单(含算子列表、shape、dtype、切分策略)及接口需求说明文档,明确算子/框架团队优先验证规格。 ● 维护并扩展补充新增AI芯片算子单OP精度与性能参考代码,沉淀AI Harness SKILL/Agent资产。 ● 建立主要模型推理规格的GPU竞品性能数据清单,形成可量化对标基准。 ● 跑通模型Fake Tensor推理(带切分方案)与Real Tensor推理全流程,验证并行切分策略正确性。 ● 对比实测性能与建模预期,量化Gap来源(算子效率/切分策略/调度开销/显存带宽等),驱动算子、框架、编译器团队形成优化闭环,持续逼近建模性能极限。 ● 制定端到端精度验证策略,输出验证方案与QA转测说明,完成AI芯片daily QA转测交付。 ● 输出模型整体并行方案与子模块/算子级切分细化方案,形成建模性能预期数据报告。
1、负责 RISC-V 架构 JVM 后端开发、移植与性能调优,参与 OpenJDK 核心组件优化(C2 编译器、GC、运行时等); 2、与硬件研发团队紧密协同,联合硬件团队进行微架构级别性能分析,参与硬件特性早期评审,提供软件侧需求与反馈,协同验证新硬件平台上的 JVM 正确性与性能; 3、推动 OpenJDK 在数据中心大规模部署与调优,针对微服务、云原生、大数据等典型场景进行 JVM 专项优化,与业务团队协同,识别并解决生产环境中的 JVM 性能瓶颈; 4、向 OpenJDK 上游社区提交 patch,参与 code review,推动代码合入主线,跟踪上游社区技术动态; 5、参与 RVI(RISC-V International)基金会技术工作组,参与 RISC-V 规范讨论与制定,代表公司推动 JVM 相关扩展指令集提案;
从事芯片框架相关的工作,主要包含: 1. 负责主流开源框架支持,如pytorch、tensorflow; 2. 负责主流开源大模型推理引擎支持,如vllm; 3. 负责大模型推理性能优化; 4. 负责大模型大规模集群训练优化;
- 主导性能建模平台的架构设计和关键模块构建,开发系统、模型和算子仿真框架,为芯片系统设计提供量化依据 - 构建AI负载特征分析套件,从主流 AI 模型中提取计算、访存、并行和互联等方面特征,并开发相应Benchmark - 定义功耗评估方法论和框架,寻找性能和功耗甜点,设计系统调频、调压及任务调度方案 - 建立芯片可编程性的科学评估体系,协调软件和硬件团队的架构探索方向
1. 对当前流行的生成式AI模型,如GPT-3,LLaMA,Qwen,stable diffusion等模型进行应用分析,评估模型在不同硬件架构(CPU/GPU/NPU)上的性能瓶颈,分析内存占用等; 2. 针对应用分析结果设计关键硬件模块的架构,包括数据通路,控制逻辑,计算/访存接口等; 3. 构建高精度的硬件架构的仿真器和性能、面积、功耗模型; 4. 依据仿真器和模型的结果做架构探索,为硬件架构设计提供理论依据。
1、负责数据中心SoC的内存子系统的软件解决方案分析和设计,参与相关的客户需求评估、软硬件架构设计等工作 2、参与DDR相关的固件和应用工具开发工作 3、与芯片研发团队协作,通过仿真、原型等方法验证内存子系统的功能及性能完整性 4、参与各类DDR子系统相关的底层软硬件问题解决,通过RAS能力增强、端到端容错方案设计等方法,保障芯片线上运行稳定性
1. 负责基于RISC-V架构的数据中心级芯片的Linux内核移植、特性开发及底层驱动适配,确保OS在新型硬件上的稳定运行与高性能表现。 2. 深度参与芯片定义阶段的软硬件协同设计,从操作系统视角提出架构建议,解决端到端业务场景中的系统级难题。 3. 主导或参与RISC-V服务器生态建设,与上游开源社区(如Linux Kernel, QEMU, U-Boot等)保持紧密互动,推动关键补丁合入,提升芯片在社区的支持度。 4. 建立系统级的性能分析与调优体系,利用Top-down等方法论定位瓶颈,针对内存管理、进程调度、IO栈等核心模块进行深度优化。 5. 解决复杂的生产环境问题,构建自动化测试与诊断工具链,支撑客户及内部团队的技术需求。
1. AI技术融合与优化:将人工智能技术、大模型融入芯片业务开发测试流程,提升产品研发效率和质量。 - 自动化工具开发:开发AI辅助工具,如代码审查工具、自动测试用例生成工具、性能瓶颈分析工具等,提高研发测试的自动化程度。 - 数据处理与分析:利用大模型和AI工具处理大量研发测试数据,包括代码、测试用例、测试执行日志等,优化数据处理流程。 2. AI知识库系统构建 - 知识库设计:设计和构建高效、准确的AI知识库系统,支持业务部门的专业知识生成和服务。 - RAG系统开发:构建和优化RAG(Retrieval-Augmented Generation)系统,实现从知识库中快速准确地检索相关信息,并生成高质量的业务文档和回答。 3. AI辅助工具平台开发 - 工具平台设计:设计和开发AI辅助工具平台,提供统一的接口和工具集,支持多种AI应用。 - 用户支持:为业务部门提供技术支持,确保AI工具平台的稳定运行和高效使用。 4. 项目管理和团队协作 - 需求分析:与业务部门紧密合作,理解业务需求,提供技术解决方案。 - 项目管理:跟踪项目进度,确保按时交付高质量的AI系统。 - 团队协作:与团队成员协作,分享知识和经验,推动团队整体技术水平的提升。
1、深入理解RISC-V软件技术架构和生态发展方向,负责RISC-V开源社区及生态组织的相关工作,构建完善的开源技术生态,并推动有利于产品发展的各项技术标准与行业标准。 2、结合市场需求,挖掘产品机会,完成生态相关产品规划、设计和落地,制定产品战略和路线图。 3、跨团队协同,联合产品与研发团队,为生态伙伴提供整套解决方案,技术文档、SDK 示例、最佳实践指南,降低其接入门槛。 4、关注开源社区动态,参与社区活动,推动Risc-V生态繁荣发展。
1.0-1供应链体系搭建主导芯片供应链流程设计建设,覆盖EDA/IP采购、晶圆代工、封测、关键材料、物流及质量管控;建立适配初创期“小步快跑”的敏捷采购、供应商准入与管理。 2.核心厂商资源整合深度对接国内外Foundry、OSAT、IP授权方、基板/特种材料供应商;主导商务谈判、产能预留、良率爬坡协同与替代方案验证。 3.业务流程拉通与全链路降本打通研发、采购、制造、财务、品控的业务断点,建立从成本拆解、流片排期到交付验收的可视化链路,实现综合成本最优。 4.阿里生态对接与能力转化快速识别并接入集团内部资源,打造“芯片供应链数字化”能力。 5.风险管控与合规保障能链接和利用好集团法务资源,建立地缘政策、产能波动、出口管制、知识产权等风险预警与预案;确保采购合规、数据安全与反舞弊机制落地,保障交付。
1、负责数据中心SoC的PCIe子系统端到端软件分析和设计,参与相关的客户需求评估、软硬件架构设计等工作 2、参与PCIe相关固件、驱动、应用工具的开发和调优工作 3、与芯片研发团队协作,通过仿真、原型等方法验证PCIe子系统的功能及性能完整性 4、参与各类PCIe子系统相关的底层软硬件问题解决
1、负责车规级处理器软件的技术路线规划、产品开发及功能安全认证工作; 2、主导 Safety OS、AUTOSAR 等主流车规操作系统的适配调优与生态协同,推动其在目标平台的落地与产品化; 3、负责 STL、数学库、电机控制算法等核心处理器软件库的设计、开发与功能安全认证。
1. 负责全栈性能测试体系建设,设计并实现覆盖内核、中间件到应用层(如SLAM、目标检测、图形渲染)的自动化 Benchmark 框架,并针对机器人、边缘AI等业务场景定制关键性能用例; 2. 完成深度性能问题诊断与解决,运用 perf、ftrace、eBPF 等工具对操作系统、处理器指令效率、I/O 及系统集成层面的性能瓶颈进行根因分析,并推动有效优化; 3. 提供性能验证与交付支撑,建立性能数据采集、可视化与回归检测 pipeline,制定验收标准,输出标准化报告,支撑版本发布与产品交付; 4. 跨团队技术协同,参与需求与架构评审,从性能视角提供输入,并协助测试团队设计用例、解读结果,确保系统整体性能目标达成;
- 负责芯片访存子系统的架构设计,可主导自研存储控制的架构及设计实现; - 跟踪芯片领域及新型计算领域(如机器学习)发展,设计开发低功耗的架构、芯片及硬件产品; - 参与芯片架构与微架构设计,负责开发和维护各种通用接口和模块; - 针对业务发展需求,开发相应原型系统,落地芯片产品
1、负责编译器设计开发与优化工作,包括编译器中端、后端技术优化等。 2、负责二进制翻译器设计开发与优化工作,包括指令翻译技术、翻译优化技术、代码缓存技术、运行优化技术等。 3、基于LLVM框架,针对高性能应用、高性能内核所需,深度开展相关优化算法与数据/指令的布局技术。 4、负责处理器研发过程中的编译与体系结构优化。 5、负责编译器领域业界前沿技术的研究分析。
我们正在寻找一位经验丰富的模块测试工程师,专注于服务器核心模块与子系统的深度测试与验证。您将负责从单元到系统级的测试策略设计、自动化实现与问题定位,确保服务器各关键模块(如内核/虚拟化、高速总线、编解码等)的功能、性能、可靠性及兼容性满足严苛的行业标准。您需要对服务器硬件架构与软件栈有深入理解,并能通过创新的测试方法发现潜在缺陷,为产品的高质量交付提供坚实保障。 岗位职责: 1. 服务器核心模块测试策略与执行:负责制定和执行服务器关键模块的测试计划,特别是在如下某一个或者某几个核心模块有扎实测试专长的候选人加入: a. 内核与虚拟化模块:测试虚拟化技术(如KVM, VMware ESXi)、容器运行时、内核关键子系统(调度、内存管理、网络栈)的功能、性能隔离与稳定性。 b. 高速互连总线模块:负责PCIe, CXL, NVLink等高速总线的功能验证、带宽/延迟性能基准测试、错误注入与容错测试。 c. 硬件加速与编解码模块:测试GPU、视频编解码器(如H.264/HEVC/AV1)、加解密引擎等硬件加速单元的功能正确性、性能提升及驱动兼容性。 d. 固件与BMC模块:参与服务器固件(BIOS/UEFI)、基板管理控制器(BMC)的接口、安全与可靠性测试。 2. 测试框架与自动化开发:针对特定模块,设计并开发高覆盖率的自动化测试套件、压力测试工具和性能基准测试框架。集成到CI/CD流水线,实现模块质量的持续监控。 3. 深度分析与问题定位:执行测试并分析结果,能深入日志、硬件寄存器、性能计数器等,对发现的缺陷进行根因分析,准确定位至硬件、固件、驱动或应用层,并与研发团队紧密协作推动问题解决。 4. 系统级集成与可靠性验证:将模块测试融入整机系统测试,验证多模块协同工作下的功能与性能,设计并执行长时压力、故障恢复、容错等可靠性测试场景。 5. 技术预研与能力建设:跟踪服务器技术演进(如新硬件架构、互联协议、虚拟化技术),预研新的测试方法、工具与标准,提升团队在特定模块领域的测试深度与效率。
1. 负责跟进大模型、具身智能等前沿科技发展,探索 AI 算力在机器人、工业自动化及智能生活场景中的应用方案; 2. 对接核心客户并挖掘其核心需求,协助其完成技术选型,并解决其从 ARM/其他架构迁移至 RISC-V 过程中的软件栈适配、性能优化等痛点; 3. 深挖机器人、边缘侧 AI 等垂直行业需求,以场景为核心,围绕 RISC-V IP 扩展指令寻找差异化竞争优势; 4. 主导内部项目立项,围绕处理器 IP、算法规划长期目标,并建立完整的 benchmark 体系; 5. 主导原型系统的开发,包括芯片规划、硬件选型、算法移植、驱动调优及 Demo 演示工作;
1. 负责车规级处理器的软件测试全流程,覆盖芯片启动、外设驱动、安全机制及性能基准测试; 2. 设计并执行 STL(软件测试库)验证方案,保障STL符合ISO 26262认证要求; 3. 开发基于 Python/C 的自动化测试框架,集成 CI/CD 流水线,实现测试用例的批量执行与覆盖率统计; 4. 结合车规处理器软件测试业务,开发对应的AI skill和agent,进行工作流编排和优化。
1. 负责基于公司服务器CPU芯片的网络垂直软件技术栈的性能优化、稳定性提升及功能迭代,主导核心技术难题的攻关;深入理解CPU芯片架构特性(如缓存、指令集、IO虚拟化、QoS等),结合网络软件运行机制,制定针对性的优化方案并落地实施 2. 与硬件设计团队紧密协作,参与芯片架构定义、功能验证阶段的软件需求输入,确保芯片设计充分适配网络软件场景;搭建网络软件优化的测试验证平台,制定测试方案、性能基准及评估体系,保障优化效果的有效性和稳定性 3. 跟踪网络领域前沿技术及行业发展趋势,将先进技术融入公司软件优化方案,推动技术创新 4. 负责网络相关软件栈(如设备驱动、协议栈、RDMA等)基于自研CPU芯片的优化,提升网络吞吐量、降低传输延迟、优化网络拥堵控制 5. 深入研究网络虚拟化技术(如SR-IOV、DPDK、VPP等),优化虚拟化场景下的网络性能,提升资源利用率 6. 针对云计算、大数据传输等高频网络场景,结合自研CPU的网络加速特性,制定端到端的网络性能优化方案 7. 解决网络软件(如网卡驱动、网络中间件)与自研CPU芯片适配过程中的技术难题,保障网络系统的稳定性和可靠性
作为芯片互联方向的产品经理,为达摩院规划与定义面向下一代AI数据中心的scale up互联芯片产品方案,与架构师,软件产品经理一起定义有技术前瞻与市场竞争力的产品 - 产品规划:跟踪 Scale-Up/Scale-Out网络架构、研究LPO/NPO/CPO、OCS(光电路交换)等新兴技术路线,制定产品技术路线图。 - 产品定义:结合AI集群Scale Up网络拓扑需求,定义交换芯片/GPU芯片互联端口速率、带宽、时延、功耗、封装形态等核心指标,输出产品MRD/PRD。 - 系统级方案设计:主导电/光互联在 Scale-Up 网络架构方案落地,评估 Pluggable/LPO/NPO/CPO、EPS/OCS等组合对系统 TCO(成本和功耗)、时延的影响,输出技术选型与成本测算报告。 - 项目推进:与架构师、软硬件团队协同,完成产品方案评审,平衡产品性能、成本、功耗与研发周期,确保产品可量产落地。 - 商业化:配合BD团队,输出产品技术白皮书与技术方案,支撑客户选型、方案适配与项目落地,跟进产品上市后市场表现与客户反馈,持续优化产品迭代策略。
1. 跟踪大模型的国际前沿算法技术动态,定期输出技术调研报告并试点验证,评估其在业务中的应用价值; 2. 负责大模型在端侧/边缘场景的优化与落地,包括模型压缩、推理加速、多模态输入处理与上下文管理; 3. 负责数据计算、运动控制、图像处理算法的研发与优化; 4. 跨团队参与产品的需求评审,制定算法验收标准,配合测试团队完成算法在各应用场景下的效果验证与版本迭代; 5. 主导算法在 RISC-V 架构硬件上的移植、量化与性能优化,确保算法运行的稳定性和实时性; 6. 负责撰写设计方案、接口规范等技术文档,参与专利布局及相关学术论文的撰写;
岗位职责: 负责服务器芯片的功能、性能、稳定性测试定制工具开发,支撑芯片验证、生产、客户服务器整机交付、线上运维等各类场景下的软件工具研发需求 参与制定芯片验证和软件测试的流程、标准 参与客户量产阶段的技术支持工作,与上下游团队协作,达成产品线上服务质量目标
- 规划 PyTorch、vLLM、SGLang 等主流框架的适配技术路线,设计硬件抽象层(HLA)与上层框架的接口规范 - 开发适配层核心模块,实现算子调度、内存管理和分布式通信等关键功能 - 优化框架后端实现,与算子库、运行时等团队协作,系统性提升大模型推理效能 - 代表团队在开源社区推动关键技术主张,提交优质代码贡献,推动后端适配进入主线代码
● 负责芯片软件栈架构设计,包括但不限于调度系统设计、编译系统设计、计算系统设计、分布式系统设计。 ● 负责大规模分布式训练和推理的软件系统性能优化方案的设计,针对芯片架构特点提出合理的解决方案。 ● 负责各软件组件之间的协同设计,以及软件与硬件的协同设计,能够基于产品要求提出对硬件的明确需求。 ● 追踪行业动态,基于公司的AI芯片架构特点提出前瞻性的建议以及技术储备。
作为供应链管理负责人,您将领导供应链管理团队,负责供应链体系建设和管理,包括合作伙伴网络建设、生产排产与规划以及质量测试等方向。您将与新产品定义需求配合,筛选优质合作伙伴,建立符合团队战略和创新产品技术方向的供应链体系,推进商务流程,并保证生产运营的顺利进行。 主要职责: 1. 领导供应链管理团队,制定并推进供应链管理策略,促进团队建设和提升团队绩效; 2. 配合新产品定义需求,拓展供应商网络,筛选合格的合作伙伴,并建立符合公司战略与创新产品技术方向的供应链体系; 3. 配合集团采购,推进各环节的商务流程,确保供应链各环节有序衔接; 4. 负责芯片生产排产与规划工作,保证生产进度和产能符合需求; 5. 负责协助工厂对芯片进行质量测试,对良率提升与量产质量负责;
● 跟踪深芯片领域及新型计算领域(如机器学习)发展,设计开发高性能低功耗的架构、芯片及硬件产品。 参与芯片架构与微架构设计,负责开发和维护各种通用接口和模块; ● 针对阿里巴巴集团业务发展需求,开发相应原型系统,落地芯片产品。
1、负责生鲜产品的接收、质量检验和分类工作,确保产品质量符合国家标准及公司要求; 2、监控生鲜产品的贮存环境,确保温度、湿度等条件符合规定要求,有效防止食品腐败; 3、定期对库存商品进行盘点抽检,及时发现并处理不合格产品; 4、跟踪并记录生鲜产品的质量状态,为质量改进提供数据支持; 5、与采购部门紧密协作,评估并审核供应商质量体系,保证商品到货品质; 6、培训仓库员工关于生鲜产品质量标准的知识和日常操作规范; 7、参与制定和优化质量控制流程,提高工作效率。
1.负责B端商家产品的用户体验设计工作,拆解业务目标,制定设计策略,独立产出高质量的产品设计方案,跟进落地并保障上线质量; 2.探索AI与业务场景结合的体验创新,将AI能力融入商家产品,推动高质量AI体验范式的落地与验证迭代; 3.研究商家及小二反馈,挖掘体验问题本质,推导优化方案并持续验证迭代,将设计价值最大化; 4.参与AI设计工作流建设和AI资产沉淀设,推动设计方法与流程的智能化升级,提升团队设计质量与效率。
1、负责平台餐饮行业的运营工作,对行业、类目进行深度的洞察分析与发展趋势分析,面向业务团队输出运营策略与支持策略; 2、负责行业基础运营体系的完善和优化, 制定核心策略和重点项目的规划、推进与落地; 3、负责行业的商户成长体系建设与商户的分层运营,在商家经营策略上(经营利润,SKU管理、营销活动等)形成完整方法论,并能应用于实操环节; 4、定期从数据视角进行业务复盘同时结合内外部信息,探索业务的新玩法的专项探索与研究,沉淀成新的运营方法论。
1.负责从rtl2netlist的综合全流程flow开发/优化/维护工作 2.负责综合模块或者整芯片的综合策略的制定及STA signoff标准制定 3.负责模块或top从rtl2netlist的综合、formal、sdc编写及验证,upf编写及验证 4.负责综合netlist/sdc的quality的验证 5.Function eco的方案及完成 6.和前端设计沟通设计相关问题及修改,和后端沟通物理实现相关问题 7.制定提升PPA的综合策略