招聘信息分享 招聘信息分享 JOBHUNTER

聚合各大厂 / 国企官网招聘信息,实时同步官方数据

共找到 34331 个岗位

阿里云智能-AI Agent开发者运营专家-弹性计算

阿里巴巴📍北京/杭州5年以上

- 制定弹性计算(包括函数计算、ACS Agent Sandbox、轻量应用服务器等产品)面向 AI Agent 开发者的运营策略,通过数据分析明确用户画像,并根据市场需求和用户反馈持续调优 - 识别关键媒体渠道(搜索引擎、B站/小红书、以及 AI 技术社区等新媒体),制定投放策略和运营计划 - 量化和提升投放 ROI,对关键词、展示类广告的前端点击和后端转化效果进行实时监控与优化,确保单位投放有效性 - 制定aliyun.com/alibabacloud.com站内流量分发规则,优化站内流量转化效率 - 设计平台运营规则,提供运营工具与资源包,协同做好权益设计与运营,支撑用户增长目标 - 制定开发者社区运营规划和策略,对社区长期发展负责,推进社区知识产权保护和技术标准制定 - 管理和维护社区技术内容(技术文章、开源项目、教程等),结合开发者实际使用场景确保内容实用性和可操作性,并通过多渠道宣传推广 - 收集分析社区运营数据(开发者数量、活跃度、试用与有效使用用户数等),评估效果并持续优化;与合作伙伴建立良好合作关系,共同推动社区发展 - 策划并组织线上线下开发者活动(免费试用、技术培训、黑客松、开发者 meetup 等),协同各产品线产品运营,提高有效用户转化 - 制定活动策略和计划,整合各方资源确保活动顺利进行,获取参与者反馈并分析活动数据,持续优化活动效果 - 与合作伙伴共同策划和运营开发者活动,关注市场行业动态,及时调整策略保持活动竞争力 - 通过数据分析、问卷调查和用户反馈等方式洞察开发者需求,与产研团队紧密合作推动产品优化和改进,提升产品竞争力

阿里云智能-弹性计算 Agent 解决方案架构师-北京/深圳/杭州

阿里巴巴📍北京/深圳/杭州5年以上

1. 能够深入理解所负责的弹性计算产品技术原理、架构和使用场景,根据云沙箱/容器/ECS产品特性进行架构设计和客户方案管理,推动和实现产品的商业化落地; 2. 负责弹性计算 Agent 技术解决方案的设计规划:需要能充分了解客户的需求和场景,能够基于云沙箱组合安全、存储、观测、上下文管理等领域产品,设计阿里云 Agent Infra 解决方案,为客户提供面向实际业务场景的可落地方案,推动产品规模增长; 3. 能够成为 AI/Agent 技术领域的专家:不仅要能理解和使用 AI/Agent 相关的产品能力和特性,还需要能深入理解和运用 Harness 工程方法,设计出可落地的 AI/Agent 最佳实践,推动客户 POC 测试和生产转化; 4. 能够主动探索 AI/Agent 的发展和演进趋势:积极主动的学习业界 AI 新技术、快速跟进 AI 发展新动向,并能从客户的诉求和落地场景中抽象出产品需求,协助产研推进云沙箱/容器/ECS等产品功能迭代和竞争力打磨; 5. 能够与前线架构师/BTE销售紧密合作,主动了解客户当前在产品方案遇到的困难和需求,帮助客户解决技术问题,寻找新的业务突破点。推广产品方案并能够影响客户的基础设施、工程、算法等不同团队,用产品技术推动业务增长。

阿里云智能-AI infra工程效能与质量开发专家-杭州

阿里巴巴📍杭州5年以上

1. 负责泛容器服务全年故障管控,推动故障分收敛,通过核心/普通仓库分级覆盖率标准及集成测试成功率保障研发过程质量,实现ACK/ACS/FC等产品闭环修复。 2. 主导容器服务全生命周期质量保障体系建设,拉齐多产品一致的质量策略、验收方案与验收流程,确保质量保障水位统一。 3. 规划建设AI Native CI平台,基于AI Agent实现测试失败分析、报告生成、流水线编排等场景,提升测试用例AI生成比例与代码风险扫描能力。 4. 负责容器产品性能容量提升,主导性能评测基础设施建设与标准化基线管理,以评测数据驱动容量规划与性能优化。 5. 建设容器故障演练体系,验证产品容灾、告警与逃逸能力,跟进历史故障改进落地及重大架构改造质量风险评估。 6. 推动AI Coding在容器研发团队的实践落地,探索AI辅助开发在测试生成、代码评审、风险识别等场景的规模化应用。

阿里云智能-AI系统工程性能优化专家-杭州/北京/上海

阿里巴巴📍北京/杭州/上海5年以上

1. 负责灵骏集群的AI系统性能分析与优化,支持客户多个AI作业场景在不同平台芯片和多种集群规模下的适配和性能调优,能快速且以工具/产品化方式识别性能瓶颈并提出解决方案; 2. 针对主流深度学习框架、分布式训练和模型部署场景等,进行性能调优,优化算子性能、通信性能、内存利用率等关键指标,提升集群整体运行效率; 3. 对AI系统进行性能建模与仿真,建立Roofline模型等性能分析工具。通过仿真结果辅助系统设计和资源分配,为集群建设提供数据支持;同时推荐最佳训练和模型部署配置,辅助用户拿到最佳性能实践; 4. 负责开发和维护性能分析工具,支持系统性能监控、瓶颈定位和优化效果评估,提供性能分析报告,为团队和客户提供性能优化建议。

阿里云智能-AI智算集群监管控及算力管理平台研发专家-北京/杭州

阿里巴巴📍北京/杭州5年以上

1. 建设灵骏集群监管控系统核心能力,不断提升客户在云上使用灵骏智算集群产品的自动化、智能化程度。 2. 建设满足业务场景和数据合规要求的智算集群库存管理体系,结合节点调度、性能分析、故障自动化处理、租户运维功能等核心体系能力,持续提升灵骏智算集群产品竞争力。 3. 建设智算集群和管控系统自身高可用体系,如智算集群健康检测、节点与集群异常快速处置体系、管控组件故障自动定位、自动恢复、自适应容灾、云原生技术实施及落地等,保障业务持续可用、保障线上系统稳定性。 4. 建设异构算力统一管理及资源调度系统,持续智算集群资源利用率、降低计算成本。 5. 持续跟踪AI智算、云原生及智能运维领域新技术,结合业务场景进行创新。 6. 该职位涉及值班响应的职责,在服务级别协议(SLA)时间内做出对客响应,推动客户问题的解决,改善客户体验。

阿里云智能-虚拟化系统研发专家(Hypervisor & AI Infra)-杭州

阿里巴巴📍杭州5年以上

1、主导/参与面向 Intel/AMD/ARM 新一代服务器平台的虚拟化核心模块研发,完成新硬件特性在 Dragonfly Hypervisor 中的使能与深度优化; 2、设计并实现虚拟化下高性能、轻量级VMM方案,支撑 AI 训练/推理、Agent 沙箱等新型负载的隔离性、性能与启动速度; 3、 研发与优化软硬协同的隔离方案(内存/IO/中断/设备粒度),提升多租户场景下的安全性、确定性与资源保障能力; 4、基于神龙硬件平台,设计并落地加速卸载方案,持续降低虚拟化开销、提升端到端吞吐与延迟; 5、持续演进热迁移/热升级/热插拔技术,在百万级实例规模下保障业务零感知、高成功率、秒级收敛; 6、构建虚拟化可信执行环境(vTPM/TCM 集成、机密计算支持、启动度量与远程证明),打造云上可信基础设施底座; 7、深入客户一线,主导复杂性能瓶颈分析、稳定性根因定位与系统级调优,输出可复用的方法论与工具链; 8、参与下一代 Dragonfly Hypervisor 的架构设计——面向 AI Infra 与 Agent 运行时需求,定义轻量、弹性、可扩展、可观测的新一代虚拟化范式。

阿里云智能-AI智算集群监管控及算力管理平台开发专家-北京/杭州

阿里巴巴📍北京/杭州5年以上

1. 建设灵骏集群监管控系统核心能力,不断提升客户在云上使用灵骏智算集群产品的自动化、智能化程度。 2. 建设满足业务场景和数据合规要求的智算集群库存管理体系,结合节点调度、性能分析、故障自动化处理、租户运维功能等核心体系能力,持续提升灵骏智算集群产品竞争力。 3. 建设智算集群和管控系统自身高可用体系,如智算集群健康检测、节点与集群异常快速处置体系、管控组件故障自动定位、自动恢复、自适应容灾、云原生技术实施及落地等,保障业务持续可用、保障线上系统稳定性。 4. 建设异构算力统一管理及资源调度系统,持续智算集群资源利用率、降低计算成本。 5. 持续跟踪AI智算、云原生及智能运维领域新技术,结合业务场景进行创新。 6. 该职位涉及值班响应的职责,在服务级别协议(SLA)时间内做出对客响应,推动客户问题的解决,改善客户体验。

阿里云智能-函数计算(FC)Sandbox Infra 研发专家-北京

阿里巴巴📍北京5年以上

函数计算(Function Compute)是阿里云 Serverless 的核心产品,承载了集团内外大量在线业务、AIGC 推理、数据处理、前端 SSR 等负载。 Sandbox Infra 团队负责函数计算最底层的那一层: ● 多租户下的安全隔离:任意用户代码都要能安全、稳定地跑在共享基础设施上; ● 极致的冷启动与弹性:百毫秒级拉起一个带完整运行时的安全沙箱,秒级扩容到数万实例; ● 极致的资源效率:在保证隔离性的前提下,把单机密度、内存复用、CPU 利用率做到业界一线水平; ● 为上层 Runtime、调度、AI Agent / Code Interpreter 等场景,提供稳定、可编程、可观测的执行底座。 简单说:我们做的是"云上最难的那类容器"——既要像虚机一样安全,又要像容器一样轻,还要像进程一样快。 你会参与哪些具体方向(任选其一或多) 1. 安全容器 / MicroVM 方向 基于 Kata / Firecracker / 自研 VMM 做深度裁剪与优化:最小化 guest kernel、优化 VM 启动路径、device 模型简化、IO/网络直通、内存气球与共享、快照与 fork 启动等。 2. 运行时方向 内核裁剪与定制(cgroup v2、namespace、seccomp、LSM、io_uring、eBPF),冷热启动路径优化,page cache / THP / memcg 行为调优,解决真实线上疑难 case。 3. 沙箱调度与资源管理 单机维度的实例编排:实例池、预热、复用、驱逐、超卖、QoS 分级;跨机维度的弹性与亲和性;与上层函数调度、镜像加速(overlay、lazy pull、P2P)深度协同。 4. Runtime & Language Sandbox 语言运行时层面的轻量隔离(Node.js / Python / JVM / Wasm 等),进程级 / v8 isolate / Wasm 沙箱在特定场景下的可行性探索与工程落地,为 AI Agent、Code Interpreter 这类新形态提供底座。 5. 可观测性与稳定性 在不能侵入用户代码的前提下,做沙箱内外的全链路追踪、性能剖析、异常诊断;设计面向百万级实例规模的故障自愈与灰度体系。

阿里云智能-agent sandbox管控开发专家-杭州/北京

阿里巴巴📍北京/杭州5年以上

1. 负责AaaS(Agent as s Service)管控平台的架构设计与功能研发工作; 2. 深入调研Agentic AI时代对Infra(基础设施层)的需求,凝练核心能力并提供专业的解决方案,助力内外部AI业务实现快速规模增长,并不断提高用户粘性; 3. 设计并落地高性能、高可用、可伸缩的管控系统架构,应对AI时代下CPU、GPU资源海量的弹性需求,并不断提升系统的容量和稳定性,保障客户业务持续稳定地运行; 4. 利用Agent、Harness框架提升内部系统的研发、运维、诊断效率。

阿里云智能-agent sandbox平台开发专家-杭州/北京

阿里巴巴📍北京/杭州5年以上

1. 构建 Agent Sandbox 服务的云原生适配层,实现基于 Kubernetes 集群的 Agent Sandbox 的全生命周期管理。 2. 负责虚拟节点(Virtual Node)架构设计和性能优化,解决 超大规模集群下 Serverless 容器与Kubernetes 管控面的状态管理、资源映射和异常自动恢复等技术难题。 3. 优化超大并发下 Kubernetes 控制器/组件的处理能力,降低处理延迟,提升资源利用效率与系统稳定性,应对AI时代下海量弹性需求。 4. 实现控制器/组件全面 Agentic 化,提升研发、运维、问题排查效率。 5. 推动云原生 AI 前沿技术的预研、落地,持续提升阿里云容器产品的竞争力与系统稳定性。

阿里云智能-灵骏 SRE专家-杭州

阿里巴巴📍杭州5年以上

1. 负责各计算集群交付运维工作, 并且参与基础运维平台架构设计和建设; 2. 运维服务体系建设与优化,达成产品稳定性与SLA目标; 3. 制定交付标准, 沉淀运维规范, 通过工具平台提效日常工作; 4 跟进内外部合作伙伴项目, 优化项目流程; 4. 需要具备一定的创新突破和个人自驱力,善于发现问题,思考并解决问题。

阿里云智能-Agent Infra产品运营高级专家-北京/杭州

阿里巴巴📍北京/杭州8年以上

- 洞察 Agent Infra 行业的市场机会,分析产品市场容量和竞争格局,分析竞争对手产品的竞争优劣势及市场策略 - 制定并组织 Agent Infra 产品营销传播策略和计划,打造产品品牌和用户心智,提升目标客群对产品的感知,扩大前端流量和商机蓄水池 - 负责Agent Infra(真武PPU、Agent Sandbox等) 相关产品的 GTM 体系化建设,跨产品及方案内容建设 - 开发销售赋能材料,制定并执行销售和渠道培训赋能计划 - 通过用户行为分析、资源使用分析、在线动手实践、线下沙龙等形式,制定商机生产、消费策略并执行 - 运营 Agent Infra 技术社区和开发者平台,策划并组织开发者活动,挖掘用户需求和场景,建立产品的技术影响力和用户心智 - 通过商业化策略设计和渠道效率优化,实现中长尾付费客户规模健康增长;通过产品市场活动、圈层运营,协助头腰部客户商业化增长 - 制定产品业务健康度衡量标准和模型,量化分析支持产品设计、业务策略、产品体验、运营效率等多方面工作 - 监控、发现、推动修复端到端用户体验问题,系统化总结用户体验痛点,参与制定产品改进策略

阿里云智能-AI加速计算产品研发专家-杭州/上海

阿里巴巴📍杭州/上海5年以上

1. 依据公共云统一架构、OpenAPI规范、软件技术栈以及交付运维体系,负责公共云异构计算产品的研发与交付。深度参与研发流程,确保产品从研发到运维的全生命周期高效管理; 2. 跟踪和了解新的异构计算产品技术和趋势,探索前沿的GPU架构设计与技术,理解业务战略及重点,基于业务需求作出高可用、高可靠、高拓展性的技术架构规划和落地; 3. 联合网络团队共同设计网络互联架构,针对分布式训练和推理业务场景,在软硬件协同及高性能网络方向上寻找性能优化的新途径,构建阿里云加速计算云服务器的核心竞争力; 4. 研发并持续改进系统的稳定性和安全性,制定稳定性策略,寻找并解决产品系统中的潜在风险和瓶颈,覆盖线上疑难杂症问题,提高产品稳定性和性能确保平台的安全可靠运行,并不断提升对外服务质量标准。

阿里云智能-研发流程管理专家-杭州

阿里巴巴📍杭州5年以上

1. 负责弹性计算团队重要产研项目的管理工作,确保项目目标达成。 2. 根据组织战略目标的要求,组织相关方进行目标拆解和战役规划,推动核心干系人达成共识。优化资源配置,做好长期目标,短期目标和有限资源之间的统筹与平衡。建立战役组织保障机制,做好战役的执行管理,确保组织战略目标的成功实现。 3.从项目筹备、需求分析、项目规划、过程实施、结果验收、产品发布、运维、业务监控等进行全生命周期管理。有效协调干系人并管理期望值,确保项目有序推进,及时发现并跟踪解决项目问题,有效管理项目风险,协调项目资源,保证目标能够按预期实现落地。 4. 在达成项目目标的同时,通过流程机制建设及可量化可观测的分析,结合产研项目过程的全程跟踪, 能够洞察并改善项目所属产研领域过程中的问题和瓶颈,能够给项目/产研领域一号位提供合理的优化建议;从产品和技术竞争力、业务的发展、从客户问题到产研效率问题等多维度,驱动整个团队提升产出效率。 5.通过过程资产库建设、最佳实践沉淀、项目管理能力赋能等提升团队项目管理能力。

阿里云智能-灵骏高性能AI集群高级解决方案架构师-杭州

阿里巴巴📍杭州8年以上

1、作为产品解决方案架构师,深入理解灵骏及异构产品所负责的高性能AI智算集群的技术原理、架构和使用场景,能够根据企业级客户需求和产品能力,规划设计合理的灵骏产品解决方案,推动和实现产品的商业化落地。 2、具备良好的架构思维能力,能够从稳定性、高性能、易用性、可用性、可运维性等方面综合考虑,结合云计算平台产品特点,敏锐捕捉市场趋势,分析竞对产品及市场策略,为产品的设计、实现、改进不断提出建设性的想法和建议,反哺产品能力建设,不断提升灵骏及异构产品的市场竞争力和市场份额。 3、与前线架构师/BTE销售紧密合作,主动了解客户当前在产品方案遇到的困难和需求,帮助客户解决技术问题,寻找新的业务突破点。推广产品方案并能够影响客户的基础设施、工程、算法等不同团队,用产品技术推动业务扩展。 4、分析云计算技术发展趋势/市场竞争格局,挖掘行业数据/客户商机,建立可复制行业解决方案,与产品内部的产品经理、资源及经营团队、研发等团队紧密配合,推动营收增长。

阿里云智能-CIPU研发专家(存储)-杭州

阿里巴巴📍杭州5年以上

在2022阿里云峰会上,阿里云正式发布了其自主研发的云基础设施处理器CIPU(Cloud infrastructure Procrssing Units),作为一款为新型云数据中心设计的专用处理器,它将在未来取代CPU成为新一代云计算的管控和加速中心。了解CIPU: https://mp.weixin.qq.com/s/VEco9XaX0eQtZy-pAVS6ug 系统设计与研发 • 负责云平台系统CIPU 的存储云化加速 架构设计和优化工作 • 负责CIPU存储云化加速 新技术和方案的研发以及在云产品推广应用的工作 • 基于业务需求和设计方案完成UT用例设计开发,对系统的稳定性负责 • 负责系统设计与研发文档的编写、改进与维护 系统性能优化 • 对软件系统进行性能数据分析,通过软件系统重构,实现软件系统稳定性/性能的提升 • 沉淀、输出相关案例/工具 系统测试与维护 • 负责软件系统的技术支持与运维工作,分析软件系统中可能存在的问题,全局视角分析问题根因,定位并解决问题,保证系统符合性能、稳定性等指标要求 • 负责CIPU存储软件和系统的测试工作,设计、搭建与管理测试平台,通过性能测试,推动产品不断演进迭代 技术规划 • 基于业务需求和技术洞察,制定本领域内的技术团队的中长期发展规划和技术路线图 • 体系性地设计各类配套规划,包括技术人员规划、技术基础设施规划、技术质量规划、技术安全规划等 项目管理 • 确定项目目标和范围,并拟定项目计划、预算和资源需求计划、项目风险评估、交付成果等 • 按项目计划进行落地实施,并对项目进度、数据、质量进行监控,确保项目保质保量实施 • 总结项目经验和教训,反馈项目成果和绩效,为之后的项目管理沉淀经验总结

阿里云智能-异构GPU集群资源优化技术专家-杭州

阿里巴巴📍杭州5年以上

1. 负责智算集群中GPU资源的全面监控、质量巡检及故障预测,通过智能化运维手段确保系统的高可用性和稳定性,提前识别并解决潜在问题。 2. 保障在线POD的集群资源管理与切分业务,优化资源分配策略,提高资源利用率和任务处理效率,支持大规模分布式计算的需求。 3. 开发和维护KuberGPU技术,实现GPU资源的高效切分与容器化部署,支持多款智算相关产品的多种应用场景,提供灵活且强大的GPU资源共享解决方案。 4. 开发和实施容器热迁移技术,提升集群灵活性和容错能力,确保在不停机的情况下进行系统维护和资源调度,进一步增强用户体验和服务连续性。

阿里云智能-异构 GPU集群资源优化专家-杭州

阿里巴巴📍杭州5年以上

1. 负责智算集群中GPU资源的全面监控、质量巡检及故障预测,通过智能化运维手段确保系统的高可用性和稳定性,提前识别并解决潜在问题。 2. 保障在线POD的集群资源管理与切分业务,优化资源分配策略,提高资源利用率和任务处理效率,支持大规模分布式计算的需求。 3. 开发和维护KuberGPU技术,实现GPU资源的高效切分与容器化部署,支持多款智算相关产品的多种应用场景,提供灵活且强大的GPU资源共享解决方案。 4. 开发和实施容器热迁移技术,提升集群灵活性和容错能力,确保在不停机的情况下进行系统维护和资源调度,进一步增强用户体验和服务连续性。

阿里云智能-AI智算集群监管控及算力管理平台研发专家-杭州/北京

阿里巴巴📍北京/杭州5年以上

1. 建设灵骏集群监管控系统核心能力,不断提升客户在云上使用灵骏智算集群产品的自动化、智能化程度。 2. 建设满足业务场景和数据合规要求的智算集群库存管理体系,结合节点调度、性能分析、故障自动化处理、租户运维功能等核心体系能力,持续提升灵骏智算集群产品竞争力。 3. 建设智算集群和管控系统自身高可用体系,如智算集群健康检测、节点与集群异常快速处置体系、管控组件故障自动定位、自动恢复、自适应容灾、云原生技术实施及落地等,保障业务持续可用、保障线上系统稳定性。 4. 建设异构算力统一管理及资源调度系统,持续智算集群资源利用率、降低计算成本。 5. 持续跟踪AI智算、云原生及智能运维领域新技术,结合业务场景进行创新。 6. 该职位涉及值班响应的职责,在服务级别协议(SLA)时间内做出对客响应,推动客户问题的解决,改善客户体验。

阿里云智能-容器高级产品专家(Agent Infra 方向)-北京/杭州

阿里巴巴📍北京/杭州8年以上

1. 技术前瞻与需求洞察:深度跟踪容器、AI Agent Infra 技术前沿(如 Kubernetes 新特性、Serverless 演进、AI 训练/推理、AI Agent 架构、微服务治理等),精准识别内/外客户在不同场景中的核心需求,驱动产品创新方向与技术战略落地; 2. 竞品与市场分析:持续分析主流模型服务商在容器&Agent 编排、AI Agent 架构、Agent Framework SDK 等领域的竞品动态,输出深度市场洞察报告,支撑产品差异化设计与战略决策,不断增强产品竞争力; 3. 产品全生命周期管理:主导核心容器产品(如 ACK、ACS、ACR、ArgoWorkflows 等)的功能规划、需求定义、设计及商业化运营,从需求挖掘到规模化落地,推动市场份额与用户满意度提升; 4. 跨职能协同:联动产品 PDSA、运营、研发、运维及 SA 架构师团队,高效推进产品从需求到上线的全流程交付,确保技术方案与客户业务目标精准匹配,提升交付质量与客户体验; 5. 产品运营与持续迭代:负责产品上线后的运营闭环,包括客户反馈深度分析、用户培训、市场活动支持及数据驱动的体验优化,通过持续迭代巩固产品市场地位与客户成功。