共 4547 个在招岗位 · 覆盖国企、大厂官方招聘
1,负责市场合作资源的拓展,结合市场部活动目标,基于AI拓展可以创造业务影响力的合作机会; 2,制定渠道资源激活策略、追踪合作效果数据、优化资源配置,把合作意向转化为资源落地和增长结果; 3,面向消费品、零售、生活服务等行业品牌,以资源置换为核心模式,撬动品牌方为千问投入市场传播资源。
1. 针对飞猪的营销活动进行媒体规划和管理媒体资源,包含完整的媒体策略、目标制定与完成路径、内容匹配安排,落地品牌的营销策略; 2. 根据用户运营的逻辑,进行精准的人群洞察与合作客户的需求挖掘,寻找高效的媒介触点和内容打法,推进项目落地执行,并搭建模型,实时监测,持续优化广告投放效果; 3. 负责协调媒体/供应商合作及商务谈判。
1. 全周期营销战役策划 负责旅游行业核心营销节点(春节、五一、暑期、国庆、双旦等)的整合营销规划与执行。基于业务节奏,制定从预热、爆发到长尾期的全链路营销策略,对流量增长、转化效率及GMV负责。协同货品运营团队,将不同层级的货盘优势转化为营销卖点,确保营销动作与货盘供给高度匹配。 2. 品牌话题与事件营销 策划具有破圈效应的品牌话题与线上线下事件。通过创意内容(短视频、直播、跨界联名等)提升品牌声量,强化品牌心智。负责重大营销节点的事件落地,统筹内外部资源,实现品牌曝光与业务转化的双赢。 3. 全域流量运营 主导站外引流渠道的内容投放策略。从用户运营视角差异化配置投放素材与人群策略,监控各渠道 ROI确保营销投入产出比健康。联动生态内资源,打通公私域流量闭环,提升用户从种草到下单再到核销的全链路效率。 4. 数据驱动与策略迭代 搭建模型建立营销数据监控体系,定期分析流量、转化率、核销率、新客占比等核心指标。有产品思维,能针对业务痛点输出专项优化方案,并协同产品、运营团队落地改进,持续提升营销效能。
1. 负责专家社区与智能标注平台的全栈开发,涵盖标注任务管理、质检验收流水线、专家资源池等核心模块; 2. 参与代码、音视频、医疗等垂类标注能力建设,设计灵活可扩展的标注模板与作业工具; 3. 开发 AI Agent 辅助标注能力,提升平台生产效率与数据质量; 4. 参与平台性能优化与架构演进,保障高并发场景下的服务稳定性; 5. 参与前端交互体验优化,建设标注员友好的作业界面与管理后台;
我们是淘宝会员技术-平台&省钱卡技术团队,长期深耕淘天账号和用户信息管理中台,并同时负责淘天集团省钱卡、大会员等业务。团队目前正致力于通过AI Agent技术解决业务和技术的痛点和难点问题,包括但不限于: 1. 省钱卡业务 Agent:目标驱动的自主业务分析 Agent,能够发现和洞察业务问题、探索优化策略、自主进行线上试验并形成持续迭代的循环,提升业务增长。 2. 省钱卡端到端 AI 研发 Agent:面向省钱卡业务代码的 Agentic Coding 系统,覆盖“需求理解 → 规划 → 编码 → 测试 → 提交”全链路,让 AI 成为真正的研发参与者。 3. 平台级 CR Agent:面向代码评审 / 变更风险的 Agent,通过知识工程(变量生命周期树、中间件知识、定向 Skill)+ Multi-Agent 编排 + 定制 MCP 工具,提升代码评审中BUG的发现率。 你加入后,将根据兴趣和团队需要,参与到以下一个或多个 Agent 系统的建设中。 1 业务/分析型 Agent 建设,负责省钱卡探索 Agent的架构设计与工程实现,实现 ReAct / Plan-and-Execute / Multi-Agent 协作、Tool/Function Calling、记忆系统(短期/长期)、RAG 检索增强等Agent 核心模块,打通数据链路,构建业务洞察和分析SKILL,并建设 Agent 可观测性、评测与实验基建,实现“自主假设生成 → 数据验证 → 问题树演化 → 可执行洞察输出”的完整分析飞轮。 2 端到端 AI 研发 Agent 建设,设计并落地面向省钱卡业务的 Agentic Coding Harness工程体系(工具调用、验证闭环(测试/构建/类型检查)、沙箱安全、Human-in-the-loop等),实践Spec-Driven 流程,构建AI Friendly的业务&技术知识库建设等。 3 CR Agent 设计与实现,包括构建面向代码评审的知识工程(变量生命周期树、中间件知识等),开发领域SKILL和MCP 工具(AST/Tree-sitter/xmlParse/jq 等),实践SFT与Agentic RL等后训练,并建立 CR Agent 的评测体系,持续优化Agent效果与成本。 4 前沿跟踪与研究,持续跟踪和研究 Agent 架构、Loop Engineering、Agent自进化、Agentic RL(GRPO/DPO/PPO)、后训练数据构建、后训练技术、RAG 优化等方向,并转化为工程实践。
1.参与财务智能分析领域、ESG领域、Agent交付领域相关系统建设,可根据个人能力承担前端、后端或全栈研发工作; 2.具备良好的沟通能力,能够充分理解业务需求,完成从方案设计、开发实现到上线交付的工作; 3.能够带着思考支持业务,主动挖掘业务痛点,并通过工程技术、数据能力、AI工具等手段提升业务效率与系统体验; 4.关注产品体验、系统质量与交付效率,能与产品、业务、设计、测试等角色高效协作。
作为不动产技术部的团队管理者,全面负责智慧办公、空间运营、资产管理的系统建设,为集团、生态公司和外部客户提供行业领先的技术系统解决方案。 1. 系统架构设计:主导整体技术架构设计,确保系统具备高可用性、高并发处理能力及良好的扩展性,以支撑全球数百万方园区不同管理业态的复杂场景; 2. 解决方案交付:深度链接业务,挖掘内外部客户在不动产场景下的数字化痛点与需求,交付稳定、高效、可产品化的技术解决方案,同时探索对外的技术输出与服务模式; 3. 技术创新与前瞻:鼓励并主导技术创新,探索AI大模型等新技术在不动产场景的落地应用,建立团队在数字化领域的技术领先性和行业影响力; 4. 研发效能提升:建立完善的研发管理体系,优化开发流程,持续提升团队技术交付效率与研发质量。
我们是 Accio,是第一个在 B2B 电商领域推出的 AI Agent(www.accio.com),加入我们,一起建设 AI Agent,帮助全球企业智能高效进行全球找品/找商,研究趋势,市场研究,新品开发,研究竞对格局等。AI 让这个时代充满了前所未有的机遇,而我们已经率先迈入这片蓝海。现在,诚邀你的加入,一起共创未来! 1. 参与和主导 MultiAgent 架构设计和落地,探索上下文工程优秀实践 2. 参与和主导 Agent 记忆系统的设计和落地,持续解决复杂技术难题 3. 持续学习 Agent 前沿的思想和经验,推动优秀实践落地,提升业务效果 4. 负责 Agent 研发效率、运维、性能、稳定性等
1、Agent 商机判断和深度技术交流: (1)赋能前端业务线/行业线,推动业务快速拓展。 (2)作为 Agent 产品团队代表,支撑前线业务线开展商机判断和选择。 (3)针对复杂项目需求,协同前后团队与客户进行深度技术交流,促进商机转化,为结果负责。 2、产品解决方案设计与标杆案例打样: (1)支持行业/区域的市场洞察,理解行业客户的业务和功能性/非功能性需求,基于客户场景,提供有技术竞争力和成本优势的产品组合方案,并在产品选型/配置报价/招投标过程中提供技术支持。 (2)跟进产品方案的落地效果,持续优化产品方案。 (3)沉淀产品解决方案的最佳实践,通过项目实践总结标杆案例,为产品方案规模化复制提供弹药。 (4)探索创新产品的方案和场景,推动新场景、新能力快速市场覆盖。 3、市场洞察: (1)洞察多Agent协同产品的市场机会、市场容量和竞争格局,捕捉机会,找到方向,并能影响前线和产研快速推动落地。
1、基于飞猪酒店业务,进行高星酒店业务拓展,保证所辖区域高星酒店覆盖率; 2、结合阿里生态&市场特性为高星酒店客户提供运营方案,帮助商家提升运营能力并驱动销量持续提升,与所辖区域商家并建立深度业务合作关系; 3、协同产品、运营团队,推动业务及项目落地,持续优化用户体验。
1. 评测集体系搭建:构建Work方向评测体系,涵盖基模、AI应用下的AI办公软件、金融、法律、GUI&CLI 、企业级工作流大型项目等方向评测体系 2. Benchmark建设:构建高专业、高覆盖率的in-house 评测集,管理运营专家评测集生产,评测集合成技术生产 3. 评测集环境定制化开发:基于基础环境,定制化开发相关环境,构建与真实场景相匹配的环境,以支持评测集建设 4. 自动化评测集技术:LLM as Judge,Agent as Judge等评测技术研发,实现高效的自动评测 5. 评测输出:周期性评测模型短板,在模型研发阶段提供针对性的数据建议。指导数据生产、模型迭代。
1、千问办公经营效率及分析洞察能力体系建设:从 0 到 1 搭建覆盖营收(SaaS 订阅 / 算力 Topup / 专有部署)、算粒与 Token 消耗、毛利利润、用户画像的商业效率分析框架,统一核心指标口径并联动 BI、数仓、财务沉淀可复用数据资产,建设经营看板与异动预警机制,输出定期经营分析报告与专项归因。 2、阿里云 & 钉钉组织商机挖掘:基于用户消耗行为、画像与生命周期数据,识别高价值/高潜客户及增购、扩容、专有部署等商机线索,面向阿里云与钉钉两大组织的销售与服务团队输出可执行的商机清单与 POC 转化洞察,跟踪转化漏斗并推动 POC 向正式商用转化。 3、经营体系 & MaaS(算粒中台)侧分析:支撑算粒商业模式设计与定价的量化测算,评估缓存计费、多模态、阶梯定价等各计费模式的效率与利润影响,支持各 AI 产品线接入算粒中台的成本核算、定价合理性与交易链路分析,并对营销、销售、渠道政策做数据评估与投入产出复盘。
1、负责阿里云公共云价格体系管理,包括但不限于行业价格策略制定、授权与行权规则设计、价格水位运营与分析、报价平台建设的工作; 2、负责收集、分析、跟踪市场竞争者价格策略和价格变动情况,根据市场竞争情况及时调整价格策略和价格管控规则,保证竞争优势; 3、负责拉通产品侧分析、优化成本,提升云计算产品成本竞争力 4、对经营单元的销售毛利负责,月度产出经营分析报告,主动识别销毛达成风险、制定盈利提升计划 5、负责价格策略、报价流程与规则的培训
1、负责公司心智层面的策划及传播,包括公司大事件、定调内容、财报等内容方向; 2、结合公司动态、行业及财经环境,撰写相关新闻稿及深度稿; 3、关注行业,了解国内外AI公司业务、技术及动态,定期出具洞察报告; 4、支持其他业务传播需求,包括但不限于产品、技术、网络热点等。
- 制定弹性计算(包括函数计算、ACS Agent Sandbox、轻量应用服务器等产品)面向 AI Agent 开发者的运营策略,通过数据分析明确用户画像,并根据市场需求和用户反馈持续调优 - 识别关键媒体渠道(搜索引擎、B站/小红书、以及 AI 技术社区等新媒体),制定投放策略和运营计划 - 量化和提升投放 ROI,对关键词、展示类广告的前端点击和后端转化效果进行实时监控与优化,确保单位投放有效性 - 制定aliyun.com/alibabacloud.com站内流量分发规则,优化站内流量转化效率 - 设计平台运营规则,提供运营工具与资源包,协同做好权益设计与运营,支撑用户增长目标 - 制定开发者社区运营规划和策略,对社区长期发展负责,推进社区知识产权保护和技术标准制定 - 管理和维护社区技术内容(技术文章、开源项目、教程等),结合开发者实际使用场景确保内容实用性和可操作性,并通过多渠道宣传推广 - 收集分析社区运营数据(开发者数量、活跃度、试用与有效使用用户数等),评估效果并持续优化;与合作伙伴建立良好合作关系,共同推动社区发展 - 策划并组织线上线下开发者活动(免费试用、技术培训、黑客松、开发者 meetup 等),协同各产品线产品运营,提高有效用户转化 - 制定活动策略和计划,整合各方资源确保活动顺利进行,获取参与者反馈并分析活动数据,持续优化活动效果 - 与合作伙伴共同策划和运营开发者活动,关注市场行业动态,及时调整策略保持活动竞争力 - 通过数据分析、问卷调查和用户反馈等方式洞察开发者需求,与产研团队紧密合作推动产品优化和改进,提升产品竞争力
1. 能够深入理解所负责的弹性计算产品技术原理、架构和使用场景,根据云沙箱/容器/ECS产品特性进行架构设计和客户方案管理,推动和实现产品的商业化落地; 2. 负责弹性计算 Agent 技术解决方案的设计规划:需要能充分了解客户的需求和场景,能够基于云沙箱组合安全、存储、观测、上下文管理等领域产品,设计阿里云 Agent Infra 解决方案,为客户提供面向实际业务场景的可落地方案,推动产品规模增长; 3. 能够成为 AI/Agent 技术领域的专家:不仅要能理解和使用 AI/Agent 相关的产品能力和特性,还需要能深入理解和运用 Harness 工程方法,设计出可落地的 AI/Agent 最佳实践,推动客户 POC 测试和生产转化; 4. 能够主动探索 AI/Agent 的发展和演进趋势:积极主动的学习业界 AI 新技术、快速跟进 AI 发展新动向,并能从客户的诉求和落地场景中抽象出产品需求,协助产研推进云沙箱/容器/ECS等产品功能迭代和竞争力打磨; 5. 能够与前线架构师/BTE销售紧密合作,主动了解客户当前在产品方案遇到的困难和需求,帮助客户解决技术问题,寻找新的业务突破点。推广产品方案并能够影响客户的基础设施、工程、算法等不同团队,用产品技术推动业务增长。
1. 负责泛容器服务全年故障管控,推动故障分收敛,通过核心/普通仓库分级覆盖率标准及集成测试成功率保障研发过程质量,实现ACK/ACS/FC等产品闭环修复。 2. 主导容器服务全生命周期质量保障体系建设,拉齐多产品一致的质量策略、验收方案与验收流程,确保质量保障水位统一。 3. 规划建设AI Native CI平台,基于AI Agent实现测试失败分析、报告生成、流水线编排等场景,提升测试用例AI生成比例与代码风险扫描能力。 4. 负责容器产品性能容量提升,主导性能评测基础设施建设与标准化基线管理,以评测数据驱动容量规划与性能优化。 5. 建设容器故障演练体系,验证产品容灾、告警与逃逸能力,跟进历史故障改进落地及重大架构改造质量风险评估。 6. 推动AI Coding在容器研发团队的实践落地,探索AI辅助开发在测试生成、代码评审、风险识别等场景的规模化应用。
1. 负责灵骏集群的AI系统性能分析与优化,支持客户多个AI作业场景在不同平台芯片和多种集群规模下的适配和性能调优,能快速且以工具/产品化方式识别性能瓶颈并提出解决方案; 2. 针对主流深度学习框架、分布式训练和模型部署场景等,进行性能调优,优化算子性能、通信性能、内存利用率等关键指标,提升集群整体运行效率; 3. 对AI系统进行性能建模与仿真,建立Roofline模型等性能分析工具。通过仿真结果辅助系统设计和资源分配,为集群建设提供数据支持;同时推荐最佳训练和模型部署配置,辅助用户拿到最佳性能实践; 4. 负责开发和维护性能分析工具,支持系统性能监控、瓶颈定位和优化效果评估,提供性能分析报告,为团队和客户提供性能优化建议。
1. 建设灵骏集群监管控系统核心能力,不断提升客户在云上使用灵骏智算集群产品的自动化、智能化程度。 2. 建设满足业务场景和数据合规要求的智算集群库存管理体系,结合节点调度、性能分析、故障自动化处理、租户运维功能等核心体系能力,持续提升灵骏智算集群产品竞争力。 3. 建设智算集群和管控系统自身高可用体系,如智算集群健康检测、节点与集群异常快速处置体系、管控组件故障自动定位、自动恢复、自适应容灾、云原生技术实施及落地等,保障业务持续可用、保障线上系统稳定性。 4. 建设异构算力统一管理及资源调度系统,持续智算集群资源利用率、降低计算成本。 5. 持续跟踪AI智算、云原生及智能运维领域新技术,结合业务场景进行创新。 6. 该职位涉及值班响应的职责,在服务级别协议(SLA)时间内做出对客响应,推动客户问题的解决,改善客户体验。
1、主导/参与面向 Intel/AMD/ARM 新一代服务器平台的虚拟化核心模块研发,完成新硬件特性在 Dragonfly Hypervisor 中的使能与深度优化; 2、设计并实现虚拟化下高性能、轻量级VMM方案,支撑 AI 训练/推理、Agent 沙箱等新型负载的隔离性、性能与启动速度; 3、 研发与优化软硬协同的隔离方案(内存/IO/中断/设备粒度),提升多租户场景下的安全性、确定性与资源保障能力; 4、基于神龙硬件平台,设计并落地加速卸载方案,持续降低虚拟化开销、提升端到端吞吐与延迟; 5、持续演进热迁移/热升级/热插拔技术,在百万级实例规模下保障业务零感知、高成功率、秒级收敛; 6、构建虚拟化可信执行环境(vTPM/TCM 集成、机密计算支持、启动度量与远程证明),打造云上可信基础设施底座; 7、深入客户一线,主导复杂性能瓶颈分析、稳定性根因定位与系统级调优,输出可复用的方法论与工具链; 8、参与下一代 Dragonfly Hypervisor 的架构设计——面向 AI Infra 与 Agent 运行时需求,定义轻量、弹性、可扩展、可观测的新一代虚拟化范式。
1. 建设灵骏集群监管控系统核心能力,不断提升客户在云上使用灵骏智算集群产品的自动化、智能化程度。 2. 建设满足业务场景和数据合规要求的智算集群库存管理体系,结合节点调度、性能分析、故障自动化处理、租户运维功能等核心体系能力,持续提升灵骏智算集群产品竞争力。 3. 建设智算集群和管控系统自身高可用体系,如智算集群健康检测、节点与集群异常快速处置体系、管控组件故障自动定位、自动恢复、自适应容灾、云原生技术实施及落地等,保障业务持续可用、保障线上系统稳定性。 4. 建设异构算力统一管理及资源调度系统,持续智算集群资源利用率、降低计算成本。 5. 持续跟踪AI智算、云原生及智能运维领域新技术,结合业务场景进行创新。 6. 该职位涉及值班响应的职责,在服务级别协议(SLA)时间内做出对客响应,推动客户问题的解决,改善客户体验。
1. 负责AaaS(Agent as s Service)管控平台的架构设计与功能研发工作; 2. 深入调研Agentic AI时代对Infra(基础设施层)的需求,凝练核心能力并提供专业的解决方案,助力内外部AI业务实现快速规模增长,并不断提高用户粘性; 3. 设计并落地高性能、高可用、可伸缩的管控系统架构,应对AI时代下CPU、GPU资源海量的弹性需求,并不断提升系统的容量和稳定性,保障客户业务持续稳定地运行; 4. 利用Agent、Harness框架提升内部系统的研发、运维、诊断效率。
1. 构建 Agent Sandbox 服务的云原生适配层,实现基于 Kubernetes 集群的 Agent Sandbox 的全生命周期管理。 2. 负责虚拟节点(Virtual Node)架构设计和性能优化,解决 超大规模集群下 Serverless 容器与Kubernetes 管控面的状态管理、资源映射和异常自动恢复等技术难题。 3. 优化超大并发下 Kubernetes 控制器/组件的处理能力,降低处理延迟,提升资源利用效率与系统稳定性,应对AI时代下海量弹性需求。 4. 实现控制器/组件全面 Agentic 化,提升研发、运维、问题排查效率。 5. 推动云原生 AI 前沿技术的预研、落地,持续提升阿里云容器产品的竞争力与系统稳定性。
1. 负责各计算集群交付运维工作, 并且参与基础运维平台架构设计和建设; 2. 运维服务体系建设与优化,达成产品稳定性与SLA目标; 3. 制定交付标准, 沉淀运维规范, 通过工具平台提效日常工作; 4 跟进内外部合作伙伴项目, 优化项目流程; 4. 需要具备一定的创新突破和个人自驱力,善于发现问题,思考并解决问题。
- 洞察 Agent Infra 行业的市场机会,分析产品市场容量和竞争格局,分析竞争对手产品的竞争优劣势及市场策略 - 制定并组织 Agent Infra 产品营销传播策略和计划,打造产品品牌和用户心智,提升目标客群对产品的感知,扩大前端流量和商机蓄水池 - 负责Agent Infra(真武PPU、Agent Sandbox等) 相关产品的 GTM 体系化建设,跨产品及方案内容建设 - 开发销售赋能材料,制定并执行销售和渠道培训赋能计划 - 通过用户行为分析、资源使用分析、在线动手实践、线下沙龙等形式,制定商机生产、消费策略并执行 - 运营 Agent Infra 技术社区和开发者平台,策划并组织开发者活动,挖掘用户需求和场景,建立产品的技术影响力和用户心智 - 通过商业化策略设计和渠道效率优化,实现中长尾付费客户规模健康增长;通过产品市场活动、圈层运营,协助头腰部客户商业化增长 - 制定产品业务健康度衡量标准和模型,量化分析支持产品设计、业务策略、产品体验、运营效率等多方面工作 - 监控、发现、推动修复端到端用户体验问题,系统化总结用户体验痛点,参与制定产品改进策略
1. 依据公共云统一架构、OpenAPI规范、软件技术栈以及交付运维体系,负责公共云异构计算产品的研发与交付。深度参与研发流程,确保产品从研发到运维的全生命周期高效管理; 2. 跟踪和了解新的异构计算产品技术和趋势,探索前沿的GPU架构设计与技术,理解业务战略及重点,基于业务需求作出高可用、高可靠、高拓展性的技术架构规划和落地; 3. 联合网络团队共同设计网络互联架构,针对分布式训练和推理业务场景,在软硬件协同及高性能网络方向上寻找性能优化的新途径,构建阿里云加速计算云服务器的核心竞争力; 4. 研发并持续改进系统的稳定性和安全性,制定稳定性策略,寻找并解决产品系统中的潜在风险和瓶颈,覆盖线上疑难杂症问题,提高产品稳定性和性能确保平台的安全可靠运行,并不断提升对外服务质量标准。
1. 负责弹性计算团队重要产研项目的管理工作,确保项目目标达成。 2. 根据组织战略目标的要求,组织相关方进行目标拆解和战役规划,推动核心干系人达成共识。优化资源配置,做好长期目标,短期目标和有限资源之间的统筹与平衡。建立战役组织保障机制,做好战役的执行管理,确保组织战略目标的成功实现。 3.从项目筹备、需求分析、项目规划、过程实施、结果验收、产品发布、运维、业务监控等进行全生命周期管理。有效协调干系人并管理期望值,确保项目有序推进,及时发现并跟踪解决项目问题,有效管理项目风险,协调项目资源,保证目标能够按预期实现落地。 4. 在达成项目目标的同时,通过流程机制建设及可量化可观测的分析,结合产研项目过程的全程跟踪, 能够洞察并改善项目所属产研领域过程中的问题和瓶颈,能够给项目/产研领域一号位提供合理的优化建议;从产品和技术竞争力、业务的发展、从客户问题到产研效率问题等多维度,驱动整个团队提升产出效率。 5.通过过程资产库建设、最佳实践沉淀、项目管理能力赋能等提升团队项目管理能力。
1、作为产品解决方案架构师,深入理解灵骏及异构产品所负责的高性能AI智算集群的技术原理、架构和使用场景,能够根据企业级客户需求和产品能力,规划设计合理的灵骏产品解决方案,推动和实现产品的商业化落地。 2、具备良好的架构思维能力,能够从稳定性、高性能、易用性、可用性、可运维性等方面综合考虑,结合云计算平台产品特点,敏锐捕捉市场趋势,分析竞对产品及市场策略,为产品的设计、实现、改进不断提出建设性的想法和建议,反哺产品能力建设,不断提升灵骏及异构产品的市场竞争力和市场份额。 3、与前线架构师/BTE销售紧密合作,主动了解客户当前在产品方案遇到的困难和需求,帮助客户解决技术问题,寻找新的业务突破点。推广产品方案并能够影响客户的基础设施、工程、算法等不同团队,用产品技术推动业务扩展。 4、分析云计算技术发展趋势/市场竞争格局,挖掘行业数据/客户商机,建立可复制行业解决方案,与产品内部的产品经理、资源及经营团队、研发等团队紧密配合,推动营收增长。
在2022阿里云峰会上,阿里云正式发布了其自主研发的云基础设施处理器CIPU(Cloud infrastructure Procrssing Units),作为一款为新型云数据中心设计的专用处理器,它将在未来取代CPU成为新一代云计算的管控和加速中心。了解CIPU: https://mp.weixin.qq.com/s/VEco9XaX0eQtZy-pAVS6ug 系统设计与研发 • 负责云平台系统CIPU 的存储云化加速 架构设计和优化工作 • 负责CIPU存储云化加速 新技术和方案的研发以及在云产品推广应用的工作 • 基于业务需求和设计方案完成UT用例设计开发,对系统的稳定性负责 • 负责系统设计与研发文档的编写、改进与维护 系统性能优化 • 对软件系统进行性能数据分析,通过软件系统重构,实现软件系统稳定性/性能的提升 • 沉淀、输出相关案例/工具 系统测试与维护 • 负责软件系统的技术支持与运维工作,分析软件系统中可能存在的问题,全局视角分析问题根因,定位并解决问题,保证系统符合性能、稳定性等指标要求 • 负责CIPU存储软件和系统的测试工作,设计、搭建与管理测试平台,通过性能测试,推动产品不断演进迭代 技术规划 • 基于业务需求和技术洞察,制定本领域内的技术团队的中长期发展规划和技术路线图 • 体系性地设计各类配套规划,包括技术人员规划、技术基础设施规划、技术质量规划、技术安全规划等 项目管理 • 确定项目目标和范围,并拟定项目计划、预算和资源需求计划、项目风险评估、交付成果等 • 按项目计划进行落地实施,并对项目进度、数据、质量进行监控,确保项目保质保量实施 • 总结项目经验和教训,反馈项目成果和绩效,为之后的项目管理沉淀经验总结
1. 负责智算集群中GPU资源的全面监控、质量巡检及故障预测,通过智能化运维手段确保系统的高可用性和稳定性,提前识别并解决潜在问题。 2. 保障在线POD的集群资源管理与切分业务,优化资源分配策略,提高资源利用率和任务处理效率,支持大规模分布式计算的需求。 3. 开发和维护KuberGPU技术,实现GPU资源的高效切分与容器化部署,支持多款智算相关产品的多种应用场景,提供灵活且强大的GPU资源共享解决方案。 4. 开发和实施容器热迁移技术,提升集群灵活性和容错能力,确保在不停机的情况下进行系统维护和资源调度,进一步增强用户体验和服务连续性。