AI算法安全专家
发布时间:
岗位职责
1.主导金融场景下大模型安全对齐的工程化方案设计与迭代。深入优化RLHF/DPO在垂域模型中的训练效率与对齐效果,构建覆盖输入过滤、意图识别、输出审查的多层级护栏系统,确保模型拒答率与误伤率在千万级日调用下达到金融级平衡点。
2.跟进多模态大模型(图文/音视频)在远程面审、双录质检场景的落地节奏,提前储备并落地低成本、低延迟的多模态安全检测能力。研究方向包括Deepfake检测、跨模态一致性校验、视觉对抗样本防御等,确保多模态攻击面在金融场景中得到有效管控。
3.建立AI安全内部评测标准体系。设计覆盖"诈骗诱导、隐私泄露、合规红线、业务逻辑绕行"等金融特有维度的安全测试集,并推动评测流程嵌入模型发布门禁
4.主导构建面向金融黑灰产的自动化红队评测平台。不仅要自己编写越狱及提示注入的自动化攻击脚本,更要设计一套持续对抗训练Pipeline,让防御模型在与红队的"左右互搏"中自动进化,有效抵御针对金融场景的定制化诱导攻击
5.攻克大模型安全领域在工程化中的痛点,如大模型推理下安全检测的毫秒级延迟要求、护栏系统在高并发场景下的稳定性等。
任职要求
1.深入理解大模型原理(Transformer、MoE、SFT、RLHF/DPO),有实际垂域模型(>10B参数)微调与对齐经验,能独立解决训练中的Loss震荡、模型崩溃等问题;对大模型安全对齐、越狱攻防、内容安全、Agent安全中的至少两个方向有系统性实战经验。
2. 对LLM攻击手法有系统性的实战认知。能构造绕过主流安全护栏的Prompt,深刻理解黑灰产在金融场景下的攻击动机与链路,具备以攻击者视角设计防御的思维习惯。
3. 熟练使用Python/Java,熟悉高性能服务框架,能独立将PyTorch模型封装为高并发、低延迟的在线服务,并有实际压测与性能调优经验;熟悉分布式训练框架,了解模型量化、蒸馏等推理优化技术。
4. 有设计复杂安全系统的经验,能在高并发、强一致性要求的金融环境中,权衡"安全强度"与"用户体验",拿出切实可行的落地方案(而非纯学术方案)。
5. 善于利用AI智能体将团队研发效能提升30%以上,并有推动团队AI化转型的实际经验。
6. 能与算法平台组、SRE、业务风控团队高效协同,将安全需求转化为通用的平台能力。