【校招】强化学习算法工程师-安全基模中心
上海人工智能实验室 · 安全基模中心
1.负责大模型在AI Coding场景下的强化学习(RL)算法研发与训练,探索并落地PPO、GRPO等主流算法,提升模型在复杂代码生成、长程规划与工具调用任务中的自主推理与执行能力; 2.参与构建端到端的Agentic RL训练链路,结合过程奖励机制(Process Reward)与Critic Model,优化Agent在真实环境中的行为引导、指令跟随与自我反思能力; 3.负责AI Coding相关高质量RL训练数据的挖掘、合成与评测体系设计,针对模型能力短板构建可验证的训练闭环,持续提升模型在前沿Benchmark及真实业务场景中的表现;…