职位信息
Stepstar实习-Code Agent算法研究员
北京阶跃星辰智能科技有限公司 发布于2026-07-20
- 学历要求 本科及以上
- 工作地点 北京市
- 招聘人数 2 人
-
职位要求
【岗位描述】
1. 负责代码数据的合成、清洗、权重分配、来源扩充等一系列工作,持续提高代码中程训练、后训练等阶段的数据质量;负责探究预训练小领域数据的配比和最终效果之间的关系;开发数据合成链路,解决代码模型中的关键问题;
2. 负责探究深度推理技术,探究Test-time Compute和模型效果的Scaling laws,参与后训练奖励模型、强化学习算法的一系列优化流程,探究线上代码补全数据到RL过程的数据飞轮。
3. 专注于代码强化学习中的奖励模型(Reward Model)的优化和创新;包括和SFT阶段配合解决判别能力较差的场景、探究合成数据进行代码奖励模型的预训练、组织标注人员进行代码奖励模型的标注、Critic的前沿探究、强化学习过程中的可执行代码与单元测试的质量过滤和扩充。
4. 利用强化学习方法改进智能体的规划、反思、利用工具的能力,强化在code agent实际场景的可用性;
5. 探索基于人机协同的高质量数据挖掘、合成,以加强智能体的规划和利用工具能力;
6. 构建code agent的基础能力,包括planning能力、测例、代码生成能力;
7. 构建多模态智能体,提升多模态大模型RLHF中的训练效果;
8. 构建code agent智能体自动化评测和docker环境生成。
【岗位要求】
1. 国内外计算机、数学、人工智能等相关专业的优秀在校生;
2. 具备软工背景,具有扎实的计算机科学功底和编程能力,熟悉常见算法和数据结构,具有良好的编程习惯;
3. 熟悉语言模型的基本技术、模型结构,对AI的未来有信仰和工作热情;
4. 工作认真细致,计划性强,具有刨根问底的探究精神,对研发工作中有很强的实事求是的落地信念,追求最终效果而不是盲目追求新颖的方法,对工作内容有较强责任感。
加分项:
1. 有NOI、ACM竞赛经历者优先;有推荐、搜索领域出色的数据驱动工作者优先;
2. 熟悉强化学习相关技术和细节,曾深度参与强化学习项目或语言模型项目;
3. 具有较强的工程能力,能迅速熟悉公司内外部平台工具使用,具有主动提升效率的意识。
职位详情
扫一扫分享本页
