职位信息

Stepstar实习-Code Agent算法研究员

北京阶跃星辰智能科技有限公司 发布于2026-07-20

    职位详情

  • 学历要求 本科及以上
  • 工作地点 北京市
  • 招聘人数 2 人
  • 职位要求

    【岗位描述】

    1. 负责代码数据的合成、清洗、权重分配、来源扩充等一系列工作,持续提高代码中程训练、后训练等阶段的数据质量;负责探究预训练小领域数据的配比和最终效果之间的关系;开发数据合成链路,解决代码模型中的关键问题;

    2. 负责探究深度推理技术,探究Test-time Compute和模型效果的Scaling laws,参与后训练奖励模型、强化学习算法的一系列优化流程,探究线上代码补全数据到RL过程的数据飞轮。

    3. 专注于代码强化学习中的奖励模型(Reward Model)的优化和创新;包括和SFT阶段配合解决判别能力较差的场景、探究合成数据进行代码奖励模型的预训练、组织标注人员进行代码奖励模型的标注、Critic的前沿探究、强化学习过程中的可执行代码与单元测试的质量过滤和扩充。

    4. 利用强化学习方法改进智能体的规划、反思、利用工具的能力,强化在code agent实际场景的可用性;

    5. 探索基于人机协同的高质量数据挖掘、合成,以加强智能体的规划和利用工具能力;

    6. 构建code agent的基础能力,包括planning能力、测例、代码生成能力;

    7. 构建多模态智能体,提升多模态大模型RLHF中的训练效果;

    8. 构建code agent智能体自动化评测和docker环境生成。


    【岗位要求】

    1. 国内外计算机、数学、人工智能等相关专业的优秀在校生;

    2. 具备软工背景,具有扎实的计算机科学功底和编程能力,熟悉常见算法和数据结构,具有良好的编程习惯;

    3. 熟悉语言模型的基本技术、模型结构,对AI的未来有信仰和工作热情;

    4. 工作认真细致,计划性强,具有刨根问底的探究精神,对研发工作中有很强的实事求是的落地信念,追求最终效果而不是盲目追求新颖的方法,对工作内容有较强责任感。


    加分项:

    1. 有NOI、ACM竞赛经历者优先;有推荐、搜索领域出色的数据驱动工作者优先;

    2. 熟悉强化学习相关技术和细节,曾深度参与强化学习项目或语言模型项目;

    3. 具有较强的工程能力,能迅速熟悉公司内外部平台工具使用,具有主动提升效率的意识。


扫描分享

扫一扫分享本页