Agentic Coding 评测算法实习生

混元基础模型部 · 评测团队
日常实习 / 青云实习|北京 / 深圳|2028 年及以后毕业|每周到岗 4 天及以上

团队介绍

我们是混元基础模型部的评测团队,负责混元主线模型 Agentic Coding 能力的生产评测,其结论是模型迭代的重要依据。在现有体系的基础上,我们希望进一步构建更贴近真实使用、更能反映实际生产力的自动化评测。

岗位职责

  1. 发现并构建评测任务:从真实需求出发,识别需要借助编程完成的高价值任务,设计相应的数据管线,将其构建为长程、端到端的交付任务,确保贴近真实使用分布、可复现、可判定,并随模型能力的演进持续维护与更新。
  2. 评估交付能力:重点评估模型能否以编程为手段,根据用户需求独立交付可用成果,并综合考察交付质量、使用体验与成本,使评测结论与真实使用效果保持一致。
  3. 探索评测范式:针对开放式、长程的 Agentic Coding 任务,与团队共同探索自动评估交付质量与使用体验的方法,并验证其可靠性,确保判分准确、结果稳定且难以被投机绕过;同时研究如何降低评测成本。
  4. 分析与反馈:建立区分模型本身与 Harness、环境等因素影响的分析方法,对模型表现进行归因,形成可指导训练的结论。

岗位要求

  1. 计算机、软件工程、人工智能等相关专业本科及以上在读,2028 年及以后毕业;每周到岗 4 天及以上,可连续实习 6 个月以上者优先;
  2. 具备出色的编程能力,熟练掌握 Python,能够独立设计并实现复杂的数据管线与评测系统;熟悉 Docker 与 Linux,能够搭建运行环境并复现问题;
  3. 深度使用 Claude Code、Codex 等主流 Coding Agent,对其优势与不足有独立的观察,能够准确评估模型产出的质量,并将判断提炼为清晰的评测标准;
  4. 能主动发现问题并推动解决;对自己的产出有很高的质量标准,愿意在数据与细节上投入精力;乐于听取不同意见。

加分项

你将获得

投递方式