Agentic Coding 评测算法实习生
混元基础模型部 · 评测团队
日常实习 / 青云实习|北京 / 深圳|2028 年及以后毕业|每周到岗 4 天及以上
团队介绍
我们是混元基础模型部的评测团队,负责混元主线模型 Agentic Coding 能力的生产评测,其结论是模型迭代的重要依据。在现有体系的基础上,我们希望进一步构建更贴近真实使用、更能反映实际生产力的自动化评测。
岗位职责
- 发现并构建评测任务:从真实需求出发,识别需要借助编程完成的高价值任务,设计相应的数据管线,将其构建为长程、端到端的交付任务,确保贴近真实使用分布、可复现、可判定,并随模型能力的演进持续维护与更新。
- 评估交付能力:重点评估模型能否以编程为手段,根据用户需求独立交付可用成果,并综合考察交付质量、使用体验与成本,使评测结论与真实使用效果保持一致。
- 探索评测范式:针对开放式、长程的 Agentic Coding 任务,与团队共同探索自动评估交付质量与使用体验的方法,并验证其可靠性,确保判分准确、结果稳定且难以被投机绕过;同时研究如何降低评测成本。
- 分析与反馈:建立区分模型本身与 Harness、环境等因素影响的分析方法,对模型表现进行归因,形成可指导训练的结论。
岗位要求
- 计算机、软件工程、人工智能等相关专业本科及以上在读,2028 年及以后毕业;每周到岗 4 天及以上,可连续实习 6 个月以上者优先;
- 具备出色的编程能力,熟练掌握 Python,能够独立设计并实现复杂的数据管线与评测系统;熟悉 Docker 与 Linux,能够搭建运行环境并复现问题;
- 深度使用 Claude Code、Codex 等主流 Coding Agent,对其优势与不足有独立的观察,能够准确评估模型产出的质量,并将判断提炼为清晰的评测标准;
- 能主动发现问题并推动解决;对自己的产出有很高的质量标准,愿意在数据与细节上投入精力;乐于听取不同意见。
加分项
- 有大模型后训练数据(如 SFT 数据、RL 任务与环境)或评测数据的合成经验,并了解数据质量的把控方法;所合成数据曾实际应用于模型训练或正式评测者更佳;
- 具有代码模型评测、Coding Agent、LLM-as-a-Judge 或奖励模型相关经验,或发表过评测相关论文、参与过 Benchmark 建设;
- 深入理解主流 Agentic Coding 评测的设计取舍与局限;
- 有开源项目贡献、独立开发过拥有真实用户的产品,或在软件开发以外的领域借助 Coding Agent 完成过完整作品。
你将获得
- 参与新评测体系的建设,与模型训练团队紧密协作,成果直接服务于混元主线模型的迭代;
- 实习期间提供充足的 Coding Agent 使用额度、模型 API 资源以及大规模沙箱环境;
- 可依托腾讯内部丰富的研发与业务需求,以及 CodeBuddy、WorkBuddy 等产品的落地场景,发现并构建评测任务;
- 团队鼓励并支持将有价值的工作成果以论文或技术报告的形式对外发布。
投递方式
- 简历投递:chendige@tencent.com
- 邮件标题:
姓名-学校-年级-每周可到岗天数-可实习时长 - 附加材料:欢迎附上 GitHub 主页或代表性项目链接