Epoch AI 与 METR 公开 MirrorCode 基准测试,目标是检验 AI 模型能不能在拿不到原始源代码的情况下,重新实现一个完整程序。它不看模型补全几行函数,而是把整个软件当成任务,要求 AI 从行为层面复刻功能。
MirrorCode 共覆盖 25 个目标程序,涉及 Unix 工具、数据序列化与查询工具、生物信息学、解释器、静态分析、密码学和压缩等方向。由于原始代码不可见,模型需要通过外部行为判断实现是否正确,这比单点代码生成更接近真实工程里的重写任务。
已公开的一个典型案例是 Claude Opus 4.7 重写 gotree。gotree 是一个约 16000 行 Go 代码、包含 40 多个命令的生物信息学工具包。MirrorCode 给出的数据显示,Claude Opus 4.7 完成一次实现耗时 14 小时,成本 251 美元;如果由人类工程师在没有 AI 辅助的情况下完成同一任务,预计需要 2 到 17 周。
这次实现没有拿到满分。最佳 AI 版本通过了 2001 个测试中的 2000 个,但一个边缘用例失败,因此没有严格达到 100% 完成度。这个结果说明,AI 已经能处理规模不小的工程项目,但边界条件、异常输入和少见路径仍会暴露问题。
MirrorCode 还展示了更长周期的任务。其中一个最大任务单次运行成本达到 2600 美元,AI 连续工作 19 天,且没有人工干预。这类数据把讨论从模型会不会写代码,拉到模型能不能长时间维持工程状态,包括理解需求、保持结构一致、持续修复错误。
项目方目前开放了 22 个目标程序,对应 132 个任务实例,其余 3 个目标保留为私有测试集。这部分未公开题目可以给后续模型对比保留独立样本,也让 MirrorCode 不完全依赖可被外部复现和训练的公开数据。




