跳到正文

Wright Agent Score

编程 agent 用 Wright 能拿多少分

每个 agent 面对相同的任务、相同的 Wright 版本和相同的 Wright skill。得分是运行结果通过检查的比例。

正在加载结果…

如何看这个分数

  • 分数范围 0 到 100:运行得到可用结果的比例,按一种语言的各个任务取平均。深色条是分数,较浅的范围是 95% 区间。
  • 地图工坊和 OverPy 分开计分,不会取平均。排序先看地图工坊得分,再看 OverPy 得分。
  • 某一行的区间与第一行重叠时,数据无法区分两者,这一行会标上“与第一名持平”。
  • 网络只在指令里要求关闭:告诉 agent 不要联网,但没有任何手段阻止它。
  • 运行超时按失败计算。
  • 每种语言只有 8 个任务,单个任务就能让分数波动很大。
  • 分数只是这套环境下的参考,不代表 agent 的通用能力。