EVALUATION WORKSPACE

选择一个测试集

导入 JSONL 后即可运行 Agent 并查看全过程。

新建评测

Oracle 用于验证环境;OpenAI-compatible 用于测试真实模型。

通过率Pass rate
平均得分Average score
Pass@k至少一次通过
工具调用平均调用次数

评测记录

尚无运行

选择测试集后显示运行记录

Trial 输出

选择一条评测记录

这里会显示模型输出与评分

DATASET

导入测试集

要求每条任务包含唯一 idoutput.target_state

TASKS

测试集任务