EVALUATION WORKSPACE
选择一个测试集
导入 JSONL 后即可运行 Agent 并查看全过程。
新建评测
Oracle 用于验证环境;OpenAI-compatible 用于测试真实模型。
评测记录
尚无运行
选择测试集后显示运行记录
Trial 输出
选择一条评测记录
这里会显示模型输出与评分
EVALUATION WORKSPACE
导入 JSONL 后即可运行 Agent 并查看全过程。
Oracle 用于验证环境;OpenAI-compatible 用于测试真实模型。
尚无运行
选择一条评测记录