METHODOLOGY
让 Agent 完成实际任务,再按事先约定的规则检查结果。每份报告都说明测试条件和适用范围。
EVALUATION SCOPE
不同能力使用不同任务和评分规则。
换一个会话后,Agent 还能找回之前的信息吗?
研究插件能否找对答案,并完成有依据的报告?
我们先约定测试条件和评分规则,再运行真实任务。每份报告同时说明结果、异常和适用范围,方便读者检查结论的依据。不同测试条件下的结果不直接比较。