DSHEval · Agent Benchmark

测 Agent,
看真实表现。

把 Agent 放进固定环境,完成真实任务。过程、状态和输出一起公开,让结果可以复查,也可以复现。

本期发现7/7 个 Agent 在被明确提醒使用记忆后,得分上升。
RUN #260829–021LEVEL 03 · 已完成测试
最新评测 · 跨会话记忆

换一个会话后,Agent 能否找回之前的信息?

关键结果

7 / 7

明确提示后得分上升

每种模式
20
任务记录
280

同一组题、同一环境,只改变是否明确提示 Agent 使用记忆。

无提示最佳
Causal Memory · 13/20
有提示最佳
Causal / Graph · 15/20
评测故障
0

换一个会话,Agent 还记得吗?

同一批 Agent 完成同一组 20 道题,对比用户不提醒和明确提醒使用记忆两种情况。

结论7/7 个 Agent 提示后得分上升;无提示表现差距明显。

正确率答案必须命中标准答案,或包含全部必需信息;越高越好。
Causal Memory65% / 75%
dsh-mnemon45% / 55%
dsh-noema30% / 70%
Mnemon(官方版)*30% / 40%
Graph Memory20% / 75%
Memory Evolve10% / 35%
dsh-memento5% / 65%
无提示有提示数值越高越好

* Mnemon(官方版)来自 Mnemon 官方仓库,与 dsh-mnemon 共享核心实现,不代表完全独立的两种方案。

PROTOCOL / CURRENT TEST查看本次测试如何执行

唯一变量:是否提醒 Agent 使用记忆。

两组测试使用同一组 20 道题、同一模型和运行环境;提示不会透露工具名、答案或历史会话 ID。

01 / 无提示观察默认表现

直接提供原始对话和问题,不要求保存或检索记忆。

02 / 有提示观察提醒后的表现

只增加通用记忆提示,不改变题目、答案和评分方式。

01清理测试环境

清空两个测试工作区,删除上一题留下的文件和会话。

02会话 A:提供信息

发送 LoCoMo 原始对话;两种模式只有附加提示不同。

03重启环境

正常关闭 DSH,等待数据写入后重新启动。

04会话 B:提出问题

删除会话 A 的工作区文件,在新会话提出同一道题。

05按标准答案评分

只看答案和必需信息,不使用 LLM 评分。

结果可复查,
尚待独立复测。

证据等级
03已完成测试
运行状态
0次评测故障
公开材料
2结果数据 · 评测代码
METHOD / 01—04查看四步评测流程
从固定条件到公开结果
METHOD / 01—04

一份结果,四次确认。

  1. 01
    固定测试条件

    Agent 版本、运行环境、题集和评分规则,都在测试开始前锁定。

  2. 02
    执行并记录

    让 Agent 完成真实任务,保留操作过程、状态变化和最终输出。

  3. 03
    复查并评分

    按照预先公开的规则核对完整记录,再计算测试结果。

  4. 04
    公开可复查

    发布得分、限制和复查材料;证据不足则明确标记“无法评测”。

LEVELS / 01—05查看五级验证标准
当前结果位于 Level 03
VERIFICATION LEVELS

证据走到哪一步,结果就标到哪一级。

  1. 01
    REGISTERED已收录

    身份、版本和基本信息已经登记。

  2. 02
    RUNNABLE可运行

    已经在标准 DSH 运行环境中成功调用。

  3. 03
    EVALUATED已完成测试

    已经按统一方案完成测试,并生成完整记录。

  4. 04
    SELF-TESTED已提交自测

    开发者已经提交注明测试环境、可复现的自测结果。

  5. 05
    VERIFIED已独立复测

    关键结果已经在独立环境中复测确认。

证据不足 缺少关键记录时标记“无法评测”,不把它当作零分。

安全边界 评测通过不等于可以安全使用;权限与高风险操作需单独检查。

想看更多 Agent?

Top100 反映关注度,不代表能力排名。入选 Agent 仍需在统一环境和规则下完成测试。