换一个会话后,Agent 能否找回之前的信息?
7 / 7
明确提示后得分上升
- 每种模式
- 20 题
- 任务记录
- 280 条
同一组题、同一环境,只改变是否明确提示 Agent 使用记忆。
- 无提示最佳
- Causal Memory · 13/20
- 有提示最佳
- Causal / Graph · 15/20
- 评测故障
- 0 次
DSHEval · Agent Benchmark
把 Agent 放进固定环境,完成真实任务。过程、状态和输出一起公开,让结果可以复查,也可以复现。
换一个会话后,Agent 能否找回之前的信息?
明确提示后得分上升
同一组题、同一环境,只改变是否明确提示 Agent 使用记忆。
MEMORY BENCHMARK / 2026-08-28
同一批 Agent 完成同一组 20 道题,对比用户不提醒和明确提醒使用记忆两种情况。
结论7/7 个 Agent 提示后得分上升;无提示表现差距明显。
* Mnemon(官方版)来自 Mnemon 官方仓库,与 dsh-mnemon 共享核心实现,不代表完全独立的两种方案。
PROTOCOL / CURRENT BENCHMARK
两组测试使用同一组 20 道题、同一模型和运行环境;提示不会透露工具名、答案或历史会话 ID。
直接提供原始对话和问题,不要求保存或检索记忆。
只增加通用记忆提示,不改变题目、答案和评分方式。
清空两个测试工作区,删除上一题留下的文件和会话。
发送 LoCoMo 原始对话;两种模式只有附加提示不同。
正常关闭 DSH,等待数据写入后重新启动。
删除会话 A 的工作区文件,在新会话提出同一道题。
只看答案和必需信息,不使用 LLM 评分。
RESULT / VERIFICATION
Agent 版本、运行环境、题集和评分规则,都在测试开始前锁定。
让 Agent 完成真实任务,保留操作过程、状态变化和最终输出。
按照预先公开的规则核对完整记录,再计算测试结果。
发布得分、限制和复查材料;证据不足则明确标记“无法评测”。
身份、版本和基本信息已经登记。
已经在标准 DSH 运行环境中成功调用。
已经按统一方案完成测试,并生成完整记录。
开发者已经提交注明测试环境、可复现的自测结果。
关键结果已经在独立环境中复测确认。
证据不足 缺少关键记录时标记“无法评测”,不把它当作零分。
安全边界 评测通过不等于可以安全使用;权限与高风险操作需单独检查。
CANDIDATES / NEXT
Top100 反映关注度,不代表能力排名。入选 Agent 仍需在统一环境和规则下完成测试。