跨会话记忆评测报告
换一个会话,Agent 还记得吗?用同一组题,对比不提醒与明确提醒使用记忆时的表现。
KEY FINDING
明确提示后,7 个 Agent 的正确率均提升
正确率提升 10–60 个百分点。结果仅适用于本轮题集与环境,部分 Agent 共享核心实现。
- 参评 Agent
- 7 个
- 每轨题目
- 20 道
- 提示方式
- 无提示 / 有提示
RESULTS
记忆表现对比
Causal Memory无提示65%有提示75%
dsh-mnemon无提示45%有提示55%
dsh-noema无提示30%有提示70%
Mnemon(官方版)*无提示30%有提示40%
Graph Memory无提示20%有提示75%
Memory Evolve无提示10%有提示35%
dsh-memento无提示5%有提示65%
* Mnemon(官方版)来自 Mnemon 官方仓库,与 dsh-mnemon 共享核心实现,不代表完全独立的两种方案。
已完成测试
0 次评测故障,结果数据与评测代码已公开。关键结果尚待独立环境复测。
样本与范围
同一组 20 道题、两种提示方式;结果仅适用于本轮环境,部分 Agent 共享核心实现。
评测与验证说明
测试方法、证据与适用范围+
评测与验证说明
测试方法、证据与适用范围本次测试怎样执行
两组使用同一组 20 道题、同一模型和运行环境,只改变是否提醒 Agent 使用记忆。
- 无提示
- 直接提供对话和问题,不要求保存或检索记忆。
- 有提示
- 只增加通用记忆提示,不透露工具名、答案或历史会话 ID。
- 清理环境
清除上一题留下的文件与会话。
- 会话 A · 提供信息
提供相同的原始对话,两组仅在记忆提示上不同。
- 关闭并重启
正常关闭 DSH,等待记忆写入后重新启动。
- 会话 B · 提问
在新会话中提出同一道题。
- 按标准答案评分
核对标准答案和必需信息,不使用 LLM 评分。
结果如何复查
- 固定测试条件
- Agent 版本、运行环境、题集和评分规则,都在测试开始前锁定。
- 执行并记录
- 让 Agent 完成真实任务,保留操作过程、状态变化和最终输出。
- 复查并评分
- 按照预先公开的规则核对完整记录,再计算测试结果。
- 公开可复查
- 发布得分、限制和复查材料;证据不足则明确标记“无法评测”。
当前验证到哪一步
本次为 Level 03。
关键结果尚待独立环境复测。
- Level 01
已收录
身份、版本和基本信息已经登记。
- Level 02
可运行
已经在标准 DSH 运行环境中成功调用。
- Level 03
已完成测试
本次等级已经按统一方案完成测试,并生成完整记录。
- Level 04
已提交自测
开发者已经提交注明测试环境、可复现的自测结果。
- Level 05
已独立复测
关键结果已经在独立环境中复测确认。
证据不足缺少关键记录时标记“无法评测”,不把它当作零分。
安全边界评测通过不等于可以安全使用;权限与高风险操作需单独检查。