DSHEVAL
菜单

DEEP RESEARCH EVALUATION

发布于

深度研究评测报告

研究插件能交出完整报告吗?与 DSH 原生基线对照,分别检查事实答案与长报告交付。

KEY FINDING

7 个插件中,仅 1 个通过了一道报告题

dsh-search-boost 通过了金融报告题,其余报告均为部分完成。本轮为固定小样本,不能概括所有研究任务。

参评范围
7 个插件 + 原生基线
独立题面
4 个
派生诊断
1 个 · 复用报告

研究任务表现

4 个独立题面 · 小样本
DSH 原生基线不安装研究插件找对答案 · 2 题1 题通过完成报告 · 2 题2 题部分完成+

各项任务表现

事实检索通过

不作增量比较

耗时
1.5 分钟
总 Token
1,894
工具 / 搜索调用
22 / 2
可打开 / 已检查链接
18 / 20
引用忠实度

复用上一批已验证的记录。 运行保护:未触发。

多跳检索失败

不作增量比较

耗时
3.2 分钟
总 Token
7,243
工具 / 搜索调用
30 / 13
可打开 / 已检查链接
0 / 0
引用忠实度

本轮重新运行的多跳检索题。 运行保护:搜索次数达到上限。

健康主题报告部分完成

不作增量比较

耗时
17.4 分钟
总 Token
57,588
工具 / 搜索调用
105 / 20
可打开 / 已检查链接
13 / 20
引用忠实度
75.0%

复用上一批已验证的记录。 运行保护:未触发。

金融主题报告部分完成

不作增量比较

耗时
6.4 分钟
总 Token
66,514
工具 / 搜索调用
107 / 17
可打开 / 已检查链接
16 / 20
引用忠实度
50.0%

复用上一批已验证的记录。 运行保护:研究工具调用达到上限。

研究交付诊断复用健康报告,不单独运行通过

不作增量比较

耗时
总 Token
工具 / 搜索调用
0 / 0
可打开 / 已检查链接
0 / 0
引用忠实度
75.0%

复用上一批已验证的记录。 派生诊断的耗时和 Token 不适用。

原生基线的运行指标

原生基线不参与排名,也不与自身计算增量。

每题平均耗时
7.1 分钟
每题平均总 Token
33,310
引用忠实度
66.7%
系统失败率
0.0%

增量与引用忠实度沿用原榜单,包含研究交付诊断;耗时与 Token 均值只统计实际运行的题目,不包含全部已丢弃尝试和评分模型用量。系统失败率仅统计最终保留记录。

dsh-search-boost找对答案 · 2 题2 题通过完成报告 · 2 题1 题通过,1 题部分完成+

各项任务表现

事实检索通过

无明显变化

耗时
4.3 分钟
总 Token
4,116
工具 / 搜索调用
41 / 3
可打开 / 已检查链接
17 / 20
引用忠实度

复用上一批已验证的记录。 运行保护:未触发。

多跳检索通过

优于原生基线

耗时
2.5 分钟
总 Token
7,131
工具 / 搜索调用
23 / 4
可打开 / 已检查链接
10 / 20
引用忠实度

本轮重新运行的多跳检索题。 运行保护:未触发。

健康主题报告部分完成

无明显变化

耗时
5.2 分钟
总 Token
27,238
工具 / 搜索调用
56 / 20
可打开 / 已检查链接
15 / 20
引用忠实度
75.0%

复用上一批已验证的记录。 运行保护:未触发。

金融主题报告通过

优于原生基线

耗时
10.3 分钟
总 Token
99,717
工具 / 搜索调用
61 / 20
可打开 / 已检查链接
19 / 20
引用忠实度
100.0%

复用上一批已验证的记录。 运行保护:未触发。

研究交付诊断复用健康报告,不单独运行通过

无明显变化

耗时
总 Token
工具 / 搜索调用
0 / 0
可打开 / 已检查链接
0 / 0
引用忠实度
75.0%

复用上一批已验证的记录。 派生诊断的耗时和 Token 不适用。

与原生能力相比

2 项更好 / 3 项无明显变化 / 0 项更差

每题平均耗时
5.6 分钟
每题平均总 Token
34,551
引用忠实度
83.3%
系统失败率
0.0%

增量与引用忠实度沿用原榜单,包含研究交付诊断;耗时与 Token 均值只统计实际运行的题目,不包含全部已丢弃尝试和评分模型用量。系统失败率仅统计最终保留记录。

dsh-deep-research找对答案 · 2 题2 题通过完成报告 · 2 题2 题部分完成+

各项任务表现

事实检索通过

无明显变化

耗时
2.5 分钟
总 Token
9,278
工具 / 搜索调用
24 / 5
可打开 / 已检查链接
18 / 20
引用忠实度

复用上一批已验证的记录。 运行保护:未触发。

多跳检索通过

优于原生基线

耗时
2.2 分钟
总 Token
6,971
工具 / 搜索调用
18 / 5
可打开 / 已检查链接
8 / 20
引用忠实度

本轮重新运行的多跳检索题。 运行保护:未触发。

健康主题报告部分完成

无明显变化

耗时
5.8 分钟
总 Token
85,065
工具 / 搜索调用
45 / 20
可打开 / 已检查链接
12 / 20
引用忠实度
75.0%

复用上一批已验证的记录。 运行保护:未触发。

金融主题报告部分完成

优于原生基线

耗时
14.0 分钟
总 Token
87,493
工具 / 搜索调用
92 / 16
可打开 / 已检查链接
13 / 20
引用忠实度
100.0%

复用上一批已验证的记录。 运行保护:未触发。

研究交付诊断复用健康报告,不单独运行通过

无明显变化

耗时
总 Token
工具 / 搜索调用
0 / 0
可打开 / 已检查链接
0 / 0
引用忠实度
75.0%

复用上一批已验证的记录。 派生诊断的耗时和 Token 不适用。

与原生能力相比

2 项更好 / 3 项无明显变化 / 0 项更差

每题平均耗时
6.1 分钟
每题平均总 Token
47,202
引用忠实度
83.3%
系统失败率
0.0%

增量与引用忠实度沿用原榜单,包含研究交付诊断;耗时与 Token 均值只统计实际运行的题目,不包含全部已丢弃尝试和评分模型用量。系统失败率仅统计最终保留记录。

hanai-investment-dsh找对答案 · 2 题2 题通过完成报告 · 2 题2 题部分完成+

各项任务表现

事实检索通过

无明显变化

耗时
1.9 分钟
总 Token
2,040
工具 / 搜索调用
18 / 3
可打开 / 已检查链接
17 / 20
引用忠实度

复用上一批已验证的记录。 运行保护:未触发。

多跳检索通过

优于原生基线

耗时
0.7 分钟
总 Token
6,941
工具 / 搜索调用
7 / 2
可打开 / 已检查链接
10 / 20
引用忠实度

本轮重新运行的多跳检索题。 运行保护:未触发。

健康主题报告部分完成

无明显变化

耗时
6.1 分钟
总 Token
45,094
工具 / 搜索调用
42 / 15
可打开 / 已检查链接
15 / 20
引用忠实度
75.0%

复用上一批已验证的记录。 运行保护:未触发。

金融主题报告部分完成

优于原生基线

耗时
9.0 分钟
总 Token
100,725
工具 / 搜索调用
40 / 19
可打开 / 已检查链接
17 / 20
引用忠实度
75.0%

复用上一批已验证的记录。 运行保护:未触发。

研究交付诊断复用健康报告,不单独运行通过

无明显变化

耗时
总 Token
工具 / 搜索调用
0 / 0
可打开 / 已检查链接
0 / 0
引用忠实度
75.0%

复用上一批已验证的记录。 派生诊断的耗时和 Token 不适用。

与原生能力相比

2 项更好 / 3 项无明显变化 / 0 项更差

每题平均耗时
4.4 分钟
每题平均总 Token
38,700
引用忠实度
75.0%
系统失败率
0.0%

增量与引用忠实度沿用原榜单,包含研究交付诊断;耗时与 Token 均值只统计实际运行的题目,不包含全部已丢弃尝试和评分模型用量。系统失败率仅统计最终保留记录。

dsh-science-workbench找对答案 · 2 题1 题通过完成报告 · 2 题2 题部分完成+

各项任务表现

事实检索通过

无明显变化

耗时
1.5 分钟
总 Token
3,861
工具 / 搜索调用
19 / 3
可打开 / 已检查链接
18 / 20
引用忠实度

复用上一批已验证的记录。 运行保护:未触发。

多跳检索失败

无明显变化

耗时
7.8 分钟
总 Token
8,382
工具 / 搜索调用
54 / 13
可打开 / 已检查链接
0 / 0
引用忠实度

本轮重新运行的多跳检索题。 运行保护:搜索次数达到上限。

健康主题报告部分完成

无明显变化

耗时
10.9 分钟
总 Token
91,218
工具 / 搜索调用
59 / 20
可打开 / 已检查链接
11 / 20
引用忠实度
75.0%

复用上一批已验证的记录。 运行保护:未触发。

金融主题报告部分完成

优于原生基线

耗时
7.0 分钟
总 Token
96,582
工具 / 搜索调用
43 / 18
可打开 / 已检查链接
14 / 20
引用忠实度
75.0%

复用上一批已验证的记录。 运行保护:未触发。

研究交付诊断复用健康报告,不单独运行通过

无明显变化

耗时
总 Token
工具 / 搜索调用
0 / 0
可打开 / 已检查链接
0 / 0
引用忠实度
75.0%

复用上一批已验证的记录。 派生诊断的耗时和 Token 不适用。

与原生能力相比

1 项更好 / 4 项无明显变化 / 0 项更差

每题平均耗时
6.8 分钟
每题平均总 Token
50,011
引用忠实度
75.0%
系统失败率
0.0%

增量与引用忠实度沿用原榜单,包含研究交付诊断;耗时与 Token 均值只统计实际运行的题目,不包含全部已丢弃尝试和评分模型用量。系统失败率仅统计最终保留记录。

dsh-scholar找对答案 · 2 题1 题通过完成报告 · 2 题2 题部分完成+

各项任务表现

事实检索通过

无明显变化

耗时
2.7 分钟
总 Token
9,080
工具 / 搜索调用
27 / 4
可打开 / 已检查链接
18 / 20
引用忠实度

复用上一批已验证的记录。 运行保护:未触发。

多跳检索失败

无明显变化

耗时
90.6 分钟
总 Token
6,729
工具 / 搜索调用
10 / 8
可打开 / 已检查链接
0 / 0
引用忠实度

本轮重新运行的多跳检索题。 运行保护:长时间无进展。

健康主题报告部分完成

无明显变化

耗时
5.3 分钟
总 Token
72,805
工具 / 搜索调用
56 / 20
可打开 / 已检查链接
12 / 20
引用忠实度
75.0%

复用上一批已验证的记录。 运行保护:未触发。

金融主题报告部分完成

优于原生基线

耗时
18.6 分钟
总 Token
89,373
工具 / 搜索调用
69 / 20
可打开 / 已检查链接
15 / 20
引用忠实度
75.0%

复用上一批已验证的记录。 运行保护:未触发。

研究交付诊断复用健康报告,不单独运行通过

无明显变化

耗时
总 Token
工具 / 搜索调用
0 / 0
可打开 / 已检查链接
0 / 0
引用忠实度
75.0%

复用上一批已验证的记录。 派生诊断的耗时和 Token 不适用。

与原生能力相比

1 项更好 / 4 项无明显变化 / 0 项更差

每题平均耗时
29.3 分钟
每题平均总 Token
44,497
引用忠实度
75.0%
系统失败率
0.0%

增量与引用忠实度沿用原榜单,包含研究交付诊断;耗时与 Token 均值只统计实际运行的题目,不包含全部已丢弃尝试和评分模型用量。系统失败率仅统计最终保留记录。

dsh-deepresearch找对答案 · 2 题0 题通过完成报告 · 2 题2 题部分完成+

各项任务表现

事实检索失败

低于原生基线

耗时
3.4 分钟
总 Token
3,127
工具 / 搜索调用
23 / 1
可打开 / 已检查链接
0 / 0
引用忠实度

复用上一批已验证的记录。 运行保护:长时间无进展。

多跳检索失败

无明显变化

耗时
9.4 分钟
总 Token
7,525
工具 / 搜索调用
49 / 13
可打开 / 已检查链接
0 / 0
引用忠实度

本轮重新运行的多跳检索题。 运行保护:搜索次数达到上限。

健康主题报告部分完成

无明显变化

耗时
6.7 分钟
总 Token
61,173
工具 / 搜索调用
80 / 16
可打开 / 已检查链接
12 / 20
引用忠实度
75.0%

复用上一批已验证的记录。 运行保护:未触发。

金融主题报告部分完成

无明显变化

耗时
9.4 分钟
总 Token
96,716
工具 / 搜索调用
102 / 17
可打开 / 已检查链接
12 / 20
引用忠实度
75.0%

复用上一批已验证的记录。 运行保护:研究工具调用达到上限。

研究交付诊断复用健康报告,不单独运行通过

无明显变化

耗时
总 Token
工具 / 搜索调用
0 / 0
可打开 / 已检查链接
0 / 0
引用忠实度
75.0%

复用上一批已验证的记录。 派生诊断的耗时和 Token 不适用。

与原生能力相比

0 项更好 / 4 项无明显变化 / 1 项更差

每题平均耗时
7.2 分钟
每题平均总 Token
42,135
引用忠实度
75.0%
系统失败率
0.0%

增量与引用忠实度沿用原榜单,包含研究交付诊断;耗时与 Token 均值只统计实际运行的题目,不包含全部已丢弃尝试和评分模型用量。系统失败率仅统计最终保留记录。

dsh-science找对答案 · 2 题1 题通过完成报告 · 2 题2 题部分完成+

各项任务表现

事实检索失败

低于原生基线

耗时
2.8 分钟
总 Token
14,442
工具 / 搜索调用
44 / 3
可打开 / 已检查链接
0 / 0
引用忠实度

复用上一批已验证的记录。 运行保护:研究工具调用达到上限。

多跳检索通过

优于原生基线

耗时
1.5 分钟
总 Token
6,804
工具 / 搜索调用
17 / 4
可打开 / 已检查链接
5 / 20
引用忠实度

本轮重新运行的多跳检索题。 运行保护:未触发。

健康主题报告部分完成

无明显变化

耗时
5.0 分钟
总 Token
97,507
工具 / 搜索调用
44 / 21
可打开 / 已检查链接
11 / 20
引用忠实度
75.0%

复用上一批已验证的记录。 运行保护:未触发。

金融主题报告部分完成

无明显变化

耗时
5.4 分钟
总 Token
118,696
工具 / 搜索调用
118 / 25
可打开 / 已检查链接
14 / 20
引用忠实度
50.0%

复用上一批已验证的记录。 运行保护:搜索次数达到上限。

研究交付诊断复用健康报告,不单独运行通过

无明显变化

耗时
总 Token
工具 / 搜索调用
0 / 0
可打开 / 已检查链接
0 / 0
引用忠实度
75.0%

复用上一批已验证的记录。 派生诊断的耗时和 Token 不适用。

与原生能力相比

1 项更好 / 3 项无明显变化 / 1 项更差

每题平均耗时
3.7 分钟
每题平均总 Token
59,362
引用忠实度
66.7%
系统失败率
0.0%

增量与引用忠实度沿用原榜单,包含研究交付诊断;耗时与 Token 均值只统计实际运行的题目,不包含全部已丢弃尝试和评分模型用量。系统失败率仅统计最终保留记录。

部分完成表示仍有缺项,未达到通过标准。点击插件可展开任务和运行指标;插件顺序沿用本轮榜单。

已完成测试

脱敏结果与评测代码已公开,可复算排名。关键结果尚待独立环境复测。

样本与范围

4 个独立题面、1 个派生诊断;私有答案与报告正文未公开,不能据此概括所有研究任务。

评测与验证说明

测试方法、证据与适用范围
TEST DESIGN

本次测试怎样执行

参评范围
原生基线不安装插件,7 个参评条件各安装一个插件。另一个候选插件因缺少所需凭证被排除,不计零分、不进入榜单。
事实检索与多跳检索
使用私有金标与确定性规则,核对答案及实际检索行为。题面和答案不公开。
健康主题报告与金融主题报告
采用公开健康、金融主题任务,结合交付物检查、链接检查与固定模型评分。部分完成表示仍有缺项或未达到通过门槛。
研究交付诊断
复用健康主题报告,评估是否形成研究交付,不再调用模型。不能把它当作额外独立样本。
RANKING & LIMITS

如何理解名次

沿用本轮评测的排序:准入 → 编造 → 长文通过与部分完成数 → 引用忠实度 → 短事实通过数 → 恢复 → 负增量 → 耗时。没有合成加权总分,原生基线不参与插件排名。

内部批次:V12,用于对应下载数据与历史记录,不是插件版本或题目数量。本轮统一补跑多跳检索题,其余复用上一批(V11)已验证的记录。发布日期不等于全部任务的运行日期。本轮只覆盖 4 个独立题面,不能推断插件在所有研究任务上的普遍优劣,也不代表上游基准的完整官方榜单。

系统失败率仅反映最终保留记录。过程日志中的错误、重试、人工介入计数是文本规则命中次数,可能重复或误命中;不能据此宣称整轮没有故障。

PUBLIC EVIDENCE

能复核到哪一步

脱敏记录保留数值与状态,移除私有题面、金标、模型回答、完整 URL、日志正文和本机路径。可以复算榜单、核对文件完整性,不能据此重新核验私有答案、引用忠实度或完整运行轨迹。

长文分数来自本地评分模型,不是上游官方评分;引用可打开也不等于它支持报告中的结论。

公开材料

下载数据,查看评测实现。

结果数据(JSON) 评测代码
离线报告与补充材料
离线榜单(HTML) 过程监测报告(HTML)