深度研究评测报告
研究插件能交出完整报告吗?与 DSH 原生基线对照,分别检查事实答案与长报告交付。
KEY FINDING
7 个插件中,仅 1 个通过了一道报告题
dsh-search-boost 通过了金融报告题,其余报告均为部分完成。本轮为固定小样本,不能概括所有研究任务。
- 参评范围
- 7 个插件 + 原生基线
- 独立题面
- 4 个
- 派生诊断
- 1 个 · 复用报告
RESULTS
研究任务表现
DSH 原生基线不安装研究插件找对答案 · 2 题1 题通过完成报告 · 2 题2 题部分完成
各项任务表现
事实检索通过
不作增量比较
- 耗时
- 1.5 分钟
- 总 Token
- 1,894
- 工具 / 搜索调用
- 22 / 2
- 可打开 / 已检查链接
- 18 / 20
- 引用忠实度
- —
复用上一批已验证的记录。 运行保护:未触发。
多跳检索失败
不作增量比较
- 耗时
- 3.2 分钟
- 总 Token
- 7,243
- 工具 / 搜索调用
- 30 / 13
- 可打开 / 已检查链接
- 0 / 0
- 引用忠实度
- —
本轮重新运行的多跳检索题。 运行保护:搜索次数达到上限。
健康主题报告部分完成
不作增量比较
- 耗时
- 17.4 分钟
- 总 Token
- 57,588
- 工具 / 搜索调用
- 105 / 20
- 可打开 / 已检查链接
- 13 / 20
- 引用忠实度
- 75.0%
复用上一批已验证的记录。 运行保护:未触发。
金融主题报告部分完成
不作增量比较
- 耗时
- 6.4 分钟
- 总 Token
- 66,514
- 工具 / 搜索调用
- 107 / 17
- 可打开 / 已检查链接
- 16 / 20
- 引用忠实度
- 50.0%
复用上一批已验证的记录。 运行保护:研究工具调用达到上限。
研究交付诊断复用健康报告,不单独运行通过
不作增量比较
- 耗时
- —
- 总 Token
- —
- 工具 / 搜索调用
- 0 / 0
- 可打开 / 已检查链接
- 0 / 0
- 引用忠实度
- 75.0%
复用上一批已验证的记录。 派生诊断的耗时和 Token 不适用。
原生基线的运行指标
原生基线不参与排名,也不与自身计算增量。
- 每题平均耗时
- 7.1 分钟
- 每题平均总 Token
- 33,310
- 引用忠实度
- 66.7%
- 系统失败率
- 0.0%
增量与引用忠实度沿用原榜单,包含研究交付诊断;耗时与 Token 均值只统计实际运行的题目,不包含全部已丢弃尝试和评分模型用量。系统失败率仅统计最终保留记录。
dsh-search-boost找对答案 · 2 题2 题通过完成报告 · 2 题1 题通过,1 题部分完成
各项任务表现
事实检索通过
无明显变化
- 耗时
- 4.3 分钟
- 总 Token
- 4,116
- 工具 / 搜索调用
- 41 / 3
- 可打开 / 已检查链接
- 17 / 20
- 引用忠实度
- —
复用上一批已验证的记录。 运行保护:未触发。
多跳检索通过
优于原生基线
- 耗时
- 2.5 分钟
- 总 Token
- 7,131
- 工具 / 搜索调用
- 23 / 4
- 可打开 / 已检查链接
- 10 / 20
- 引用忠实度
- —
本轮重新运行的多跳检索题。 运行保护:未触发。
健康主题报告部分完成
无明显变化
- 耗时
- 5.2 分钟
- 总 Token
- 27,238
- 工具 / 搜索调用
- 56 / 20
- 可打开 / 已检查链接
- 15 / 20
- 引用忠实度
- 75.0%
复用上一批已验证的记录。 运行保护:未触发。
金融主题报告通过
优于原生基线
- 耗时
- 10.3 分钟
- 总 Token
- 99,717
- 工具 / 搜索调用
- 61 / 20
- 可打开 / 已检查链接
- 19 / 20
- 引用忠实度
- 100.0%
复用上一批已验证的记录。 运行保护:未触发。
研究交付诊断复用健康报告,不单独运行通过
无明显变化
- 耗时
- —
- 总 Token
- —
- 工具 / 搜索调用
- 0 / 0
- 可打开 / 已检查链接
- 0 / 0
- 引用忠实度
- 75.0%
复用上一批已验证的记录。 派生诊断的耗时和 Token 不适用。
与原生能力相比
2 项更好 / 3 项无明显变化 / 0 项更差
- 每题平均耗时
- 5.6 分钟
- 每题平均总 Token
- 34,551
- 引用忠实度
- 83.3%
- 系统失败率
- 0.0%
增量与引用忠实度沿用原榜单,包含研究交付诊断;耗时与 Token 均值只统计实际运行的题目,不包含全部已丢弃尝试和评分模型用量。系统失败率仅统计最终保留记录。
dsh-deep-research找对答案 · 2 题2 题通过完成报告 · 2 题2 题部分完成
各项任务表现
事实检索通过
无明显变化
- 耗时
- 2.5 分钟
- 总 Token
- 9,278
- 工具 / 搜索调用
- 24 / 5
- 可打开 / 已检查链接
- 18 / 20
- 引用忠实度
- —
复用上一批已验证的记录。 运行保护:未触发。
多跳检索通过
优于原生基线
- 耗时
- 2.2 分钟
- 总 Token
- 6,971
- 工具 / 搜索调用
- 18 / 5
- 可打开 / 已检查链接
- 8 / 20
- 引用忠实度
- —
本轮重新运行的多跳检索题。 运行保护:未触发。
健康主题报告部分完成
无明显变化
- 耗时
- 5.8 分钟
- 总 Token
- 85,065
- 工具 / 搜索调用
- 45 / 20
- 可打开 / 已检查链接
- 12 / 20
- 引用忠实度
- 75.0%
复用上一批已验证的记录。 运行保护:未触发。
金融主题报告部分完成
优于原生基线
- 耗时
- 14.0 分钟
- 总 Token
- 87,493
- 工具 / 搜索调用
- 92 / 16
- 可打开 / 已检查链接
- 13 / 20
- 引用忠实度
- 100.0%
复用上一批已验证的记录。 运行保护:未触发。
研究交付诊断复用健康报告,不单独运行通过
无明显变化
- 耗时
- —
- 总 Token
- —
- 工具 / 搜索调用
- 0 / 0
- 可打开 / 已检查链接
- 0 / 0
- 引用忠实度
- 75.0%
复用上一批已验证的记录。 派生诊断的耗时和 Token 不适用。
与原生能力相比
2 项更好 / 3 项无明显变化 / 0 项更差
- 每题平均耗时
- 6.1 分钟
- 每题平均总 Token
- 47,202
- 引用忠实度
- 83.3%
- 系统失败率
- 0.0%
增量与引用忠实度沿用原榜单,包含研究交付诊断;耗时与 Token 均值只统计实际运行的题目,不包含全部已丢弃尝试和评分模型用量。系统失败率仅统计最终保留记录。
hanai-investment-dsh找对答案 · 2 题2 题通过完成报告 · 2 题2 题部分完成
各项任务表现
事实检索通过
无明显变化
- 耗时
- 1.9 分钟
- 总 Token
- 2,040
- 工具 / 搜索调用
- 18 / 3
- 可打开 / 已检查链接
- 17 / 20
- 引用忠实度
- —
复用上一批已验证的记录。 运行保护:未触发。
多跳检索通过
优于原生基线
- 耗时
- 0.7 分钟
- 总 Token
- 6,941
- 工具 / 搜索调用
- 7 / 2
- 可打开 / 已检查链接
- 10 / 20
- 引用忠实度
- —
本轮重新运行的多跳检索题。 运行保护:未触发。
健康主题报告部分完成
无明显变化
- 耗时
- 6.1 分钟
- 总 Token
- 45,094
- 工具 / 搜索调用
- 42 / 15
- 可打开 / 已检查链接
- 15 / 20
- 引用忠实度
- 75.0%
复用上一批已验证的记录。 运行保护:未触发。
金融主题报告部分完成
优于原生基线
- 耗时
- 9.0 分钟
- 总 Token
- 100,725
- 工具 / 搜索调用
- 40 / 19
- 可打开 / 已检查链接
- 17 / 20
- 引用忠实度
- 75.0%
复用上一批已验证的记录。 运行保护:未触发。
研究交付诊断复用健康报告,不单独运行通过
无明显变化
- 耗时
- —
- 总 Token
- —
- 工具 / 搜索调用
- 0 / 0
- 可打开 / 已检查链接
- 0 / 0
- 引用忠实度
- 75.0%
复用上一批已验证的记录。 派生诊断的耗时和 Token 不适用。
与原生能力相比
2 项更好 / 3 项无明显变化 / 0 项更差
- 每题平均耗时
- 4.4 分钟
- 每题平均总 Token
- 38,700
- 引用忠实度
- 75.0%
- 系统失败率
- 0.0%
增量与引用忠实度沿用原榜单,包含研究交付诊断;耗时与 Token 均值只统计实际运行的题目,不包含全部已丢弃尝试和评分模型用量。系统失败率仅统计最终保留记录。
dsh-science-workbench找对答案 · 2 题1 题通过完成报告 · 2 题2 题部分完成
各项任务表现
事实检索通过
无明显变化
- 耗时
- 1.5 分钟
- 总 Token
- 3,861
- 工具 / 搜索调用
- 19 / 3
- 可打开 / 已检查链接
- 18 / 20
- 引用忠实度
- —
复用上一批已验证的记录。 运行保护:未触发。
多跳检索失败
无明显变化
- 耗时
- 7.8 分钟
- 总 Token
- 8,382
- 工具 / 搜索调用
- 54 / 13
- 可打开 / 已检查链接
- 0 / 0
- 引用忠实度
- —
本轮重新运行的多跳检索题。 运行保护:搜索次数达到上限。
健康主题报告部分完成
无明显变化
- 耗时
- 10.9 分钟
- 总 Token
- 91,218
- 工具 / 搜索调用
- 59 / 20
- 可打开 / 已检查链接
- 11 / 20
- 引用忠实度
- 75.0%
复用上一批已验证的记录。 运行保护:未触发。
金融主题报告部分完成
优于原生基线
- 耗时
- 7.0 分钟
- 总 Token
- 96,582
- 工具 / 搜索调用
- 43 / 18
- 可打开 / 已检查链接
- 14 / 20
- 引用忠实度
- 75.0%
复用上一批已验证的记录。 运行保护:未触发。
研究交付诊断复用健康报告,不单独运行通过
无明显变化
- 耗时
- —
- 总 Token
- —
- 工具 / 搜索调用
- 0 / 0
- 可打开 / 已检查链接
- 0 / 0
- 引用忠实度
- 75.0%
复用上一批已验证的记录。 派生诊断的耗时和 Token 不适用。
与原生能力相比
1 项更好 / 4 项无明显变化 / 0 项更差
- 每题平均耗时
- 6.8 分钟
- 每题平均总 Token
- 50,011
- 引用忠实度
- 75.0%
- 系统失败率
- 0.0%
增量与引用忠实度沿用原榜单,包含研究交付诊断;耗时与 Token 均值只统计实际运行的题目,不包含全部已丢弃尝试和评分模型用量。系统失败率仅统计最终保留记录。
dsh-scholar找对答案 · 2 题1 题通过完成报告 · 2 题2 题部分完成
各项任务表现
事实检索通过
无明显变化
- 耗时
- 2.7 分钟
- 总 Token
- 9,080
- 工具 / 搜索调用
- 27 / 4
- 可打开 / 已检查链接
- 18 / 20
- 引用忠实度
- —
复用上一批已验证的记录。 运行保护:未触发。
多跳检索失败
无明显变化
- 耗时
- 90.6 分钟
- 总 Token
- 6,729
- 工具 / 搜索调用
- 10 / 8
- 可打开 / 已检查链接
- 0 / 0
- 引用忠实度
- —
本轮重新运行的多跳检索题。 运行保护:长时间无进展。
健康主题报告部分完成
无明显变化
- 耗时
- 5.3 分钟
- 总 Token
- 72,805
- 工具 / 搜索调用
- 56 / 20
- 可打开 / 已检查链接
- 12 / 20
- 引用忠实度
- 75.0%
复用上一批已验证的记录。 运行保护:未触发。
金融主题报告部分完成
优于原生基线
- 耗时
- 18.6 分钟
- 总 Token
- 89,373
- 工具 / 搜索调用
- 69 / 20
- 可打开 / 已检查链接
- 15 / 20
- 引用忠实度
- 75.0%
复用上一批已验证的记录。 运行保护:未触发。
研究交付诊断复用健康报告,不单独运行通过
无明显变化
- 耗时
- —
- 总 Token
- —
- 工具 / 搜索调用
- 0 / 0
- 可打开 / 已检查链接
- 0 / 0
- 引用忠实度
- 75.0%
复用上一批已验证的记录。 派生诊断的耗时和 Token 不适用。
与原生能力相比
1 项更好 / 4 项无明显变化 / 0 项更差
- 每题平均耗时
- 29.3 分钟
- 每题平均总 Token
- 44,497
- 引用忠实度
- 75.0%
- 系统失败率
- 0.0%
增量与引用忠实度沿用原榜单,包含研究交付诊断;耗时与 Token 均值只统计实际运行的题目,不包含全部已丢弃尝试和评分模型用量。系统失败率仅统计最终保留记录。
dsh-deepresearch找对答案 · 2 题0 题通过完成报告 · 2 题2 题部分完成
各项任务表现
事实检索失败
低于原生基线
- 耗时
- 3.4 分钟
- 总 Token
- 3,127
- 工具 / 搜索调用
- 23 / 1
- 可打开 / 已检查链接
- 0 / 0
- 引用忠实度
- —
复用上一批已验证的记录。 运行保护:长时间无进展。
多跳检索失败
无明显变化
- 耗时
- 9.4 分钟
- 总 Token
- 7,525
- 工具 / 搜索调用
- 49 / 13
- 可打开 / 已检查链接
- 0 / 0
- 引用忠实度
- —
本轮重新运行的多跳检索题。 运行保护:搜索次数达到上限。
健康主题报告部分完成
无明显变化
- 耗时
- 6.7 分钟
- 总 Token
- 61,173
- 工具 / 搜索调用
- 80 / 16
- 可打开 / 已检查链接
- 12 / 20
- 引用忠实度
- 75.0%
复用上一批已验证的记录。 运行保护:未触发。
金融主题报告部分完成
无明显变化
- 耗时
- 9.4 分钟
- 总 Token
- 96,716
- 工具 / 搜索调用
- 102 / 17
- 可打开 / 已检查链接
- 12 / 20
- 引用忠实度
- 75.0%
复用上一批已验证的记录。 运行保护:研究工具调用达到上限。
研究交付诊断复用健康报告,不单独运行通过
无明显变化
- 耗时
- —
- 总 Token
- —
- 工具 / 搜索调用
- 0 / 0
- 可打开 / 已检查链接
- 0 / 0
- 引用忠实度
- 75.0%
复用上一批已验证的记录。 派生诊断的耗时和 Token 不适用。
与原生能力相比
0 项更好 / 4 项无明显变化 / 1 项更差
- 每题平均耗时
- 7.2 分钟
- 每题平均总 Token
- 42,135
- 引用忠实度
- 75.0%
- 系统失败率
- 0.0%
增量与引用忠实度沿用原榜单,包含研究交付诊断;耗时与 Token 均值只统计实际运行的题目,不包含全部已丢弃尝试和评分模型用量。系统失败率仅统计最终保留记录。
dsh-science找对答案 · 2 题1 题通过完成报告 · 2 题2 题部分完成
各项任务表现
事实检索失败
低于原生基线
- 耗时
- 2.8 分钟
- 总 Token
- 14,442
- 工具 / 搜索调用
- 44 / 3
- 可打开 / 已检查链接
- 0 / 0
- 引用忠实度
- —
复用上一批已验证的记录。 运行保护:研究工具调用达到上限。
多跳检索通过
优于原生基线
- 耗时
- 1.5 分钟
- 总 Token
- 6,804
- 工具 / 搜索调用
- 17 / 4
- 可打开 / 已检查链接
- 5 / 20
- 引用忠实度
- —
本轮重新运行的多跳检索题。 运行保护:未触发。
健康主题报告部分完成
无明显变化
- 耗时
- 5.0 分钟
- 总 Token
- 97,507
- 工具 / 搜索调用
- 44 / 21
- 可打开 / 已检查链接
- 11 / 20
- 引用忠实度
- 75.0%
复用上一批已验证的记录。 运行保护:未触发。
金融主题报告部分完成
无明显变化
- 耗时
- 5.4 分钟
- 总 Token
- 118,696
- 工具 / 搜索调用
- 118 / 25
- 可打开 / 已检查链接
- 14 / 20
- 引用忠实度
- 50.0%
复用上一批已验证的记录。 运行保护:搜索次数达到上限。
研究交付诊断复用健康报告,不单独运行通过
无明显变化
- 耗时
- —
- 总 Token
- —
- 工具 / 搜索调用
- 0 / 0
- 可打开 / 已检查链接
- 0 / 0
- 引用忠实度
- 75.0%
复用上一批已验证的记录。 派生诊断的耗时和 Token 不适用。
与原生能力相比
1 项更好 / 3 项无明显变化 / 1 项更差
- 每题平均耗时
- 3.7 分钟
- 每题平均总 Token
- 59,362
- 引用忠实度
- 66.7%
- 系统失败率
- 0.0%
增量与引用忠实度沿用原榜单,包含研究交付诊断;耗时与 Token 均值只统计实际运行的题目,不包含全部已丢弃尝试和评分模型用量。系统失败率仅统计最终保留记录。
部分完成表示仍有缺项,未达到通过标准。点击插件可展开任务和运行指标;插件顺序沿用本轮榜单。
脱敏结果与评测代码已公开,可复算排名。关键结果尚待独立环境复测。
4 个独立题面、1 个派生诊断;私有答案与报告正文未公开,不能据此概括所有研究任务。
评测与验证说明
测试方法、证据与适用范围+
评测与验证说明
测试方法、证据与适用范围本次测试怎样执行
- 参评范围
- 原生基线不安装插件,7 个参评条件各安装一个插件。另一个候选插件因缺少所需凭证被排除,不计零分、不进入榜单。
- 事实检索与多跳检索
- 使用私有金标与确定性规则,核对答案及实际检索行为。题面和答案不公开。
- 健康主题报告与金融主题报告
- 采用公开健康、金融主题任务,结合交付物检查、链接检查与固定模型评分。部分完成表示仍有缺项或未达到通过门槛。
- 研究交付诊断
- 复用健康主题报告,评估是否形成研究交付,不再调用模型。不能把它当作额外独立样本。
如何理解名次
沿用本轮评测的排序:准入 → 编造 → 长文通过与部分完成数 → 引用忠实度 → 短事实通过数 → 恢复 → 负增量 → 耗时。没有合成加权总分,原生基线不参与插件排名。
内部批次:V12,用于对应下载数据与历史记录,不是插件版本或题目数量。本轮统一补跑多跳检索题,其余复用上一批(V11)已验证的记录。发布日期不等于全部任务的运行日期。本轮只覆盖 4 个独立题面,不能推断插件在所有研究任务上的普遍优劣,也不代表上游基准的完整官方榜单。
系统失败率仅反映最终保留记录。过程日志中的错误、重试、人工介入计数是文本规则命中次数,可能重复或误命中;不能据此宣称整轮没有故障。