DSHEVAL
菜单

METHOD / DEEP RESEARCH

深度研究评测方法

让研究插件与 DSH 原生能力完成同一组任务。既检查能否找到正确答案,也检查能否交付有依据的完整报告。

与原生能力对照

同一轮使用相同任务和运行条件,观察安装插件后带来的变化。

BASELINE

DSH 原生能力

不安装额外研究插件,作为比较基线,不参与插件排名。

PLUGIN

研究插件

每次只安装一个待测插件。缺少必需凭证等准入问题单独记录,不记质量零分。

怎样执行

本轮有两道短事实题、两道长报告题。另有一项诊断复用健康主题报告,不另算独立题目。

  1. 固定比较条件

    锁定 DSH、模型、题面、运行预算和评分配置。先运行原生基线,再分别测试插件。

  2. 独立运行任务

    每个参评条件使用独立环境和工作区,记录检索、工具调用、输出、耗时与异常。

  3. 检查答案与报告

    短事实题核对答案与实际检索行为;长报告先检查交付物和链接,再由固定模型评价质量。

  4. 汇总并公开

    分别统计短事实、长报告与相对基线的增量,公开脱敏记录,同时说明故障、复用记录和适用边界。

怎样判分

检索答案与报告质量分别统计,不合成为一个加权总分。

短事实:答案是否正确

使用私有标准答案进行精确或可接受答案匹配,并检查是否实际发生多步检索或抓取。

长报告:交付与证据是否充分

先检查必需交付物、链接可达性和禁止项,再由固定模型、固定提示词的评分器评价事实、完整性、引用忠实度和风险。评分器不获知插件身份。

关键交付物齐全、事实和引用达到门槛且无严重编造,才算通过;可用但仍有缺项或证据不足,记为部分完成。链接能打开,不代表它支持报告中的结论。

异常单独记录

系统故障、超出能力范围和评分器故障分别标记。评分器无法完成时,保留确定性检查,暂不进入其质量排名,不记质量零分。

公开材料与边界

这是固定小样本的插件比较,不代表所有研究任务,也不是上游基准的完整官方榜单。

公开数据保留状态、数值、资源用量和来源标记,可复算排名。私有题面、标准答案、报告正文和完整日志未公开,不能仅凭脱敏数据重新核验答案、引用或完整运行过程。

本轮重新运行多跳检索题,其余复用上一批已验证的记录;逐条标明来源。长文质量采用本地模型评分,不标作上游官方分数。

查看原始协议与技术细节 对应公开报告查看深度研究评测结果