DSH 原生能力
不安装额外研究插件,作为比较基线,不参与插件排名。
METHOD / DEEP RESEARCH
让研究插件与 DSH 原生能力完成同一组任务。既检查能否找到正确答案,也检查能否交付有依据的完整报告。
COMPARISON
同一轮使用相同任务和运行条件,观察安装插件后带来的变化。
不安装额外研究插件,作为比较基线,不参与插件排名。
每次只安装一个待测插件。缺少必需凭证等准入问题单独记录,不记质量零分。
PROCEDURE
本轮有两道短事实题、两道长报告题。另有一项诊断复用健康主题报告,不另算独立题目。
锁定 DSH、模型、题面、运行预算和评分配置。先运行原生基线,再分别测试插件。
每个参评条件使用独立环境和工作区,记录检索、工具调用、输出、耗时与异常。
短事实题核对答案与实际检索行为;长报告先检查交付物和链接,再由固定模型评价质量。
分别统计短事实、长报告与相对基线的增量,公开脱敏记录,同时说明故障、复用记录和适用边界。
SCORING
检索答案与报告质量分别统计,不合成为一个加权总分。
使用私有标准答案进行精确或可接受答案匹配,并检查是否实际发生多步检索或抓取。
先检查必需交付物、链接可达性和禁止项,再由固定模型、固定提示词的评分器评价事实、完整性、引用忠实度和风险。评分器不获知插件身份。
关键交付物齐全、事实和引用达到门槛且无严重编造,才算通过;可用但仍有缺项或证据不足,记为部分完成。链接能打开,不代表它支持报告中的结论。
系统故障、超出能力范围和评分器故障分别标记。评分器无法完成时,保留确定性检查,暂不进入其质量排名,不记质量零分。
EVIDENCE
这是固定小样本的插件比较,不代表所有研究任务,也不是上游基准的完整官方榜单。
公开数据保留状态、数值、资源用量和来源标记,可复算排名。私有题面、标准答案、报告正文和完整日志未公开,不能仅凭脱敏数据重新核验答案、引用或完整运行过程。
本轮重新运行多跳检索题,其余复用上一批已验证的记录;逐条标明来源。长文质量采用本地模型评分,不标作上游官方分数。