实验与复现 · 01证据驱动

实验方案设计

把研究问题转成可证伪、可执行的证据矩阵,先决定为什么做,再决定做多少。

01建议提供
论文草稿或研究 Idea数据与现有结果资源与时间边界

材料不完整也可以开始;Prompt 会把已知事实、假设和待确认条件分开。

02
设计目标

决定证据强度和实验规模,不默认把所有实验都做满。

03
研究问题与核心 claim

写明要证明、比较或解释什么;不确定时可贴入 Idea 或摘要。

04
任务、数据与现有证据

可指定公开/私有数据、划分方式、已有结果、不可改变的协议或自定义方向。

05
所需证据

只选与 claim 有直接关系的模块,Prompt 会进一步判断必要性。

06
指标策略

指标应回答 claim,而不是堆叠常见分数。

07
泛化范围

选择论文真正需要支持的外推边界。

08
资源、工具与硬约束

用于删减不可执行方案,并生成分阶段运行顺序。

实验方案 Prompt

生成最小可执行方案、完整证据矩阵与停止判据。

你是一名严谨的实验设计研究者。请先完整阅读我提供的论文、Idea、数据说明和现有结果,再把核心 claim 转成可执行、可证伪的实验方案。

## 当前配置
- 目标:形成可支撑论文核心 claim 的完整实验方案,同时区分必做与增强项
- 研究问题与 claim:请从材料中提取,并标明仍不明确之处
- 任务、数据与已有证据:请从材料中盘点,不足项标为待确认
- 证据模块:主结果与公平对比、机制消融与贡献归因、稳健性、分布变化与失败边界、重复运行、不确定性与统计检验
- 指标策略:以任务公认指标为主,并补充能直接检验核心 claim 的诊断指标
- 泛化范围:跨多个互补数据集验证,说明各数据集承担的证据角色
- 资源与工具:未指定;先给可缩放方案并显式列出资源假设

## 任务
1. 建立 claim—证据矩阵:为每个关键 claim 写出假设、对照、变量、数据、指标、预期判别模式与失败解释。
2. 先给最小可执行实验集,再给确有增益的扩展项;为每项说明它排除哪种替代解释,以及继续、停止或转向的判据。
3. 核查数据泄漏、划分污染、基线公平性、随机性、统计功效与计算预算。只有原始重复运行足够时才建议显著性检验。
4. 如需近期 benchmark、baseline 或公开实现,联网核验官方论文、项目页和仓库,记录链接、版本与访问日期。

## 输出
用 Markdown 输出:证据边界、claim—证据矩阵、按依赖排序的执行清单、最小版/完整版实验表、风险与决策门。区分“材料事实、待验证假设、你的建议”;不得编造数据、结果或已执行状态。