分析导出
dispatchatlas.analytica 将已完成的活动仓库转化为统计摘要、确定性图形、证据包,以及
门户就绪数据集。该包消费稳定的 JSON 清单,并不导入活动运行时。
可运行示例: examples/analyze_results.py 以非参数统计、效应量、置信区间、确定性表格与双格式图形总结一个结果集。
📥 输入
分析加载器期望一个包含以下内容的活动目录:
checkpoint.json,含已完成、失败与待处理的运行 id。plan.json,含运行顺序与披露标签。environment.json,含非机密的环境事实。results/*.json,已完成运行行。failures/*.json,存在时的失败尝试行。
缺失的检查点、内容哈希、目标值或披露标签会在分析开始之前使摄取失败。
📊 统计方法
一个具名方法注册表声明每个分析方法及其数据假设、最小样本规则、失败模式与最低证据层。 每个推断方法与质量指标都要求每个随机求解器-实例单元至少 30 次独立运行;低于下限的样本 被路由到“局限”面,而非产生一个无效结果。
对每个目标,摘要层报告求解器计数、可行计数、均值、中位数、标准差、偏差校正且加速的 (BCa)自助置信区间、用于成对比较的 Wilcoxon 符号秩检验及 Vargha-Delaney A12 与 Cliff's delta 效应量、在多求解器场上的 Friedman 总括检验及 Nemenyi 临界差异事后检验、 在成对族上的 Holm 或 Hochberg 校正,以及按基准问题的平均秩。多目标前沿另外报告 超体积(主要)、IGD+、加性 epsilon-指标与散布质量指标。
默认目标是 makespan,采用最小化语义。Wilcoxon 检验对小型无平局样本使用精确零分布,
否则使用平局校正的正态近似。置信区间使用带记录种子的确定性自助重采样;它们描述所观测
的活动样本,单凭其本身并非完整活动的主张。
在闭式贝叶斯符号检验之外,bayesian_signed_rank_test 在成对差异的 Walsh 均值上抽取一个
带种子的 Dirichlet 过程后验,因此连续指标获得 Benavoli、Corani、Demšar 与 Zaffalon
(2017)的、感知量级的贝叶斯比较;符号检验仍保持为闭式默认。多重比较族新增 Shaffer 的
静态逐步降序程序,它利用一个完整全配对比较族的逻辑约束,并在一个部分族上失败关闭
(Shaffer 1986),以及 Finner 的逐步降序校正,一种接受任意族的更简单功效增益(Finner
1993);Holm 仍为已配置默认。相对百分比偏差加入最优性差距方法:arpd_rows 以显式
出处对照一个调用方提供的已知最优参考值为每次可行运行评分,而 ensure_equal_budgets
校验其背后的按规模缩放的等预算协议——每个问题在各求解器间使用一个相同预算,预算可随
实例大小增长(Vallada、Ruiz 与 Framiñan 2015)。多目标超体积比较归档其共享参考点:
multiobjective_indicator_report 在一个具名规则下导出该点——边距-分数默认规则或
ishibuchi-h 缩放——在一个 ReferencePointRecord 中记录理想点、最劣点、规则、参数与一套
失败关闭的出处词汇,而 ensure_shared_reference_points 拒绝比较归档点不同的产物
(Ishibuchi、Imada、Setoguchi 与 Nojima 2018;确切的已发布偏移在待运营者检视全文之前
保持标记为 APPROXIMATE)。一条硬规则守护每个被导出的表格:p 值绝不在其旁没有效应量
与区间的情况下发运。ensure_effect_sizes_beside_p_values 在表格构建器内部并在包写入时
再次检查表头,对任何裸的显著性列失败关闭(Carrasco、García、Rueda、Das 与 Herrera
2020)。
🖼️ 图形与表格
证据包包含用于求解器摘要、成对比较、排名、基准覆盖与不可行行的 Markdown 表格。SVG
图形携带无障碍的 title 与 desc 元数据,用于排名条、性能剖面、按运行顺序的目标趋势、
Nemenyi 临界差异图、运行时-质量权衡、收敛轨迹、探索-开发平衡、按实例大小的运行时
可扩展性、种子稳定性(变异系数)、鲁棒性(CVaR 尾部风险)与基准特征化。一份图形清单
记录每个图形的角色、出处与无障碍说明。依赖某活动未记录的诊断(运行时、收敛轨迹、
种群多样性、实例规模)或依赖多个种子(种子稳定性)的图形会渲染一条“局限”提示。一个
supplement/limitations.md 收集每个被路由到“局限”的方法。
对相同输入重新运行相同导出会产生相同的 JSON、表格与图形载荷。
Dolan-Moré 性能剖面随其 Moré-Wild 伴生图一同发运:data_profile_svg 与
data_profile_tex 从收敛图消费的同一批收敛轨迹出发,绘制在一个评估组预算内被求解到某个
目标精度的 (求解器, 问题) 单元所占份额——评估组是单纯形梯度单元的评估组适配——而一个
没有轨迹的数据集会被路由到局限图。比较超过两个求解器的性能剖面在两种输出形式中都携带
一条解读注意事项:一个剖面仅将每个求解器与每个问题的最优者进行排名,因此非最优求解器
之间的相对次序并不被隐含(Gould 与 Scott 2016)。
⚖️ 平台对比
平台对比导出渲染竞争框架的能力行、一份特性丰富度覆盖矩阵、一份分布距离桥接评估,以及
产物检视行。每一行都携带一个证据来源标签(documented、measured、
artifact-inspected、vendor-claim 或 unsupported),任何不支持的行被路由到一个
局限-与-未来工作面。该导出携带一条常设守护语:这些表格比较平台的能力、特性与产物,
而非直接的性能主张——性能证据存在于统计分析导出中。
🥊 正面对决车道
正面对决车道用相同的具名非参数检验,将一个焦点求解器与一个具名基线队列进行比较,将每 一行朝向焦点求解器取向,并将一项胜过队列的主张限定于:焦点求解器持有最佳平均秩,且在 校正显著性水平上以利于它的效应量赢得每一次成对比较。算法复杂度以及 构造/内部/外部有效性威胁的表格构建器伴随该车道,供报告消费。
🔒 披露策略
导出通过可执行的披露策略进行过滤:
core仅允许核心/公开证据。speed允许核心、速度与公开证据。quality允许核心、速度、质量与公开证据。platform允许平台证据,同时仍屏蔽编修后的源与陈旧叙事术语。
被禁止的行从证据与门户数据集中排除,并连同原因写入一份补充排除清单。
🗂️ 包布局
evidence-bundle/
bundle.json
tables/
solver-summary.md
pairwise-comparisons.md
rankings.md
benchmarks.md
infeasible-rows.md
figures/
performance-profile.svg
solver-rankings.svg
run-order-trend.svg
critical-difference.svg
runtime-quality.svg
convergence.svg
characterization.svg
exploration-exploitation.svg
scalability.svg
stability.svg
robustness.svg
figure-manifest.json
supplement/
exclusions.json
limitations.mdbundle.json 列出每个生成文件并对规范清单载荷进行哈希,因此每个表格、图形与补充材料
都留在一份被跟踪、内容寻址的清单之内。
⌨️ 命令
uv run dispatchatlas export `
--campaign-dir .\experiments\results\smoke-pilot `
--target-dir .\exports\smoke-pilot `
--authorized-output-root .\exports `
--tier core `
--objective makespan `
--portal该命令写出一个证据包,外加一个可选的门户数据集。证据包包含表格、图形与补充排除。门户
JSON 包含可搜索标签、披露标签、目标值、运行 id 与哈希关联的活动元数据。--target-dir
必须解析到 --authorized-output-root 之内;默认授权根是当前工作目录。
运行 uv run dispatchatlas export --help 获取选项描述与示例。运行时输入错误默认打印一条
恢复消息;在开发需要 Python 回溯时,在子命令前传入 --debug。
📝 报告脚手架
分析层还将一个经披露过滤的证据包转化为一个按证据层索引的确定性报告脚手架。一个
ReportScaffoldSpec 声明贡献主张、设计理据与主张关卡;write_report_scaffold 写出
证据包,外加一份全面的章节计划、一项贡献主张、一份主张-关卡台账,以及一份编修报告,
置于 report/ 之下。每个章节都锚定到一个经过滤的证据产物,所生成的脚手架会被扫描,使
一个较后层机制或一个受限内部标记令该写入失败关闭。
主张关卡是失败即关闭:一个设计级主张无条件开启,而一个比较性主张保持关闭,直到一次
正面对决以每个配对计数都达到或超过统计功效下限胜过队列。一份跨证据层的
contribution_partition 证明每层零重叠的贡献,而 redaction_report 接受一个由调用方
提供的注册表,使一份非公开草稿可被检查,而该注册表绝不进入已发布的源。
uv run dispatchatlas report `
--campaign-dir .\experiments\results\smoke-pilot `
--target-dir .\scaffolds\smoke-pilot `
--authorized-output-root .\scaffolds `
--tier core