本文へスキップ
DispatchAtlas
検索

分析エクスポート

dispatchatlas.analytica は完了したキャンペーンリポジトリを、統計要約、決定的な図、 エビデンスバンドル、ポータル対応データセットに変えます。本パッケージは安定した JSON マニフェストを消費し、キャンペーンランタイムを import しません。

実行可能な例: examples/analyze_results.py は、ノンパラメトリック統計、効果量、信頼区間、決定的な表、二重形式の図で結果集合を要約します。

📥 入力

分析ローダーは、次を含む 1 つのキャンペーンディレクトリを期待します:

  • 完了・失敗・保留の実行 id を持つ checkpoint.json
  • 実行順序と開示ラベルを持つ plan.json
  • 非機密の環境事実を持つ environment.json
  • results/*.json の完了実行行。
  • 存在する場合の failures/*.json の失敗試行行。

欠落したチェックポイント、コンテンツハッシュ、目的値、開示ラベルは、分析開始前に インジェスチョンを失敗させます。

📊 統計手法

名前付き手法レジストリが、各分析手法をそのデータ仮定、最小標本規則、失敗モード、最低 エビデンス層とともに宣言します。各推論手法と品質指標は、確率的なソルバー-インスタンス セルごとに少なくとも 30 回の独立実行を必要とします; 下限未満の標本は、無効な結果を 生み出す代わりに限界事項面へルーティングされます。

各目的について、要約層はソルバー数、実行可能数、平均、中央値、標準偏差、バイアス補正 加速(BCa)ブートストラップ信頼区間、ペアワイズ比較のための Vargha-Delaney A12 と Cliff's delta の効果量を伴う Wilcoxon 符号順位検定、マルチソルバーフィールド上の Friedman オムニバス検定と Nemenyi 臨界差事後検定、ペアワイズファミリー上の Holm または Hochberg 補正、そしてベンチマーク問題ごとの平均順位を報告します。多目的フロントはさらに、 ハイパーボリューム(主要)、IGD+、加法イプシロン指標、散らばりの品質指標を報告します。

既定の目的は最小化セマンティクスの makespan です。Wilcoxon 検定は、小さなタイなし標本 には厳密な帰無分布を、それ以外にはタイ補正正規近似を使用します。信頼区間は記録された シードによる決定的ブートストラップ再標本化を使用します; それらは観測されたキャンペーン 標本を記述し、それ自体だけでは完全キャンペーンの主張ではありません。

閉形式のベイズ符号検定に加え、bayesian_signed_rank_test はペア差のウォルシュ 平均上にシード付きディリクレ過程事後分布を引くため、連続指標は Benavoli, Corani, Demšar, Zaffalon (2017) の大きさを意識したベイズ比較を得ます; 符号検定は閉形式の 既定のままです。多重比較ファミリーには、完全な全ペア比較ファミリーの論理制約を活用し 部分的なファミリーではフェイルクローズする Shaffer の静的ステップダウン手続き (Shaffer 1986)と、任意のファミリーを受け入れるより単純な検出力向上である Finner の ステップダウン補正(Finner 1993)が加わります; Holm は構成上の既定のままです。相対 パーセント偏差が最適性ギャップ手法に加わります: arpd_rows は各実行可能な実行を、 呼び出し側が供給する明示的な来歴付きの既知最良参照値に対して採点し、 ensure_equal_budgets はその背後のサイズスケール等予算プロトコル——ソルバー間で 問題ごとに 1 つの同一予算、予算はインスタンスサイズとともに増加してよい——を検証します (Vallada, Ruiz, Framiñan 2015)。多目的ハイパーボリューム比較は共有参照点をアーカイブ します: multiobjective_indicator_report は名前付き規則——マージン分数の既定または ishibuchi-h スケーリング——の下で点を導出し、理想点、ナディア点、規則、パラメータ、 フェイルクローズの来歴語彙を ReferencePointRecord に記録し、 ensure_shared_reference_points はアーカイブされた点が異なる成果物の比較を拒否します (Ishibuchi, Imada, Setoguchi, Nojima 2018; 正確な公表オフセットは、オペレーターが レビューする全文が得られるまで APPROXIMATE と記されたままです)。1 つの厳格な規則が すべてのエクスポート表を守ります: p 値は効果量と区間をその傍らに伴わずには決して 出荷されません。ensure_effect_sizes_beside_p_values は表ビルダー内部で、そして バンドル書き込み時に再度ヘッダーを検査し、裸の有意性列があればフェイルクローズします (Carrasco, García, Rueda, Das, Herrera 2020)。

🖼️ 図と表

エビデンスバンドルには、ソルバー要約、ペアワイズ比較、ランキング、ベンチマーク カバレッジ、実行不能行の Markdown 表が含まれます。SVG 図は、ランキングバー、性能 プロファイル、実行順序による目的トレンド、Nemenyi 臨界差図、ランタイム-品質トレードオフ、 収束軌跡、探索-活用バランス、インスタンスサイズ別ランタイムスケーラビリティ、シード 安定性(変動係数)、ロバスト性(CVaR テールリスク)、ベンチマーク特性評価のための、 アクセシブルな titledesc メタデータを携えます。図マニフェストが各図の役割、来歴、 アクセシビリティ注記を記録します。キャンペーンが記録しなかった診断(ランタイム、収束 トレース、母集団多様性、インスタンス規模)または複数シード(シード安定性)に依存する図は、 限界事項通知をレンダリングします。supplement/limitations.md が限界事項へルーティング された各手法を集めます。

同じ入力に対して同じエクスポートを再実行すると、同じ JSON・表・図のペイロードが 得られます。

Dolan-Moré 性能プロファイルは、その Moré-Wild の相棒とともに随伴します: data_profile_svgdata_profile_tex は、収束図が消費するのと同じ収束トレースから、 評価グループ——シンプレックス勾配単位の評価グループ適応——の予算内で目標精度まで 解かれた (ソルバー, 問題) セルの割合をプロットし、トレースを持たないデータセットは 限界事項図へルーティングされます。3 つを超えるソルバーを比較する性能プロファイルは、 両方の出力形式で解釈上の注意書きを携えます: プロファイルは各ソルバーを問題ごとの 最良に対してのみ順位付けするため、最良でないソルバー同士の相対順序は含意されません (Gould and Scott 2016)。

⚖️ プラットフォーム比較

プラットフォーム比較エクスポートは、競合フレームワークの能力行、機能の豊かさカバレッジ マトリクス、分布距離橋渡し評価、成果物検査行をレンダリングします。各行は エビデンス源ラベル(documentedmeasuredartifact-inspectedvendor-claimunsupported)を携え、サポートされない行は限界-と-今後の課題面へルーティングされます。 エクスポートは常設のガード行を携えます: これらの表はプラットフォームの能力・機能・成果物 を比較し、直接の性能主張ではありません——性能エビデンスは統計分析エクスポートに住みます。

🥊 一騎打ち比較レーン

一騎打ちレーンは、同じ名前付きノンパラメトリック検定を用いて 1 つの焦点ソルバーを 名前付きベースライン群と比較し、各行を焦点ソルバーへ向けて方向付け、群を打ち負かす主張を、 焦点ソルバーが最良の平均順位を保持し、補正有意水準で効果量がそれに有利な状態で各 ペアワイズ比較に勝つことに条件付けます。アルゴリズム複雑性と 構成/内的/外的の妥当性脅威の表ビルダーが、レポート消費のためにレーンに付随します。

🔒 開示ポリシー

エクスポートは実行可能な開示ポリシーを通じてフィルタリングされます:

  • core はコア/公開エビデンスのみを許可します。
  • speed はコア、速度、公開エビデンスを許可します。
  • quality はコア、速度、品質、公開エビデンスを許可します。
  • platform は、編集されたソースと陳腐化ナラティブ用語を依然ブロックしつつ、 プラットフォームエビデンスを許可します。

禁止された行はエビデンスとポータルデータセットから除外され、理由とともに補足の除外 マニフェストに書き込まれます。

🗂️ バンドルレイアウト

evidence-bundle/
  bundle.json
  tables/
    solver-summary.md
    pairwise-comparisons.md
    rankings.md
    benchmarks.md
    infeasible-rows.md
  figures/
    performance-profile.svg
    solver-rankings.svg
    run-order-trend.svg
    critical-difference.svg
    runtime-quality.svg
    convergence.svg
    characterization.svg
    exploration-exploitation.svg
    scalability.svg
    stability.svg
    robustness.svg
    figure-manifest.json
  supplement/
    exclusions.json
    limitations.md

bundle.json はすべての生成ファイルを列挙し正典マニフェストペイロードをハッシュする ため、すべての表・図・補足が 1 つの追跡された、コンテンツアドレス指定のマニフェスト内に 留まります。

⌨️ コマンド

uv run dispatchatlas export `
  --campaign-dir .\experiments\results\smoke-pilot `
  --target-dir .\exports\smoke-pilot `
  --authorized-output-root .\exports `
  --tier core `
  --objective makespan `
  --portal

コマンドはエビデンスバンドルと、オプションのポータルデータセットを書き出します。 エビデンスバンドルには表、図、補足的除外が含まれます。ポータル JSON には検索可能タグ、 開示ラベル、目的値、実行 id、ハッシュ連結のキャンペーンメタデータが含まれます。 --target-dir--authorized-output-root 内に解決されなければなりません; 既定の 認可ルートは現在の作業ディレクトリです。

オプションの説明と例については uv run dispatchatlas export --help を実行してください。 ランタイム入力エラーは既定で回復メッセージを表示します; 開発で Python トレースバックが 必要なときはサブコマンドの前に --debug を渡してください。

📝 レポートの足場

分析層はまた、開示フィルタ済みのエビデンスバンドルを、エビデンス層でキー付けされた決定的 レポートの足場に変えます。ReportScaffoldSpec が貢献主張、設計根拠、主張ゲートを宣言し、 write_report_scaffold がエビデンスバンドルに加え、包括的なセクション計画、貢献主張、 主張ゲート台帳、編集レポートを report/ の下に書きます。各セクションはフィルタ済みの エビデンス成果物に錨付けされ、生成された足場はスキャンされ、より後の層の機構または制限 付き内部マーカーが書き込みをフェイルクローズさせます。

主張ゲートはフェイルクローズです: 設計レベルの主張は無条件に開き、比較的主張は、一騎打ち 比較が各対計数を統計的検出力の下限以上にして群を打ち負かすまで閉じたままです。エビデンス 層にわたる contribution_partition は層ごとに重複ゼロの貢献を証明し、redaction_report は呼び出し側が供給するレジスタを受け入れるため、非公開のドラフトを、そのレジスタが 出荷ソースに決して入ることなく確認できます。

uv run dispatchatlas report `
  --campaign-dir .\experiments\results\smoke-pilot `
  --target-dir .\scaffolds\smoke-pilot `
  --authorized-output-root .\scaffolds `
  --tier core