MACF 实验报告:MAPPO、LegacyGAT 到 HATT v3.2

生成时间:2026-06-29。输入:sweep YAML、TensorBoard event、32-episode eval、v32 checkpoint sweep。

12sweep manifests
7主要横向 eval 组
79v32 checkpoint eval records
5v32 有效候选,v3.2d failed

结论摘要

分析口径

Best checkpoint 表示能力上限,last checkpoint 表示直接部署风险,stable checkpoint ratio 表示跨 checkpoint 的稳健性。对于 full_random 环境,late eval 变弱可能来自环境抽样、路径/补给惩罚和训练继续更新共同作用,因此报告中保留三种视角。

配置索引

ManifestGroupScale/EvalJobs
20260623_7groups.yamlmacf-260623?+? agents, tasks=?, steps=?, eval=32hattv2.2-260623, hattv2.0-260623, hattv1.0-260623, gatobs-260623, cat-260623, gated-260623, mappo-260623
20260624_v2_full_random.yamlmacf-sweep-v2?+? agents, tasks=?, steps=?, eval=32mappo-v2, hattv2.0-v2
20260625_v4_curriculum_full_random.yamlmacf-sweep-v4?+? agents, tasks=?, steps=?, eval=32hattv2.0-v4-curriculum, hattv2.0-v4-fullrandom, mappo-v4-curriculum, mappo-v4-fullrandom
20260626_mid_260626.yamlmacf-mid-26062610+20 agents, tasks=25, steps=1500, eval=32hattv2.0-mid-jitter-260626, hattv2.0-mid-fullrandom-260626, mappo-mid-jitter-260626, mappo-mid-fullrandom-260626
20260626_small-scale.yamlsmall-scale8+12 agents, tasks=10, steps=750, eval=32hattv2.0, hattv2.0, mappo, mappo, rmappo-hattv2.0, rmappo
20260627_hatt-v23-small-scale.yamlhatt-v23-small-scale4+8 agents, tasks=10, steps=750, eval=32hattv2.0, hattv2.3a, hattv2.3b, hattv2.2, hattv2.3c, mappo
20260628_hatt-v30-small-scale.yamlhatt-v30-small-scale4+8 agents, tasks=10, steps=750, eval=32hattv2.0, hattv3.0a, hattv3.0b, hattv3.0c
20260628_hatt-v31-fixed-small-scale.yamlhatt-v31-fixed-small-scale4+8 agents, tasks=10, steps=750, eval=32hattv2.0, hattv3.0a, hattv3.1a-fixed, hattv3.1b-fixed, mappo
20260628_hatt-v31-mid-scale.yamlhatt-v31-mid-scale10+20 agents, tasks=25, steps=1500, eval=32hattv2.0, hattv3.0a, hattv3.1a, hattv3.1b, mappo
20260628_hatt-v31-small-scale.yamlhatt-v31-small-scale4+8 agents, tasks=10, steps=750, eval=32hattv2.0, hattv3.0a, hattv3.1a, hattv3.1b, mappo
20260629_hatt-v32-small-scale-resume.yamlhatt-v32-small-scale4+8 agents, tasks=10, steps=750, eval=32hattv2.0, hattv3.2d, mappo
20260629_hatt-v32-small-scale.yamlhatt-v32-small-scale4+8 agents, tasks=10, steps=750, eval=32hattv2.0, hattv3.1a-fixed, hattv3.1b-fixed, hattv3.2a, hattv3.2b, hattv3.2c, hattv3.2d, mappo

LegacyGAT 与早期 HATT

260623 32-episode success:MAPPO / LegacyGAT / HATT 0.8 0.6 0.4 0.2 0.0 hattv2.0-260623: 0.844 hattv2.0-260623 hattv2.2-260623: 0.812 hattv2.2-260623 cat-260623: 0.719 cat-260623 gated-260623: 0.688 gated-260623 hattv1.0-260623: 0.531 hattv1.0-260623 mappo-260623: 0.406 mappo-260623 gatobs-260623: 0.250 gatobs-260623

macf-260623-eval_20260624-073628

ModelFamilySuccessRewardCompletionLengthDead
hattv2.0-260623HATT v2.084.4%1.8197.8%573.30.56
hattv2.2-260623HATT v2.281.2%-13.7094.7%628.80.88
cat-260623LegacyGAT71.9%-15.2195.9%591.90.62
gated-260623LegacyGAT68.8%-26.3792.8%610.50.72
hattv1.0-260623HATT v153.1%-28.3693.1%621.90.44
mappo-260623MAPPO40.6%-49.9791.6%679.80.34
gatobs-260623LegacyGAT25.0%-153.7973.8%707.60.97

LegacyGAT cat/gated 的成功率明显高于 MAPPO,说明关系信息有价值;gatobs 明显较差,说明把决策压到图 embedding 里会损失关键局部观测。HATT v2.0 在该组里同时提升 success、completion 和 reward,是比 v1/v2.2 更稳的结构。

代表性横向 Eval

macf-sweep-v2-eval_20260624-222659

ModelFamilySuccessRewardCompletionLengthDead
mappo-v2MAPPO96.9%1.4199.7%521.50.19
hattv2.0-v2HATT v2.050.0%-25.7085.3%614.60.41

macf-sweep-v4-eval_20260625-193045

ModelFamilySuccessRewardCompletionLengthDead
mappo-v4-fullrandomMAPPO96.9%1.4199.7%521.50.19
hattv2.0-v4-fullrandomHATT v2.093.8%14.4399.1%521.80.34
mappo-v4-curriculumMAPPO65.6%-109.8492.5%610.60.50
hattv2.0-v4-curriculumHATT v2.021.9%-56.8474.4%681.21.06

macf-mid-260626-eval_20260626-160854

ModelFamilySuccessRewardCompletionLengthDead
hattv2.0-mid-fullrandom-260626HATT v2.0100.0%44.72100.0%474.50.12
hattv2.0-mid-jitter-260626HATT v2.0100.0%41.11100.0%493.90.38
mappo-mid-jitter-260626MAPPO93.8%-96.0897.0%659.11.94
mappo-mid-fullrandom-260626MAPPO87.5%-204.8198.6%766.60.19

small-scale-eval_20260627-111300

ModelFamilySuccessRewardCompletionLengthDead
hattv2.0_jitterHATT v2.0100.0%17.06100.0%401.90.22
rmappo-hattv2.0_full-randomHATT v2.096.9%21.3399.4%392.80.31
hattv2.0_full-randomHATT v2.096.9%19.6299.1%399.80.50
rmappo_full-randomRMAPPO93.8%-42.2197.8%479.80.41
mappo_jitterMAPPO84.4%-0.8195.9%433.80.69
mappo_full-randomMAPPO50.0%-371.7080.3%589.10.41

hatt-v23-small-scale-eval_20260628-041808

ModelFamilySuccessRewardCompletionLengthDead
hattv2.3c_full-randomHATT v2.396.9%-4.9199.7%525.30.16
hattv2.2_full-randomHATT v2.296.9%7.6299.1%516.50.19
hattv2.0_full-randomHATT v2.087.5%4.6497.2%526.90.22
hattv2.3b_full-randomHATT v2.387.5%0.7197.2%560.60.47
hattv2.3a_full-randomHATT v2.375.0%-3.2496.9%565.50.50
mappo_full-randomMAPPO50.0%-298.1281.6%657.40.22

hatt-v30-small-scale-eval_20260628-023944

ModelFamilySuccessRewardCompletionLengthDead
hattv3.0a_full-randomHATT v3.093.8%-0.9199.1%526.00.25
hattv2.0_full-randomHATT v2.090.6%-3.0598.4%550.90.16
hattv3.0c_full-randomHATT v3.078.1%-12.7094.7%570.10.66
hattv3.0b_full-randomHATT v3.043.8%-35.6389.1%648.30.75

HATT v3.2 Checkpoint Sweep

下面是 32-episode checkpoint sweep,不是 4-episode 在线 eval。Stable ratio = success >= 87.5% 且 completion >= 95% 的 checkpoint 占比。

v32 checkpoint success 1.0 0.8 0.5 0.2 0.0 hattv3.1a-fixed hattv3.1b-fixed hattv3.2a hattv3.2b hattv3.2c v32 checkpoint episode reward 23.5 -82.6 -188.7 -294.7 -400.8 hattv3.1a-fixed hattv3.1b-fixed hattv3.2a hattv3.2b hattv3.2c
VariantNBest epBest succBest rewardBest compLast epLast succLast rewardLast compStable ratio
hattv3.1a-fixed15ep00010093.8%9.7599.4%ep00139984.4%6.1892.2%40.0%
hattv3.1b-fixed16ep00099996.9%14.7899.7%ep00149965.6%-19.5495.6%37.5%
hattv3.2a16ep00149996.9%15.6899.7%ep00149996.9%15.6899.7%31.2%
hattv3.2b16ep000299100.0%18.18100.0%ep00149987.5%-45.6595.0%68.8%
hattv3.2c16ep00060096.9%23.4899.7%ep00149993.8%9.2799.4%62.5%

TensorBoard 训练曲线

训练曲线用于判断后段趋势。可以看到 eval success 有跳变,reward/episode 后段差异没有单个 last eval 那么极端,这支持“best 强、后期弱与环境噪声强相关”的判断。

v32 TensorBoard reward/episode 68.8 4.3 -60.2 -124.7 -189.1 hattv3.1a-fixed hattv3.1b-fixed hattv3.2a hattv3.2b hattv3.2c v32 TensorBoard online eval/success 1.0 0.8 0.5 0.2 0.0 hattv3.1a-fixed hattv3.1b-fixed hattv3.2a hattv3.2b hattv3.2c

4-Episode Best/Latest 辅助表

这些是训练中保存的 best/latest,episode 数较少,只作为辅助,不作为最终排名。

RunBest epBest succBest rewardLatest epLatest succLatest reward
20260628-0357_macf_hatt-v31-small-scale/hattv3.1a_full-random799100.0%29.981499100.0%19.67
20260628-0357_macf_hatt-v31-small-scale/hattv2.0_full-random899100.0%18.381399100.0%11.60
20260628-0357_macf_hatt-v31-small-scale/mappo_full-random1300100.0%13.69149975.0%-38.15
20260628-0357_macf_hatt-v31-small-scale/hattv3.0a_full-random1099100.0%24.141399100.0%-8.95
20260628-0357_macf_hatt-v31-small-scale/hattv3.1b_full-random1000100.0%36.361399100.0%-4.43
20260628-1043_macf_hatt-v31-fixed-small-scale/hattv3.1a-fixed_full-random599100.0%22.84149950.0%-35.71
20260628-1043_macf_hatt-v31-fixed-small-scale/hattv2.0_full-random599100.0%18.171499100.0%-4.78
20260628-1043_macf_hatt-v31-fixed-small-scale/mappo_full-random199100.0%-13.0830050.0%-60.00
20260628-1043_macf_hatt-v31-fixed-small-scale/hattv3.0a_full-random19975.0%1.5519975.0%1.55
20260628-1043_macf_hatt-v31-fixed-small-scale/hattv3.1b-fixed_full-random999100.0%29.37139975.0%-79.30
20260629-0104_macf_hatt-v32-small-scale/hattv3.1a-fixed_full-random799100.0%29.251399100.0%18.64
20260629-0104_macf_hatt-v32-small-scale/hattv2.0_full-random10.0%-139.6610.0%-139.66
20260629-0104_macf_hatt-v32-small-scale/hattv3.2c_full-random300100.0%28.69149975.0%-22.37
20260629-0104_macf_hatt-v32-small-scale/hattv3.2b_full-random599100.0%29.491499100.0%-33.17
20260629-0104_macf_hatt-v32-small-scale/mappo_full-random10.0%-245.9810.0%-245.98
20260629-0104_macf_hatt-v32-small-scale/hattv3.2a_full-random1399100.0%24.811499100.0%15.10
20260629-0104_macf_hatt-v32-small-scale/hattv3.1b-fixed_full-random1400100.0%22.91149950.0%-54.51

代际评价

建议