Coalition Delivery Reward Shaping 评估

训练组:runs/20260702-1104_coalition_delivery_reward-shaping-small-scale。独立评估:64 个 full_random deterministic episodes,输出目录 runs/eval/reward-shaping-64eval_20260702-174336

核心判断

新奖励不是只改变了 reward 数值尺度,而是明显改变了可学习性:MAPPO 稳定提升,HATT v2.0 从几乎不可用跃迁到接近 MAPPO,新版 HATT v3.1a 也有改善但仍显著落后。

87.5%MAPPO shaped best success
82.8%HATT v2.0 shaped best success
56.2%HATT v3.1a shaped best success

64-Episode Eval 汇总

模型 / checkpoint success completion sent discover reward reward std len dead
MAPPO old best70.3%94.4%95.8%98.9%40.333.2621.00.50
MAPPO old latest79.7%94.7%95.3%99.2%40.867.9610.00.67
MAPPO shaped best87.5%98.3%99.2%100.0%55.720.1574.30.50
MAPPO shaped latest82.8%96.7%98.3%100.0%52.024.2584.30.56
HATT v2.0 old best15.6%71.3%72.8%93.1%-0.758.9709.20.56
HATT v2.0 old latest4.7%66.7%66.4%96.2%5.346.8735.31.14
HATT v2.0 shaped best82.8%97.8%98.5%100.0%66.918.1585.00.45
HATT v2.0 shaped latest20.3%71.7%74.3%98.6%12.341.3699.81.00
HATT v3.1a old best6.2%54.7%56.7%85.3%-28.291.9741.71.31
HATT v3.1a old latest17.2%76.7%78.9%98.9%28.435.4704.31.14
HATT v3.1a shaped best56.2%91.3%94.6%100.0%29.755.5630.11.25
HATT v3.1a shaped latest32.8%83.3%88.3%100.0%38.135.6663.10.59

读数解释

下一步建议