Coalition Delivery Reward Shaping 评估
训练组:runs/20260702-1104_coalition_delivery_reward-shaping-small-scale。独立评估:64 个 full_random deterministic episodes,输出目录 runs/eval/reward-shaping-64eval_20260702-174336。
核心判断
新奖励不是只改变了 reward 数值尺度,而是明显改变了可学习性:MAPPO 稳定提升,HATT v2.0 从几乎不可用跃迁到接近 MAPPO,新版 HATT v3.1a 也有改善但仍显著落后。
87.5%MAPPO shaped best success
82.8%HATT v2.0 shaped best success
56.2%HATT v3.1a shaped best success
64-Episode Eval 汇总
| 模型 / checkpoint | success | completion | sent | discover | reward | reward std | len | dead |
|---|---|---|---|---|---|---|---|---|
| MAPPO old best | 70.3% | 94.4% | 95.8% | 98.9% | 40.3 | 33.2 | 621.0 | 0.50 |
| MAPPO old latest | 79.7% | 94.7% | 95.3% | 99.2% | 40.8 | 67.9 | 610.0 | 0.67 |
| MAPPO shaped best | 87.5% | 98.3% | 99.2% | 100.0% | 55.7 | 20.1 | 574.3 | 0.50 |
| MAPPO shaped latest | 82.8% | 96.7% | 98.3% | 100.0% | 52.0 | 24.2 | 584.3 | 0.56 |
| HATT v2.0 old best | 15.6% | 71.3% | 72.8% | 93.1% | -0.7 | 58.9 | 709.2 | 0.56 |
| HATT v2.0 old latest | 4.7% | 66.7% | 66.4% | 96.2% | 5.3 | 46.8 | 735.3 | 1.14 |
| HATT v2.0 shaped best | 82.8% | 97.8% | 98.5% | 100.0% | 66.9 | 18.1 | 585.0 | 0.45 |
| HATT v2.0 shaped latest | 20.3% | 71.7% | 74.3% | 98.6% | 12.3 | 41.3 | 699.8 | 1.00 |
| HATT v3.1a old best | 6.2% | 54.7% | 56.7% | 85.3% | -28.2 | 91.9 | 741.7 | 1.31 |
| HATT v3.1a old latest | 17.2% | 76.7% | 78.9% | 98.9% | 28.4 | 35.4 | 704.3 | 1.14 |
| HATT v3.1a shaped best | 56.2% | 91.3% | 94.6% | 100.0% | 29.7 | 55.5 | 630.1 | 1.25 |
| HATT v3.1a shaped latest | 32.8% | 83.3% | 88.3% | 100.0% | 38.1 | 35.6 | 663.1 | 0.59 |
读数解释
- MAPPO:新奖励带来稳定增益,best success 从 70.3% 到 87.5%,latest 也保持在 82.8%。这说明 reward shaping 没有只制造偶然 checkpoint,而是改善了训练后的策略质量。
- HATT v2.0:新奖励收益最大,best 从 15.6% 到 82.8%。这强烈支持之前判断:旧版 coalition_delivery 主要卡在奖励和信用分配,而不是模型完全学不了。
- HATT v2.0 latest:从 82.8% 掉到 20.3%,说明后期策略退化仍然存在。这里不是评估噪声可以解释的,应该继续查 PPO 更新稳定性、熵退火、checkpoint selection 和 value/reward scale。
- HATT v3.1a:新奖励有效,但 best 只有 56.2%,latest 32.8%。它不是完全失败,但当前结构或实现明显没有吃到新任务的收益,优先级低于 HATT v2.0 的稳定化。
- 发现率在 shaped 组基本都是 100%,失败主要不再是找不到任务,而是后续分配、补给、死亡和时序控制没有稳定闭环。
下一步建议
- 短期用 MAPPO shaped 和 HATT v2.0 shaped best 作为对照基线,不建议用 latest 直接比较模型能力。
- 对 HATT v2.0 shaped 的 best/latest 做 hard-seed trace,对比失败回合里的 deliver、resupply、idle、death、coalition change 分布,确认后期退化的具体行为模式。
- 保留当前 reward shaping 方向,但不要再用 action mask 做引导;mask 只保留非法动作屏蔽。
- 算法侧优先尝试更保守的 PPO 更新:更小 clip、target KL early stop 或熵系数退火,而不是继续堆任务奖励项。