jitter / full_random / curriculum 训练方式对比

三种 reset 方式定义
方式 定义 目的
jitter 首次 reset 保存基础环境,后续只在基础环境上抖动任务位置 降低训练方差,让智能体先学习固定地图布局
full_random 每次 episode 完全重新随机生成地图、任务、智能体位置 提升泛化能力,但训练难度更大
curriculum 训练前期用 jitter,到指定 episode 后切换到 full_random 先用简单环境稳定学习,再逐步增加难度
curriculum 切换示意: jitter ─────────────────────────────┐ ↓ curriculum_switch_ep full_random ────────────────────────┘
---
Small-scale 结果(4 UAV + 8 UGV + 10 任务)

来源:runs/20260626-1825_macf_small-scale/eval_results/small-scale-eval_20260627-111300/summary.csv

HATT v2.0

training reset eval reset success reward length completion sent%
jitter full_random 1.000 +17.06 401.9 1.000 1.000
full_random full_random 0.969 +19.62 399.8 0.991 0.994

MAPPO

training reset eval reset success reward length completion sent%
jitter full_random 0.844 -0.81 433.8 0.959 0.970
full_random full_random 0.500 -371.70 589.1 0.803 0.803
结论:small-scale 上,HATT v2.0 在 jitter 和 full_random 下都接近 100% 成功且 reward 为正;MAPPO 在 full_random 下仅 50% 成功且 reward -371,说明 MAPPO 对完全随机环境泛化很差。
---
Mid-scale 结果(10 UAV + 20 UGV + 25 任务)

来源:runs/20260626-0041_MyEnv_mid-260626/eval_results/macf-mid-260626-eval_20260626-160854/summary.csv

方法 training reset eval reset success reward length completion sent%
HATT v2.0 jitter full_random 1.000 +41.11 493.9 1.000 1.000
HATT v2.0 full_random full_random 1.000 +44.72 474.5 1.000 1.000
MAPPO jitter full_random 0.938 -96.08 659.1 0.970 0.974
MAPPO full_random full_random 0.875 -204.81 766.6 0.986 0.985
结论:mid-scale 下 HATT v2.0 仍保持 100% 成功且 reward 为正;MAPPO 成功率下降到 87.5–93.8%,reward 为 -96 到 -204。规模越大,HATT 优势越明显。
---
Curriculum 结果(与直接 full_random 对比)

来源:runs/20260625-1242_MyEnv_v4-curriculum+full_random/eval_results/macf-sweep-v4-eval_20260625-193045/summary.csv

设置:small-scale,curriculum 在指定 episode 后从 jitter 切换到 full_random。

方法 training reset eval reset success reward length completion sent%
HATT v2.0 curriculum full_random 0.219 -56.84 681.3 0.744 0.830
HATT v2.0 full_random full_random 0.938 +14.43 521.8 0.991 0.998
MAPPO curriculum full_random 0.656 -109.84 610.6 0.925 0.932
MAPPO full_random full_random 0.969 +1.41 521.5 0.997 0.999
注意:这个 curriculum 实验结果比较反常——curriculum 模式比直接 full_random 差很多。可能原因: 因此目前数据表明:直接 full_random 训练优于该 curriculum 配置。
---
汇总:三种训练方式对比

Small-scale 最终对比(推荐展示)

方法 jitter full_random curriculum
HATT v2.0 success 1.000 0.969 0.219
HATT v2.0 reward +17.06 +19.62 -56.84
MAPPO success 0.844 0.500 0.656
MAPPO reward -0.81 -371.70 -109.84

结论

  1. jitter:训练最稳定,HATT 和 MAPPO 都容易收敛,但泛化到 full_random 可能稍弱。
  2. full_random:HATT 能直接学好泛化;MAPPO 在 small-scale 还能部分成功,但在 mid-scale 大幅退化。
  3. curriculum:当前配置效果不佳,可能切换时机或切换后训练不足,需要进一步调参。
PPT 建议:如果想突出 HATT 的鲁棒性,重点放 full_random 结果——HATT 在 small 和 mid 规模都保持 96.9–100% 成功且 reward 为正,MAPPO 则随规模增大迅速恶化。