# HATT / MAPPO 阶段性研究进度报告

报告区间：2026-06-28 至 2026-08-22 13:17（Asia/Shanghai）  
证据来源：`CHANGELOG.yaml`、git 提交、实验状态文件、独立评估结果、阶段交接文档。  
重要性采用 10 分制：9–10 表示决定研究结论或正式实验可信度，7–8.5 表示重要机制或对照，5–6.5 表示辅助研究与工程保障。

## 一、当前结论摘要

1. DelivCoal 当前协议下，HATT v2.0 的性能优势已经得到五个训练 seed、固定 validation、128-seed held-out test 和最后 10% 逐 checkpoint 评估的共同支持。HATT full 的 validation-best success 为 72.2%，MAPPO-288 为 22.8%，MAPPO-64 为 10.2%。最后 10% success 分别为 75.5%、5.1%、3.7%。
2. MAPPO actor 参数量不足的解释已经被证伪。MAPPO-288 与 HATT actor 参数量相差约 4.5%，性能差距持续存在。
3. HATT 的任务槽置换等变性得到实验支持。Deliver 槽位置换未改变 HATT 结果，Explore 槽位置换对 HATT 影响很小。MAPPO 的 Explore 置换 success 从约 14.6% 降至约 2.6%。
4. Coverage search-state 是环境端观测表示，也是当前 HATT 性能的重要条件。共同 seed 的 held-out validation-best 中，HATT full 为 70.8%，no-coverage 为 33.9%，geometry-only 为 31.5%。Geometry 提供有限增益，coverage state 提供主要增益。当前 coverage 汇总全队探索历史，部署假设需要明确。
5. Coalition context 是 HATT 算法端的 task-indexed structured actor 组件，并获得稳定的中等强度证据。HATT full 与 no-coalition 的 validation-best 为 72.2% 与 61.9%，最后 10% 为 75.5% 与 58.9%。
6. HATT v2.0 全局 AA attention 的独立增益没有得到支持。no-AA 的 validation-best、last 和最后 10% success 分别为 69.2%、69.2%、76.5%；full 对应 72.2%、65.2%、75.5%。
7. 上述 no-AA 结果只评价 v2.0 的全局、任务无关 AA 实现。该实现的注意力熵接近最大值，关系选择较弱。agent-agent 关系价值没有被该实验否定。
8. Event 规则具备清晰的决策语义。Always reconfiguration 明显降低训练表现。Event 相对 legacy 的任务成功优势没有得到稳定证据。
9. Learned reconfiguration gate 的性能增益已被多种子实验和同 checkpoint 干预否定。mixture、switch、hierarchical、显式事件上下文和重选成本均未稳定提高任务成功率。
10. CapCoal 中规模 legacy 设置显示 HATT 的完成效率和训练后期保持能力更好。GymRT2A 尚无有效算法性能结果。跨环境普遍优势仍待统一协议确认。

## 二、时间线与阶段评估

| 日期 | 改动与实验 | 是否有效 | 主要证据 | 证明、证伪或边界 | 重要性 |
|---|---|---|---|---|---:|
| 06-28 至 06-29 | 建立 HATT v3.0、v3.1、v3.2；加入候选加入变化、成员交互、过渡信息和诊断量；重写 PCFA 基线。 | 工程有效；性能结论不足 | 旧环境 32-episode 结果中，v3.0a success 0.9375，v2.0 为 0.9063；v3.0b 为 0.4375；v3.0c 为 0.7813。v3.2 还出现 utility-loss shape 问题和不完整实验。 | 候选加入变化具有继续研究价值。复杂残差和成员分支没有获得稳定证据。早期结果不适用于当前 DelivCoal 协议。 | 8.0 |
| 06-29 至 07-03 | 引入 sector/survey 探索、`coalition_delivery` 场景、PPO KL/clip early stopping 和配送 reward shaping。 | 建模有效；初版 sector 无法完成任务 | sector 初版中 HATT、MAPPO success 均为 0。到达 waypoint 和发现任务后的重新决策修复后，HATT best 约 29.2%，MAPPO best 约 16.7%。 | “初版 sector 已可学习”被证伪。重新决策时机属于必要的环境语义修复。 | 9.0 |
| 07-03 至 07-08 | 将环境拆分为 CapCoal 与 DelivCoal；增加 HATT v2.4–v2.7、任务类型处理、动态服务聚合、局部 credit、potential shaping 和 CapCoal requirement 表征。 | 部分有效 | CapCoal 中 HATT 可达到高成功率。DelivCoal 的若干 best checkpoint 改善，latest 多次退化。`demand4` 等 requirement 表征显著影响 CapCoal。 | 两类环境需要分别分析。单个 reward 版本和单个 best checkpoint无法说明结构有效性。v2.4–v2.7 未形成稳定统一方案。 | 9.0 |
| 07-17 | 增加 task-type 行为指标、训练期评估与独立评估对齐、checkpoint 关系分析。 | 有效 | 训练期多 seed eval 与 32-seed 独立 eval 的关系明显高于单局 reward/length。best 与 latest 的差异被重复观察。 | 单局训练 reward 不能可靠选择 checkpoint。模型选择需要固定多 seed validation。 | 9.0 |
| 07-19 | 接入 GymRT2A 适配器、空间候选 HATT actor和 MARL-MRT2A 官方复现入口。 | 工程部分有效；性能未验证 | 适配器 smoke 可执行。官方复现耗时较长。近期本地六个 job 在 runner 返回值解包处失败。 | 当前没有 GymRT2A 上的 HATT/MAPPO 有效性能比较。失败属于接口问题。 | 7.0 |
| 07-21 至 07-23 | 增加 raw、physics、task-attention、resource、set-context、no-idle 信息路径；加入 Idle-25 有限等待和配送分配诊断。 | 诊断有效；多个结构结论未完成多 seed 确认 | 旧 nearest 设置中 base best/last 为 31.2%/12.5%，raw 为 31.2%/6.2%，physics 为 53.1%/6.2%，resource 为 90.6%/78.1%，set-context 为 84.4%/71.9%。Idle-25 best 约 77.1%，No-Idle best 约 87.8%，MAPPO约 90%。 | “HATT 只因编码后丢失原始输入而变差”没有证据。raw bypass 没有改善。载荷阶段、候选集合和特殊动作语义具有更直接的影响。单次 Idle 无限持续是主因的命题被证伪。 | 8.5 |
| 07-24 至 07-28 | 分离特殊控制动作与 Deliver 联盟聚合；修复 sector waypoint/event redecision 和无效边界方向；统一训练进度和 checkpoint 状态。 | 有效，适用范围有限 | 早期 nearest 设置中 detached 三 seed best 均值约 87.5%，原 HATT v2.0 约 50%。detached 的任务槽置换结果完全一致。sector redecision 将 HATT best 从 0 提高到约 29.2%。 | 特殊动作污染在早期设置中得到支持。detached 在后续 coverage/event 设置中表现较差，该改动不具备跨协议稳定收益。 | 9.5 |
| 07-29 至 07-30 | 增加 observer-relative sector goal、leg distance、coverage 网格、novel coverage、remaining unexplored；比较前馈、RNN 和 coverage。 | 明显有效 | HATT+coverage best success 约 74.5%，HATT+RNN 约 24.2%，HATT+coverage+RNN 约 70.3%，MAPPO+coverage 约 4.4%。HATT+coverage 发现率约 98.2%，任务完成率约 96.9%。 | 显式 coverage 对当前 HATT 有重要作用。RNN 无法替代缺失的探索状态。该阶段的 coverage 开关同时包含 geometry 和 coverage state，独立贡献当时尚未分离。 | 10.0 |
| 07-30 | 对已有 HATT+coverage checkpoint执行 all-discovered 和 delivery-only 条件评估。 | 有效 | all-discovered deterministic success 约 94.8%。delivery-only deterministic 为 64.1%，stochastic 为 80.7%。 | Coverage 的主要作用位于搜索观测和搜索调度。已知任务条件下的配送能力较强。屏蔽 Explore 会改变整体动作分布，delivery-only 结果不能单独评价 Deliver 编码。 | 8.0 |
| 07-31 至 08-01 | 将 Idle 时间成本改为 uniform；构造延迟任务、不同待命位置和服务承诺诊断。 | 建模有效；预留运力主张未成立 | HATT best success 从旧时间成本约 13.3%提高到约 27.3%。策略没有选择 Idle。原地 reserve 在 1024 个配对场景中仅31.8%更快，总完成时间平均增加2.68 step；中心待命在57.9%场景更快。 | Idle 额外惩罚属于不合理奖励偏置。取消偏置没有使策略学会预留运力。原地预留运力普遍提高效率的命题被证伪。 | 7.5 |
| 08-01 至 08-05 | 实现 legacy、always、periodic、event、urgency 和 learned reconfiguration；依次测试 mixture、switch、hierarchical、显式上下文、gate action replay 和重选成本。 | Event 可用；learned gate 未获得性能收益 | 三 seed 中 event 与 legacy整体较稳。learned gate降低单次决策的实际换任务比例，成功率没有提高。hierarchical cost0.05 的单 seed优势未在 seed2/3复现。event-only best约23.2%，event-or-learned约18.5%。force-closed success为0。 | Learned gate 提高任务成功率的命题被证伪。Always/force-closed 均不可用。Event 适合作为固定决策规则。 | 9.0 |
| 08-05 至 08-09 | 完成 detached×coverage 因子实验、matched MAPPO64、MAPPO204、参数量匹配 MAPPO288、seed4/5 扩展和任务槽置换。 | 明显有效 | HATT coverage/event 五 seed best/p90/last success 为68.0%/63.1%/63.9%；MAPPO64 为11.9%/1.1%/2.5%；MAPPO288 为8.1%/3.4%/5.8%。HATT actor约262,341参数，MAPPO288约250,530。HATT Deliver置换差值为0。 | 参数量解释被证伪。任务槽记忆解释被证伪。HATT 在当前协议下的结构优势得到高置信证据。detached 的早期收益未在新协议中复现。 | 10.0 |
| 08-10 至 08-13 | 重建中规模 CapCoal：30 agents、25 tasks、1500 steps、random demand；修复交叉评估 guard 和场景配置继承。 | 有效 | legacy 有效恢复评估中，HATT best/p90/last success 为99.5%/97.4%/97.9%，MAPPO为100%/75.3%/81.0%。HATT best平均约462 steps，MAPPO约659 steps。一次错误的小场景评估已作废。 | CapCoal 中 HATT 的优势主要体现在效率和训练后期保持。all-visible 设置接近满分，方法区分能力低。正式统一新协议结果仍待补充。 | 8.5 |
| 08-13 至 08-17 | 建立本地 QMIX、VDN、HATT-QMIX；修复更新单位、RNN hidden、active/alive mask、constrained target 和 event-SMDP；增加更新强度与 reward scale 筛选。 | 工程有效；性能较弱 | 首批45个 checkpoint success全为0。修复后普通 QMIX `u4-r10` best success约9.4%、完成率67.8%。HATT-QMIX `u4-r10` 两 seed 均值12.9%，单 seed分别为0%与25.8%。team-mean HATT-MAPPO best约7.0%，原个体 shaped reward约74.6%。 | 值分解方法当前没有接近 HATT-MAPPO。更新强度解释普通 QMIX 的部分弱势。个体 shaped reward与 focal advantage 是当前 HATT-MAPPO 性能的重要条件。 | 8.0 |
| 08-17 | 固定正式评估协议：每50 episode×32 validation seeds；锁定 validation-best；validation-best/last×128 held-out test；最后10%逐 actor评估；分阶段进度记录。 | 设计有效；实现随后完成 | 协议明确分离模型选择、末期稳定性和最终泛化测试。进度统计保留 planned/submitted/completed/missing。 | 旧 best/p90/last 结果继续作为历史证据。正式论文结果需要采用锁定 validation-best 与 held-out test。 | 9.5 |
| 08-18 至 08-19 | 启动 DelivCoal 37-job 正式训练矩阵；完成15个 OOM job recovery；保存逐 episode actor。 | 工程有效；训练期方向有效 | 合并后37/37训练完成，54,197个逐 episode actor。末期训练 HATT full sent 0.888、reward54.08；MAPPO64为0.820、31.40；MAPPO288为0.825、40.48。Always sent 0.498、reward−22.98。 | OOM 恢复完整。训练末期统计只用于方向检查。Always reconfiguration 的损害得到再次确认。 | 9.0 |
| 08-19 至 08-20 | 在当前 DelivCoal 协议下训练 HATT v3.2R full、no-transition、no-member，各3 seeds。修正保持动作与 source-leave/target-join 表示。 | 工程有效；member增益未确认 | 9/9训练完成。full没有稳定超过 no-member。member gate从0.5移动到约0.507–0.509。Deliver candidate约占全部 task slot的4%–5%。该组未执行正式 held-out test。 | 当前 member residual 的独立性能增益没有证据。该结果不评价全局AA；`no-member`保留v2全局AA。v3.2R不具备替代v2.0的证据。 | 8.0 |
| 08-20 至 08-21 | 拆分 observer-relative geometry 与 coverage state；训练 HATT/MAPPO geometry-only和 HATT no-AA+no-coalition；恢复31个正式 job的 periodic validation与held-out测试。 | 明显有效 | 三共同 seed validation-best：HATT full 70.8%，no-coverage 33.9%，geometry-only 31.5%；MAPPO full 8.3%，no-coverage 12.8%，geometry-only 17.4%。joint消融为57.8%。 | Geometry无法解释 coverage的大部分收益。HATT在无coverage条件下仍保留结构优势。joint消融损失主要来自coalition context。 | 10.0 |
| 08-21 至 08-22 | 完成正式 held-out评估和最后10%逐 checkpoint补评。 | 完成且有效 | Held-out：HATT full validation-best/last为72.2%/65.2%，MAPPO288为22.8%/5.9%，MAPPO64为10.2%/1.1%。最后10%：HATT full 75.5%，no-AA 76.5%，no-coalition 58.9%，MAPPO288 5.1%，MAPPO64 3.7%。40/40 final-window job完成；46,568/48,000评估单元完成；1,432个缺失单元来自未保存的中间 actor。 | HATT相对MAPPO、coverage作用和coalition context作用获得正式协议证据。v2全局AA独立增益没有得到支持。MAPPO后期性能下降明显。 | 10.0 |
| 08-22 | 诊断AA未生效原因；实现HATT v3.3AA同构typed AA/AT边；设计learned-AA与uniform-AA配对训练和同checkpoint learned/uniform/zero干预。 | 实现与冒烟有效；性能评估进行中 | v2 AA entropy约2.279–2.345，理论最大值为2.398；v3.2R约2.314–2.387。query/key变化低于value/output。新网络6项专项测试通过，learned和uniform各3 episode冒烟通过。正式6-job sweep已启动。 | 当前证据支持“旧AA学成接近均匀的全局聚合”。新typed-edge AA是否提高性能尚无结果。 | 9.0 |

## 三、关键命题的证据状态

| 命题 | 当前状态 | 证据强度 | 准确表述 |
|---|---|---|---|
| 当前 DelivCoal 协议中 HATT 优于 MAPPO | 已确认 | 高 | 五训练 seed、128-seed held-out 和最后10%评估方向一致。 |
| 优势来源于更多参数 | 已证伪 | 高 | MAPPO288参数量接近HATT，性能明显较低。 |
| 优势来源于固定任务槽顺序 | 已证伪 | 高 | HATT对Deliver/Explore槽位置换稳定。 |
| Coverage search-state改善HATT | 已确认 | 高 | matched held-out与final-window均显示约30个百分点以上差距。 |
| Observer-relative geometry解释全部coverage收益 | 已证伪 | 高 | geometry-only与no-coverage接近，均明显低于full。 |
| Coalition context提供增益 | 已确认 | 中高 | 五seed held-out和末期窗口均下降，幅度约10–17个百分点。 |
| v2全局AA提供独立增益 | 未确认 | 高置信负结果 | full与no-AA在三种口径接近，方向不一致。 |
| agent-agent关系没有价值 | 无法判断 | 无直接证据 | 现有no-AA只关闭任务无关全局AA。新typed AA/AT实验正在检验。 |
| Event性能稳定高于legacy | 未确认 | 中 | Event语义清晰，任务指标没有稳定超过legacy。 |
| Learned gate提高任务结果 | 已证伪 | 高 | 多种参数化、多seed和同checkpoint干预均未显示收益。 |
| 提高Idle比例可形成有效reserve | 已证伪，限当前动力学 | 高 | 原地reserve平均完成更慢，结果依赖待命位置和服务承诺。 |
| HATT在CapCoal中更优 | 部分确认 | 中高 | 中规模legacy显示效率和后期保持优势；统一新协议尚未完成。 |
| HATT可泛化到GymRT2A | 未验证 | 无有效性能证据 | 当前只有适配器smoke和接口失败记录。 |
| HATT结构单独决定性能 | 已证伪 | 中高 | team-mean reward显著降低HATT-MAPPO，性能依赖结构、可观测状态和个体credit共同作用。 |

## 四、当前方法定位

当前证据最充分的方法描述为：

> 使用observer-relative exploration-state representation、task-wise shared candidate scorer和task-indexed coalition context的结构化Actor，在event-triggered动态联盟任务分配中学习agent-to-task assignment。

各组成部分的证据等级：

| 组成部分 | 当前评价 |
|---|---|
| Task-wise shared candidate scorer与任务槽等变性 | 高置信结构证据；独立性能贡献尚未完全拆分 |
| Task-indexed coalition context | 算法端结构；中高置信正贡献 |
| Coverage search-state | 环境端观测表示；对HATT为高置信正贡献 |
| Observer-relative geometry | 小到中等贡献 |
| Event reconfiguration | 决策语义有效；相对legacy性能优势未确认 |
| Individual shaped credit | 高重要性条件 |
| v2 global AA | 高置信负结果，限当前实现 |
| v3.2R member residual | 负结果，正式held-out证据缺失 |
| v3.3 typed AA/AT | 正在评估 |

## 五、当前运行状态与下一检查点

HATT v3.3AA正式实验目录：`runs/20260822-1223_delivcoal_hatt-v33aa-focused`。

- learned-AA：3个训练seed。
- uniform-AA：3个训练seed。
- 每50 episode执行32-seed validation。
- validation-best和last分别执行128-seed held-out test。
- learned validation-best执行learned、uniform、zero同checkpoint干预。
- 截止13:17，4个job运行，2个job等待；运行job约33–35/1500 episode；GPU1占用20.34 GiB；无OOM和数值异常。

该实验需要回答两个问题：

1. learned AA相对uniform AA是否提高任务指标和训练稳定性。
2. 同一checkpoint切换AA gate后，动作分布和联盟候选排序是否发生一致变化。

判定规则已经预先固定。learned与uniform采用相同拓扑、参数量、成员信息和AT计算。性能差异可归因于AA关系门的学习能力。同checkpoint干预用于测量已训练策略对AA的即时依赖。

## 六、证据边界

1. 旧五seed `best/p90/last` 数字属于旧模型选择协议。2026-08-21完成的validation-best/last held-out结果属于当前更严格协议。
2. 最后10%评估以逐checkpoint、每checkpoint固定8 seeds统计训练末期分布。该统计不代表单一可部署模型。
3. Final-window计划量48,000，实际完成46,568。缺失1,432个单元对应179个未保存actor。缺失比例约3.0%，状态文件保留完整计划分母。
4. v3.2R只有训练结果和内部诊断，没有正式held-out测试。
5. v3.3AA当前只有实现验证、冒烟结果和进行中的正式训练。当前报告不评价其性能。
6. CapCoal与DelivCoal支持不同性能维度。GymRT2A尚无有效结果。现阶段不声明跨任务普遍优势。
7. 当前 coverage 使用全队共享的 `_explored_cells`，candidate novel coverage 和 remaining unexplored 均依赖该全局搜索历史。完全去中心化部署需要共享地图、地图融合或通信机制作为实现条件。

## 七、Coverage与coalition context的归属

### 7.1 Coverage search-state

Coverage 由DelivCoal环境维护并写入actor observation。环境在连续地图上建立coverage网格，沿所有智能体的实际移动与感知线段更新 `_explored_cells`，再为每个observer的sector candidate生成executable goal、leg distance、novel coverage和remaining unexplored。该功能不直接修改配送动力学和reward coefficient。

因此，coverage的准确定位是：

> observer-relative exploration-state representation / observability repair

它属于环境端观测建模，也属于完整任务求解系统。它不属于HATT网络算法。HATT与MAPPO在matched实验中接收相同coverage字段，因此HATT/MAPPO的算法比较保持输入公平。

当前实现包含一项部署假设：`_explored_cells` 汇总全队搜索历史，remaining unexplored也是全局量。该信息等价于全队共享coverage map。论文需要明确地图共享来源，并通过global-shared、local-only和communication-fused coverage对照测量依赖程度。

现有证据支持以下表述：

> Coverage-aware observation substantially improves HATT performance in DelivCoal.

共同seed的validation-best中，HATT full、no-coverage、geometry-only分别为70.8%、33.9%、31.5%。MAPPO对应结果为8.3%、12.8%、17.4%。Coverage没有形成跨算法一致增益，当前证据支持architecture × observation interaction。HATT在无coverage条件下仍高于对应MAPPO，no-coverage差值为21.1个百分点，geometry-only差值为14.1个百分点。

### 7.2 Task-indexed coalition context

环境在`ego/others`中提供当前coalition ID。MAPPO可直接读取这些原始字段。HATT将coalition ID用于任务槽路由，把当前成员的hidden representation按task slot聚合为coalition sum、mean、count，并把对应联盟上下文注入每个candidate task context。该聚合与融合属于算法端structured actor。

现有no-coalition消融关闭显式sum/mean/count注入，保留AA边中的same-coalition关系和focal assigned关系。该实验隔离显式task-indexed coalition context，未删除全部联盟信息。

现有证据支持以下表述：

> Explicit task-indexed coalition context provides an additional performance gain within HATT.

Full相对no-coalition的validation-best增加10.3个百分点，最后10%增加16.6个百分点。No-coalition仍显著高于MAPPO。显式coalition context解释HATT总差距的一部分。

## 八、近期文献审计

本节检索截至2026-08-22。期刊“一区”采用2024 JCR口径；中科院分区和SJR分区未混用。IEEE Robotics and Automation Letters、IEEE Transactions on Neural Networks and Learning Systems、IEEE Internet of Things Journal、Engineering Applications of Artificial Intelligence和Journal of Manufacturing Systems在该口径下均为Q1。

| 工作 | 发表与代码 | 与当前工作的关系 | 处理建议 |
|---|---|---|---|
| [Learning Policies for Dynamic Coalition Formation in Multi-Robot Task Allocation](https://arxiv.org/abs/2412.20397) | RA-L 2025，JCR Q1；[官方代码](https://github.com/lcdbezerra/marl_mrt2a) | MAPPO、动态coalition、部分可观测、空间动作、任务重选和意图共享；对应本工程GyMRT2A | 完成官方复现和本地HATT比较，列为最高优先级外部benchmark |
| [Heterogeneous Multi-robot Task Allocation and Scheduling via Reinforcement Learning](https://marmotlab.org/publications/73-RAL2025-HetMRTA.pdf) | RA-L 2025，JCR Q1；[官方代码](https://github.com/marmotlab/HeteroMRTA) | 异构skills、task requirements、同步到达、动态联盟、agent/task cross-attention、共享task selector | 最适合验证coalition-conditioned candidate scorer和跨规模泛化 |
| [Dynamic Coalition Formation and Routing for Multirobot Task Allocation via Reinforcement Learning](https://www.marmotlab.org/publications/56-ICRA2024-MRTA.pdf) | ICRA 2024；[官方代码](https://github.com/marmotlab/DCMRTA) | task/agent encoder、cross-attention、当前联盟人数、共享task selector；提供CTAS-D和OR-Tools基线 | 用于验证task数量、agent数量和coalition-size泛化 |
| [Multiagent Reinforcement Learning With Heterogeneous Graph Attention Network](https://pubmed.ncbi.nlm.nih.gov/36331648/) | TNNLS 2023，JCR Q1 | agent-level与relation-level heterogeneous attention；在predator-prey和heterogeneous SMAC验证 | 作为近邻关系编码基线或结构实现参照 |
| [MAPG²: Multiagent Policy Gradient via Potential Game for Multirobot Task Allocation Problems](https://ieeexplore.ieee.org/abstract/document/11271511) | IEEE IoT Journal 2026，JCR Q1 | graph attention、potential game、CTDE、多类型任务和资源需求 | 纳入相关工作；代码缺失期间不作为近期必跑项 |
| [A Two-stage Reinforcement Learning-based Approach for Multi-entity Task Allocation](https://arxiv.org/abs/2407.00496) | EAAI 2024，JCR Q1；[官方代码](https://github.com/yk7333/TaskAllocation) | 动态entity/task属性、attention、可变数量和zero-shot generalization；包含4个实验环境 | 作为结构化动态分配补充benchmark，优先级低于两个MRTA环境 |
| [Multirobot collaborative task dynamic scheduling based on MARL with heuristic graph convolution](https://www.sciencedirect.com/science/article/abs/pii/S0278612523002376) | Journal of Manufacturing Systems 2024，JCR Q1 | 多关系图、图卷积、服务性能退化和动态调度 | 场景差异较大，作为相关工作引用 |
| [Learning for Dynamic Subteaming and Voluntary Waiting](https://par.nsf.gov/servlets/purl/10574244) 与 [SADCHER](https://arxiv.org/abs/2510.14851) | ICRA 2024；MRS 2025 | robot/task graph attention、动态subteam、voluntary waiting、bipartite matching和imitation learning | 说明近邻结构与求解范式，时间允许时加入离线调度比较 |

### 8.1 与HATT最接近的已发表结构

近期工作已经覆盖agent/task encoder、cross-attention、共享task selector、当前联盟人数、异构skill requirement、动态图关系、动态任务重选和联盟形成。HATT的论文主张需要收敛到以下可检验结构：

> A coalition-conditioned, task-permutation-equivariant structured actor that injects current coalition composition into every agent-task candidate before shared decoding.

Coverage适合作为观测表示贡献。Event-triggered reconfiguration适合作为决策语义和系统实现。AA/AT typed relation的贡献取决于v3.3AA正式结果。

## 九、建议实验顺序

### 9.1 Coverage信息范围审计

在DelivCoal中比较四种设置：

1. 当前global-shared coverage。
2. 每个智能体独立维护local-only coverage。
3. 只融合通信范围或显式消息可达智能体的communication-fused coverage。
4. Geometry-only。

第一阶段使用HATT三seed筛选，第二阶段对形成明显差异的设置补五seed HATT/MAPPO matched正式评估。该实验用于确定coverage收益、去中心化部署假设和共享信息敏感性。

### 9.2 完成GyMRT2A

当前工程已经引入官方环境、官方MARL-MRT2A、PCFA和HATT spatial actor。2026-08-07的本地六个job在runner返回值解包处失败，尚未产生算法性能证据。

建议比较：

1. 官方MARL-MRT2A U-Net MAPPO。
2. 官方PCFA。
3. 本地参数匹配MAPPO。
4. 当前HATT spatial candidate scorer。
5. HATT spatial + cell/task-indexed coalition context。

当前spatial HATT主要验证空间candidate共享评分和AA聚合。第5项用于把DelivCoal的coalition-conditioned机制迁移到外部环境。所有方法沿用官方局部可观测性、意图共享和任务生成协议，不加入DelivCoal全局coverage字段。

### 9.3 迁移到HeteroMRTA

HeteroMRTA天然包含多维agent skills、多维task requirements、动态联盟、同步到达、等待成本和可变agent/task数量。建议比较官方HeteroMRTA policy、HATT、参数匹配task-agent cross-attention baseline和Greedy；小规模场景加入CTAS-D、SAS或TACO。

主要指标包括success、makespan、平均等待时间、能力浪费、推理时间，以及agent/task数量变化下的zero-shot generalization。该环境对task-indexed coalition context的验证价值最高。

### 9.4 DelivCoal近邻结构基线

增加HeteroMRTA-style task/agent cross-attention actor，保持相同PPO、observation、reward、参数量和checkpoint协议，并移除显式task-indexed coalition aggregation。该比较用于区分一般set/attention encoder、共享candidate scorer和coalition-conditioned candidate context的贡献。

### 9.5 优化与启发式切片

在all-discovered或delivery-only子问题中比较PCFA、Greedy、OR-Tools或CTAS-D，报告solution quality、makespan和推理时间。该切片具有完整任务信息，适合与离线优化器比较。完整DelivCoal包含在线搜索和部分可观测性，不宜直接套用离线solver作为全任务基线。

### 9.6 暂缓项目

SMAC和predator-prey可验证一般关系编码，缺少MRTA与联盟语义。围捕、攻击和新建自定义场景会增加控制与战术协同变量。现阶段优先完成公开MRTA benchmark，外部证据强于新增自定义环境。

## 十、主要证据文件

- `CHANGELOG.yaml`
- `html_logs/hatt_formal_delivcoal_20260818_handoff.md`
- `docs/PROJECT_RESEARCH_HANDOFF_20260817.md`
- `docs/EVALUATION_PROGRESS_HANDOFF_20260817.md`
- `docs/HATT_V33AA_EXPERIMENT_DESIGN_20260822.md`
- `runs/20260821-1045_delivcoal_final-window-evaluation/status.json`
- `runs/20260822-1223_delivcoal_hatt-v33aa-focused/status.json`
- `envs/delivcoal/env_core.py`
- `algorithms/algorithm/HATTV20Network.py`
- `third_party/marl_mrt2a/README.md`
