HATT / MAPPO 阶段性研究进度报告

报告区间:2026-06-28 至 2026-08-22 13:17(Asia/Shanghai)
证据来源:CHANGELOG.yaml、git 提交、实验状态文件、独立评估结果、阶段交接文档。
重要性采用 10 分制:9–10 表示决定研究结论或正式实验可信度,7–8.5 表示重要机制或对照,5–6.5 表示辅助研究与工程保障。

一、当前结论摘要

  1. DelivCoal 当前协议下,HATT v2.0 的性能优势已经得到五个训练 seed、固定 validation、128-seed held-out test 和最后 10% 逐 checkpoint 评估的共同支持。HATT full 的 validation-best success 为 72.2%,MAPPO-288 为 22.8%,MAPPO-64 为 10.2%。最后 10% success 分别为 75.5%、5.1%、3.7%。
  2. MAPPO actor 参数量不足的解释已经被证伪。MAPPO-288 与 HATT actor 参数量相差约 4.5%,性能差距持续存在。
  3. HATT 的任务槽置换等变性得到实验支持。Deliver 槽位置换未改变 HATT 结果,Explore 槽位置换对 HATT 影响很小。MAPPO 的 Explore 置换 success 从约 14.6% 降至约 2.6%。
  4. Coverage search-state 是环境端观测表示,也是当前 HATT 性能的重要条件。共同 seed 的 held-out validation-best 中,HATT full 为 70.8%,no-coverage 为 33.9%,geometry-only 为 31.5%。Geometry 提供有限增益,coverage state 提供主要增益。当前 coverage 汇总全队探索历史,部署假设需要明确。
  5. Coalition context 是 HATT 算法端的 task-indexed structured actor 组件,并获得稳定的中等强度证据。HATT full 与 no-coalition 的 validation-best 为 72.2% 与 61.9%,最后 10% 为 75.5% 与 58.9%。
  6. HATT v2.0 全局 AA attention 的独立增益没有得到支持。no-AA 的 validation-best、last 和最后 10% success 分别为 69.2%、69.2%、76.5%;full 对应 72.2%、65.2%、75.5%。
  7. 上述 no-AA 结果只评价 v2.0 的全局、任务无关 AA 实现。该实现的注意力熵接近最大值,关系选择较弱。agent-agent 关系价值没有被该实验否定。
  8. Event 规则具备清晰的决策语义。Always reconfiguration 明显降低训练表现。Event 相对 legacy 的任务成功优势没有得到稳定证据。
  9. Learned reconfiguration gate 的性能增益已被多种子实验和同 checkpoint 干预否定。mixture、switch、hierarchical、显式事件上下文和重选成本均未稳定提高任务成功率。
  10. CapCoal 中规模 legacy 设置显示 HATT 的完成效率和训练后期保持能力更好。GymRT2A 尚无有效算法性能结果。跨环境普遍优势仍待统一协议确认。

二、时间线与阶段评估

日期 改动与实验 是否有效 主要证据 证明、证伪或边界 重要性
06-28 至 06-29 建立 HATT v3.0、v3.1、v3.2;加入候选加入变化、成员交互、过渡信息和诊断量;重写 PCFA 基线。 工程有效;性能结论不足 旧环境 32-episode 结果中,v3.0a success 0.9375,v2.0 为 0.9063;v3.0b 为 0.4375;v3.0c 为 0.7813。v3.2 还出现 utility-loss shape 问题和不完整实验。 候选加入变化具有继续研究价值。复杂残差和成员分支没有获得稳定证据。早期结果不适用于当前 DelivCoal 协议。 8.0
06-29 至 07-03 引入 sector/survey 探索、coalition_delivery 场景、PPO KL/clip early stopping 和配送 reward shaping。 建模有效;初版 sector 无法完成任务 sector 初版中 HATT、MAPPO success 均为 0。到达 waypoint 和发现任务后的重新决策修复后,HATT best 约 29.2%,MAPPO best 约 16.7%。 “初版 sector 已可学习”被证伪。重新决策时机属于必要的环境语义修复。 9.0
07-03 至 07-08 将环境拆分为 CapCoal 与 DelivCoal;增加 HATT v2.4–v2.7、任务类型处理、动态服务聚合、局部 credit、potential shaping 和 CapCoal requirement 表征。 部分有效 CapCoal 中 HATT 可达到高成功率。DelivCoal 的若干 best checkpoint 改善,latest 多次退化。demand4 等 requirement 表征显著影响 CapCoal。 两类环境需要分别分析。单个 reward 版本和单个 best checkpoint无法说明结构有效性。v2.4–v2.7 未形成稳定统一方案。 9.0
07-17 增加 task-type 行为指标、训练期评估与独立评估对齐、checkpoint 关系分析。 有效 训练期多 seed eval 与 32-seed 独立 eval 的关系明显高于单局 reward/length。best 与 latest 的差异被重复观察。 单局训练 reward 不能可靠选择 checkpoint。模型选择需要固定多 seed validation。 9.0
07-19 接入 GymRT2A 适配器、空间候选 HATT actor和 MARL-MRT2A 官方复现入口。 工程部分有效;性能未验证 适配器 smoke 可执行。官方复现耗时较长。近期本地六个 job 在 runner 返回值解包处失败。 当前没有 GymRT2A 上的 HATT/MAPPO 有效性能比较。失败属于接口问题。 7.0
07-21 至 07-23 增加 raw、physics、task-attention、resource、set-context、no-idle 信息路径;加入 Idle-25 有限等待和配送分配诊断。 诊断有效;多个结构结论未完成多 seed 确认 旧 nearest 设置中 base best/last 为 31.2%/12.5%,raw 为 31.2%/6.2%,physics 为 53.1%/6.2%,resource 为 90.6%/78.1%,set-context 为 84.4%/71.9%。Idle-25 best 约 77.1%,No-Idle best 约 87.8%,MAPPO约 90%。 “HATT 只因编码后丢失原始输入而变差”没有证据。raw bypass 没有改善。载荷阶段、候选集合和特殊动作语义具有更直接的影响。单次 Idle 无限持续是主因的命题被证伪。 8.5
07-24 至 07-28 分离特殊控制动作与 Deliver 联盟聚合;修复 sector waypoint/event redecision 和无效边界方向;统一训练进度和 checkpoint 状态。 有效,适用范围有限 早期 nearest 设置中 detached 三 seed best 均值约 87.5%,原 HATT v2.0 约 50%。detached 的任务槽置换结果完全一致。sector redecision 将 HATT best 从 0 提高到约 29.2%。 特殊动作污染在早期设置中得到支持。detached 在后续 coverage/event 设置中表现较差,该改动不具备跨协议稳定收益。 9.5
07-29 至 07-30 增加 observer-relative sector goal、leg distance、coverage 网格、novel coverage、remaining unexplored;比较前馈、RNN 和 coverage。 明显有效 HATT+coverage best success 约 74.5%,HATT+RNN 约 24.2%,HATT+coverage+RNN 约 70.3%,MAPPO+coverage 约 4.4%。HATT+coverage 发现率约 98.2%,任务完成率约 96.9%。 显式 coverage 对当前 HATT 有重要作用。RNN 无法替代缺失的探索状态。该阶段的 coverage 开关同时包含 geometry 和 coverage state,独立贡献当时尚未分离。 10.0
07-30 对已有 HATT+coverage checkpoint执行 all-discovered 和 delivery-only 条件评估。 有效 all-discovered deterministic success 约 94.8%。delivery-only deterministic 为 64.1%,stochastic 为 80.7%。 Coverage 的主要作用位于搜索观测和搜索调度。已知任务条件下的配送能力较强。屏蔽 Explore 会改变整体动作分布,delivery-only 结果不能单独评价 Deliver 编码。 8.0
07-31 至 08-01 将 Idle 时间成本改为 uniform;构造延迟任务、不同待命位置和服务承诺诊断。 建模有效;预留运力主张未成立 HATT best success 从旧时间成本约 13.3%提高到约 27.3%。策略没有选择 Idle。原地 reserve 在 1024 个配对场景中仅31.8%更快,总完成时间平均增加2.68 step;中心待命在57.9%场景更快。 Idle 额外惩罚属于不合理奖励偏置。取消偏置没有使策略学会预留运力。原地预留运力普遍提高效率的命题被证伪。 7.5
08-01 至 08-05 实现 legacy、always、periodic、event、urgency 和 learned reconfiguration;依次测试 mixture、switch、hierarchical、显式上下文、gate action replay 和重选成本。 Event 可用;learned gate 未获得性能收益 三 seed 中 event 与 legacy整体较稳。learned gate降低单次决策的实际换任务比例,成功率没有提高。hierarchical cost0.05 的单 seed优势未在 seed2/3复现。event-only best约23.2%,event-or-learned约18.5%。force-closed success为0。 Learned gate 提高任务成功率的命题被证伪。Always/force-closed 均不可用。Event 适合作为固定决策规则。 9.0
08-05 至 08-09 完成 detached×coverage 因子实验、matched MAPPO64、MAPPO204、参数量匹配 MAPPO288、seed4/5 扩展和任务槽置换。 明显有效 HATT coverage/event 五 seed best/p90/last success 为68.0%/63.1%/63.9%;MAPPO64 为11.9%/1.1%/2.5%;MAPPO288 为8.1%/3.4%/5.8%。HATT actor约262,341参数,MAPPO288约250,530。HATT Deliver置换差值为0。 参数量解释被证伪。任务槽记忆解释被证伪。HATT 在当前协议下的结构优势得到高置信证据。detached 的早期收益未在新协议中复现。 10.0
08-10 至 08-13 重建中规模 CapCoal:30 agents、25 tasks、1500 steps、random demand;修复交叉评估 guard 和场景配置继承。 有效 legacy 有效恢复评估中,HATT best/p90/last success 为99.5%/97.4%/97.9%,MAPPO为100%/75.3%/81.0%。HATT best平均约462 steps,MAPPO约659 steps。一次错误的小场景评估已作废。 CapCoal 中 HATT 的优势主要体现在效率和训练后期保持。all-visible 设置接近满分,方法区分能力低。正式统一新协议结果仍待补充。 8.5
08-13 至 08-17 建立本地 QMIX、VDN、HATT-QMIX;修复更新单位、RNN hidden、active/alive mask、constrained target 和 event-SMDP;增加更新强度与 reward scale 筛选。 工程有效;性能较弱 首批45个 checkpoint success全为0。修复后普通 QMIX u4-r10 best success约9.4%、完成率67.8%。HATT-QMIX u4-r10 两 seed 均值12.9%,单 seed分别为0%与25.8%。team-mean HATT-MAPPO best约7.0%,原个体 shaped reward约74.6%。 值分解方法当前没有接近 HATT-MAPPO。更新强度解释普通 QMIX 的部分弱势。个体 shaped reward与 focal advantage 是当前 HATT-MAPPO 性能的重要条件。 8.0
08-17 固定正式评估协议:每50 episode×32 validation seeds;锁定 validation-best;validation-best/last×128 held-out test;最后10%逐 actor评估;分阶段进度记录。 设计有效;实现随后完成 协议明确分离模型选择、末期稳定性和最终泛化测试。进度统计保留 planned/submitted/completed/missing。 旧 best/p90/last 结果继续作为历史证据。正式论文结果需要采用锁定 validation-best 与 held-out test。 9.5
08-18 至 08-19 启动 DelivCoal 37-job 正式训练矩阵;完成15个 OOM job recovery;保存逐 episode actor。 工程有效;训练期方向有效 合并后37/37训练完成,54,197个逐 episode actor。末期训练 HATT full sent 0.888、reward54.08;MAPPO64为0.820、31.40;MAPPO288为0.825、40.48。Always sent 0.498、reward−22.98。 OOM 恢复完整。训练末期统计只用于方向检查。Always reconfiguration 的损害得到再次确认。 9.0
08-19 至 08-20 在当前 DelivCoal 协议下训练 HATT v3.2R full、no-transition、no-member,各3 seeds。修正保持动作与 source-leave/target-join 表示。 工程有效;member增益未确认 9/9训练完成。full没有稳定超过 no-member。member gate从0.5移动到约0.507–0.509。Deliver candidate约占全部 task slot的4%–5%。该组未执行正式 held-out test。 当前 member residual 的独立性能增益没有证据。该结果不评价全局AA;no-member保留v2全局AA。v3.2R不具备替代v2.0的证据。 8.0
08-20 至 08-21 拆分 observer-relative geometry 与 coverage state;训练 HATT/MAPPO geometry-only和 HATT no-AA+no-coalition;恢复31个正式 job的 periodic validation与held-out测试。 明显有效 三共同 seed validation-best:HATT full 70.8%,no-coverage 33.9%,geometry-only 31.5%;MAPPO full 8.3%,no-coverage 12.8%,geometry-only 17.4%。joint消融为57.8%。 Geometry无法解释 coverage的大部分收益。HATT在无coverage条件下仍保留结构优势。joint消融损失主要来自coalition context。 10.0
08-21 至 08-22 完成正式 held-out评估和最后10%逐 checkpoint补评。 完成且有效 Held-out:HATT full validation-best/last为72.2%/65.2%,MAPPO288为22.8%/5.9%,MAPPO64为10.2%/1.1%。最后10%:HATT full 75.5%,no-AA 76.5%,no-coalition 58.9%,MAPPO288 5.1%,MAPPO64 3.7%。40/40 final-window job完成;46,568/48,000评估单元完成;1,432个缺失单元来自未保存的中间 actor。 HATT相对MAPPO、coverage作用和coalition context作用获得正式协议证据。v2全局AA独立增益没有得到支持。MAPPO后期性能下降明显。 10.0
08-22 诊断AA未生效原因;实现HATT v3.3AA同构typed AA/AT边;设计learned-AA与uniform-AA配对训练和同checkpoint learned/uniform/zero干预。 实现与冒烟有效;性能评估进行中 v2 AA entropy约2.279–2.345,理论最大值为2.398;v3.2R约2.314–2.387。query/key变化低于value/output。新网络6项专项测试通过,learned和uniform各3 episode冒烟通过。正式6-job sweep已启动。 当前证据支持“旧AA学成接近均匀的全局聚合”。新typed-edge AA是否提高性能尚无结果。 9.0

三、关键命题的证据状态

命题 当前状态 证据强度 准确表述
当前 DelivCoal 协议中 HATT 优于 MAPPO 已确认 五训练 seed、128-seed held-out 和最后10%评估方向一致。
优势来源于更多参数 已证伪 MAPPO288参数量接近HATT,性能明显较低。
优势来源于固定任务槽顺序 已证伪 HATT对Deliver/Explore槽位置换稳定。
Coverage search-state改善HATT 已确认 matched held-out与final-window均显示约30个百分点以上差距。
Observer-relative geometry解释全部coverage收益 已证伪 geometry-only与no-coverage接近,均明显低于full。
Coalition context提供增益 已确认 中高 五seed held-out和末期窗口均下降,幅度约10–17个百分点。
v2全局AA提供独立增益 未确认 高置信负结果 full与no-AA在三种口径接近,方向不一致。
agent-agent关系没有价值 无法判断 无直接证据 现有no-AA只关闭任务无关全局AA。新typed AA/AT实验正在检验。
Event性能稳定高于legacy 未确认 Event语义清晰,任务指标没有稳定超过legacy。
Learned gate提高任务结果 已证伪 多种参数化、多seed和同checkpoint干预均未显示收益。
提高Idle比例可形成有效reserve 已证伪,限当前动力学 原地reserve平均完成更慢,结果依赖待命位置和服务承诺。
HATT在CapCoal中更优 部分确认 中高 中规模legacy显示效率和后期保持优势;统一新协议尚未完成。
HATT可泛化到GymRT2A 未验证 无有效性能证据 当前只有适配器smoke和接口失败记录。
HATT结构单独决定性能 已证伪 中高 team-mean reward显著降低HATT-MAPPO,性能依赖结构、可观测状态和个体credit共同作用。

四、当前方法定位

当前证据最充分的方法描述为:

使用observer-relative exploration-state representation、task-wise shared candidate scorer和task-indexed coalition context的结构化Actor,在event-triggered动态联盟任务分配中学习agent-to-task assignment。

各组成部分的证据等级:

组成部分 当前评价
Task-wise shared candidate scorer与任务槽等变性 高置信结构证据;独立性能贡献尚未完全拆分
Task-indexed coalition context 算法端结构;中高置信正贡献
Coverage search-state 环境端观测表示;对HATT为高置信正贡献
Observer-relative geometry 小到中等贡献
Event reconfiguration 决策语义有效;相对legacy性能优势未确认
Individual shaped credit 高重要性条件
v2 global AA 高置信负结果,限当前实现
v3.2R member residual 负结果,正式held-out证据缺失
v3.3 typed AA/AT 正在评估

五、当前运行状态与下一检查点

HATT v3.3AA正式实验目录:runs/20260822-1223_delivcoal_hatt-v33aa-focused

该实验需要回答两个问题:

  1. learned AA相对uniform AA是否提高任务指标和训练稳定性。
  2. 同一checkpoint切换AA gate后,动作分布和联盟候选排序是否发生一致变化。

判定规则已经预先固定。learned与uniform采用相同拓扑、参数量、成员信息和AT计算。性能差异可归因于AA关系门的学习能力。同checkpoint干预用于测量已训练策略对AA的即时依赖。

六、证据边界

  1. 旧五seed best/p90/last 数字属于旧模型选择协议。2026-08-21完成的validation-best/last held-out结果属于当前更严格协议。
  2. 最后10%评估以逐checkpoint、每checkpoint固定8 seeds统计训练末期分布。该统计不代表单一可部署模型。
  3. Final-window计划量48,000,实际完成46,568。缺失1,432个单元对应179个未保存actor。缺失比例约3.0%,状态文件保留完整计划分母。
  4. v3.2R只有训练结果和内部诊断,没有正式held-out测试。
  5. v3.3AA当前只有实现验证、冒烟结果和进行中的正式训练。当前报告不评价其性能。
  6. CapCoal与DelivCoal支持不同性能维度。GymRT2A尚无有效结果。现阶段不声明跨任务普遍优势。
  7. 当前 coverage 使用全队共享的 _explored_cells,candidate novel coverage 和 remaining unexplored 均依赖该全局搜索历史。完全去中心化部署需要共享地图、地图融合或通信机制作为实现条件。

七、Coverage与coalition context的归属

7.1 Coverage search-state

Coverage 由DelivCoal环境维护并写入actor observation。环境在连续地图上建立coverage网格,沿所有智能体的实际移动与感知线段更新 _explored_cells,再为每个observer的sector candidate生成executable goal、leg distance、novel coverage和remaining unexplored。该功能不直接修改配送动力学和reward coefficient。

因此,coverage的准确定位是:

observer-relative exploration-state representation / observability repair

它属于环境端观测建模,也属于完整任务求解系统。它不属于HATT网络算法。HATT与MAPPO在matched实验中接收相同coverage字段,因此HATT/MAPPO的算法比较保持输入公平。

当前实现包含一项部署假设:_explored_cells 汇总全队搜索历史,remaining unexplored也是全局量。该信息等价于全队共享coverage map。论文需要明确地图共享来源,并通过global-shared、local-only和communication-fused coverage对照测量依赖程度。

现有证据支持以下表述:

Coverage-aware observation substantially improves HATT performance in DelivCoal.

共同seed的validation-best中,HATT full、no-coverage、geometry-only分别为70.8%、33.9%、31.5%。MAPPO对应结果为8.3%、12.8%、17.4%。Coverage没有形成跨算法一致增益,当前证据支持architecture × observation interaction。HATT在无coverage条件下仍高于对应MAPPO,no-coverage差值为21.1个百分点,geometry-only差值为14.1个百分点。

7.2 Task-indexed coalition context

环境在ego/others中提供当前coalition ID。MAPPO可直接读取这些原始字段。HATT将coalition ID用于任务槽路由,把当前成员的hidden representation按task slot聚合为coalition sum、mean、count,并把对应联盟上下文注入每个candidate task context。该聚合与融合属于算法端structured actor。

现有no-coalition消融关闭显式sum/mean/count注入,保留AA边中的same-coalition关系和focal assigned关系。该实验隔离显式task-indexed coalition context,未删除全部联盟信息。

现有证据支持以下表述:

Explicit task-indexed coalition context provides an additional performance gain within HATT.

Full相对no-coalition的validation-best增加10.3个百分点,最后10%增加16.6个百分点。No-coalition仍显著高于MAPPO。显式coalition context解释HATT总差距的一部分。

八、近期文献审计

本节检索截至2026-08-22。期刊“一区”采用2024 JCR口径;中科院分区和SJR分区未混用。IEEE Robotics and Automation Letters、IEEE Transactions on Neural Networks and Learning Systems、IEEE Internet of Things Journal、Engineering Applications of Artificial Intelligence和Journal of Manufacturing Systems在该口径下均为Q1。

工作 发表与代码 与当前工作的关系 处理建议
Learning Policies for Dynamic Coalition Formation in Multi-Robot Task Allocation RA-L 2025,JCR Q1;官方代码 MAPPO、动态coalition、部分可观测、空间动作、任务重选和意图共享;对应本工程GyMRT2A 完成官方复现和本地HATT比较,列为最高优先级外部benchmark
Heterogeneous Multi-robot Task Allocation and Scheduling via Reinforcement Learning RA-L 2025,JCR Q1;官方代码 异构skills、task requirements、同步到达、动态联盟、agent/task cross-attention、共享task selector 最适合验证coalition-conditioned candidate scorer和跨规模泛化
Dynamic Coalition Formation and Routing for Multirobot Task Allocation via Reinforcement Learning ICRA 2024;官方代码 task/agent encoder、cross-attention、当前联盟人数、共享task selector;提供CTAS-D和OR-Tools基线 用于验证task数量、agent数量和coalition-size泛化
Multiagent Reinforcement Learning With Heterogeneous Graph Attention Network TNNLS 2023,JCR Q1 agent-level与relation-level heterogeneous attention;在predator-prey和heterogeneous SMAC验证 作为近邻关系编码基线或结构实现参照
MAPG²: Multiagent Policy Gradient via Potential Game for Multirobot Task Allocation Problems IEEE IoT Journal 2026,JCR Q1 graph attention、potential game、CTDE、多类型任务和资源需求 纳入相关工作;代码缺失期间不作为近期必跑项
A Two-stage Reinforcement Learning-based Approach for Multi-entity Task Allocation EAAI 2024,JCR Q1;官方代码 动态entity/task属性、attention、可变数量和zero-shot generalization;包含4个实验环境 作为结构化动态分配补充benchmark,优先级低于两个MRTA环境
Multirobot collaborative task dynamic scheduling based on MARL with heuristic graph convolution Journal of Manufacturing Systems 2024,JCR Q1 多关系图、图卷积、服务性能退化和动态调度 场景差异较大,作为相关工作引用
Learning for Dynamic Subteaming and Voluntary WaitingSADCHER ICRA 2024;MRS 2025 robot/task graph attention、动态subteam、voluntary waiting、bipartite matching和imitation learning 说明近邻结构与求解范式,时间允许时加入离线调度比较

8.1 与HATT最接近的已发表结构

近期工作已经覆盖agent/task encoder、cross-attention、共享task selector、当前联盟人数、异构skill requirement、动态图关系、动态任务重选和联盟形成。HATT的论文主张需要收敛到以下可检验结构:

A coalition-conditioned, task-permutation-equivariant structured actor that injects current coalition composition into every agent-task candidate before shared decoding.

Coverage适合作为观测表示贡献。Event-triggered reconfiguration适合作为决策语义和系统实现。AA/AT typed relation的贡献取决于v3.3AA正式结果。

九、建议实验顺序

9.1 Coverage信息范围审计

在DelivCoal中比较四种设置:

  1. 当前global-shared coverage。
  2. 每个智能体独立维护local-only coverage。
  3. 只融合通信范围或显式消息可达智能体的communication-fused coverage。
  4. Geometry-only。

第一阶段使用HATT三seed筛选,第二阶段对形成明显差异的设置补五seed HATT/MAPPO matched正式评估。该实验用于确定coverage收益、去中心化部署假设和共享信息敏感性。

9.2 完成GyMRT2A

当前工程已经引入官方环境、官方MARL-MRT2A、PCFA和HATT spatial actor。2026-08-07的本地六个job在runner返回值解包处失败,尚未产生算法性能证据。

建议比较:

  1. 官方MARL-MRT2A U-Net MAPPO。
  2. 官方PCFA。
  3. 本地参数匹配MAPPO。
  4. 当前HATT spatial candidate scorer。
  5. HATT spatial + cell/task-indexed coalition context。

当前spatial HATT主要验证空间candidate共享评分和AA聚合。第5项用于把DelivCoal的coalition-conditioned机制迁移到外部环境。所有方法沿用官方局部可观测性、意图共享和任务生成协议,不加入DelivCoal全局coverage字段。

9.3 迁移到HeteroMRTA

HeteroMRTA天然包含多维agent skills、多维task requirements、动态联盟、同步到达、等待成本和可变agent/task数量。建议比较官方HeteroMRTA policy、HATT、参数匹配task-agent cross-attention baseline和Greedy;小规模场景加入CTAS-D、SAS或TACO。

主要指标包括success、makespan、平均等待时间、能力浪费、推理时间,以及agent/task数量变化下的zero-shot generalization。该环境对task-indexed coalition context的验证价值最高。

9.4 DelivCoal近邻结构基线

增加HeteroMRTA-style task/agent cross-attention actor,保持相同PPO、observation、reward、参数量和checkpoint协议,并移除显式task-indexed coalition aggregation。该比较用于区分一般set/attention encoder、共享candidate scorer和coalition-conditioned candidate context的贡献。

9.5 优化与启发式切片

在all-discovered或delivery-only子问题中比较PCFA、Greedy、OR-Tools或CTAS-D,报告solution quality、makespan和推理时间。该切片具有完整任务信息,适合与离线优化器比较。完整DelivCoal包含在线搜索和部分可观测性,不宜直接套用离线solver作为全任务基线。

9.6 暂缓项目

SMAC和predator-prey可验证一般关系编码,缺少MRTA与联盟语义。围捕、攻击和新建自定义场景会增加控制与战术协同变量。现阶段优先完成公开MRTA benchmark,外部证据强于新增自定义环境。

十、主要证据文件