报告区间:2026-06-28 至 2026-08-22 13:17(Asia/Shanghai)
证据来源:CHANGELOG.yaml、git 提交、实验状态文件、独立评估结果、阶段交接文档。
重要性采用 10 分制:9–10 表示决定研究结论或正式实验可信度,7–8.5 表示重要机制或对照,5–6.5 表示辅助研究与工程保障。
| 日期 | 改动与实验 | 是否有效 | 主要证据 | 证明、证伪或边界 | 重要性 |
|---|---|---|---|---|---|
| 06-28 至 06-29 | 建立 HATT v3.0、v3.1、v3.2;加入候选加入变化、成员交互、过渡信息和诊断量;重写 PCFA 基线。 | 工程有效;性能结论不足 | 旧环境 32-episode 结果中,v3.0a success 0.9375,v2.0 为 0.9063;v3.0b 为 0.4375;v3.0c 为 0.7813。v3.2 还出现 utility-loss shape 问题和不完整实验。 | 候选加入变化具有继续研究价值。复杂残差和成员分支没有获得稳定证据。早期结果不适用于当前 DelivCoal 协议。 | 8.0 |
| 06-29 至 07-03 | 引入 sector/survey 探索、coalition_delivery 场景、PPO KL/clip early stopping 和配送 reward shaping。 |
建模有效;初版 sector 无法完成任务 | sector 初版中 HATT、MAPPO success 均为 0。到达 waypoint 和发现任务后的重新决策修复后,HATT best 约 29.2%,MAPPO best 约 16.7%。 | “初版 sector 已可学习”被证伪。重新决策时机属于必要的环境语义修复。 | 9.0 |
| 07-03 至 07-08 | 将环境拆分为 CapCoal 与 DelivCoal;增加 HATT v2.4–v2.7、任务类型处理、动态服务聚合、局部 credit、potential shaping 和 CapCoal requirement 表征。 | 部分有效 | CapCoal 中 HATT 可达到高成功率。DelivCoal 的若干 best checkpoint 改善,latest 多次退化。demand4 等 requirement 表征显著影响 CapCoal。 |
两类环境需要分别分析。单个 reward 版本和单个 best checkpoint无法说明结构有效性。v2.4–v2.7 未形成稳定统一方案。 | 9.0 |
| 07-17 | 增加 task-type 行为指标、训练期评估与独立评估对齐、checkpoint 关系分析。 | 有效 | 训练期多 seed eval 与 32-seed 独立 eval 的关系明显高于单局 reward/length。best 与 latest 的差异被重复观察。 | 单局训练 reward 不能可靠选择 checkpoint。模型选择需要固定多 seed validation。 | 9.0 |
| 07-19 | 接入 GymRT2A 适配器、空间候选 HATT actor和 MARL-MRT2A 官方复现入口。 | 工程部分有效;性能未验证 | 适配器 smoke 可执行。官方复现耗时较长。近期本地六个 job 在 runner 返回值解包处失败。 | 当前没有 GymRT2A 上的 HATT/MAPPO 有效性能比较。失败属于接口问题。 | 7.0 |
| 07-21 至 07-23 | 增加 raw、physics、task-attention、resource、set-context、no-idle 信息路径;加入 Idle-25 有限等待和配送分配诊断。 | 诊断有效;多个结构结论未完成多 seed 确认 | 旧 nearest 设置中 base best/last 为 31.2%/12.5%,raw 为 31.2%/6.2%,physics 为 53.1%/6.2%,resource 为 90.6%/78.1%,set-context 为 84.4%/71.9%。Idle-25 best 约 77.1%,No-Idle best 约 87.8%,MAPPO约 90%。 | “HATT 只因编码后丢失原始输入而变差”没有证据。raw bypass 没有改善。载荷阶段、候选集合和特殊动作语义具有更直接的影响。单次 Idle 无限持续是主因的命题被证伪。 | 8.5 |
| 07-24 至 07-28 | 分离特殊控制动作与 Deliver 联盟聚合;修复 sector waypoint/event redecision 和无效边界方向;统一训练进度和 checkpoint 状态。 | 有效,适用范围有限 | 早期 nearest 设置中 detached 三 seed best 均值约 87.5%,原 HATT v2.0 约 50%。detached 的任务槽置换结果完全一致。sector redecision 将 HATT best 从 0 提高到约 29.2%。 | 特殊动作污染在早期设置中得到支持。detached 在后续 coverage/event 设置中表现较差,该改动不具备跨协议稳定收益。 | 9.5 |
| 07-29 至 07-30 | 增加 observer-relative sector goal、leg distance、coverage 网格、novel coverage、remaining unexplored;比较前馈、RNN 和 coverage。 | 明显有效 | HATT+coverage best success 约 74.5%,HATT+RNN 约 24.2%,HATT+coverage+RNN 约 70.3%,MAPPO+coverage 约 4.4%。HATT+coverage 发现率约 98.2%,任务完成率约 96.9%。 | 显式 coverage 对当前 HATT 有重要作用。RNN 无法替代缺失的探索状态。该阶段的 coverage 开关同时包含 geometry 和 coverage state,独立贡献当时尚未分离。 | 10.0 |
| 07-30 | 对已有 HATT+coverage checkpoint执行 all-discovered 和 delivery-only 条件评估。 | 有效 | all-discovered deterministic success 约 94.8%。delivery-only deterministic 为 64.1%,stochastic 为 80.7%。 | Coverage 的主要作用位于搜索观测和搜索调度。已知任务条件下的配送能力较强。屏蔽 Explore 会改变整体动作分布,delivery-only 结果不能单独评价 Deliver 编码。 | 8.0 |
| 07-31 至 08-01 | 将 Idle 时间成本改为 uniform;构造延迟任务、不同待命位置和服务承诺诊断。 | 建模有效;预留运力主张未成立 | HATT best success 从旧时间成本约 13.3%提高到约 27.3%。策略没有选择 Idle。原地 reserve 在 1024 个配对场景中仅31.8%更快,总完成时间平均增加2.68 step;中心待命在57.9%场景更快。 | Idle 额外惩罚属于不合理奖励偏置。取消偏置没有使策略学会预留运力。原地预留运力普遍提高效率的命题被证伪。 | 7.5 |
| 08-01 至 08-05 | 实现 legacy、always、periodic、event、urgency 和 learned reconfiguration;依次测试 mixture、switch、hierarchical、显式上下文、gate action replay 和重选成本。 | Event 可用;learned gate 未获得性能收益 | 三 seed 中 event 与 legacy整体较稳。learned gate降低单次决策的实际换任务比例,成功率没有提高。hierarchical cost0.05 的单 seed优势未在 seed2/3复现。event-only best约23.2%,event-or-learned约18.5%。force-closed success为0。 | Learned gate 提高任务成功率的命题被证伪。Always/force-closed 均不可用。Event 适合作为固定决策规则。 | 9.0 |
| 08-05 至 08-09 | 完成 detached×coverage 因子实验、matched MAPPO64、MAPPO204、参数量匹配 MAPPO288、seed4/5 扩展和任务槽置换。 | 明显有效 | HATT coverage/event 五 seed best/p90/last success 为68.0%/63.1%/63.9%;MAPPO64 为11.9%/1.1%/2.5%;MAPPO288 为8.1%/3.4%/5.8%。HATT actor约262,341参数,MAPPO288约250,530。HATT Deliver置换差值为0。 | 参数量解释被证伪。任务槽记忆解释被证伪。HATT 在当前协议下的结构优势得到高置信证据。detached 的早期收益未在新协议中复现。 | 10.0 |
| 08-10 至 08-13 | 重建中规模 CapCoal:30 agents、25 tasks、1500 steps、random demand;修复交叉评估 guard 和场景配置继承。 | 有效 | legacy 有效恢复评估中,HATT best/p90/last success 为99.5%/97.4%/97.9%,MAPPO为100%/75.3%/81.0%。HATT best平均约462 steps,MAPPO约659 steps。一次错误的小场景评估已作废。 | CapCoal 中 HATT 的优势主要体现在效率和训练后期保持。all-visible 设置接近满分,方法区分能力低。正式统一新协议结果仍待补充。 | 8.5 |
| 08-13 至 08-17 | 建立本地 QMIX、VDN、HATT-QMIX;修复更新单位、RNN hidden、active/alive mask、constrained target 和 event-SMDP;增加更新强度与 reward scale 筛选。 | 工程有效;性能较弱 | 首批45个 checkpoint success全为0。修复后普通 QMIX u4-r10 best success约9.4%、完成率67.8%。HATT-QMIX u4-r10 两 seed 均值12.9%,单 seed分别为0%与25.8%。team-mean HATT-MAPPO best约7.0%,原个体 shaped reward约74.6%。 |
值分解方法当前没有接近 HATT-MAPPO。更新强度解释普通 QMIX 的部分弱势。个体 shaped reward与 focal advantage 是当前 HATT-MAPPO 性能的重要条件。 | 8.0 |
| 08-17 | 固定正式评估协议:每50 episode×32 validation seeds;锁定 validation-best;validation-best/last×128 held-out test;最后10%逐 actor评估;分阶段进度记录。 | 设计有效;实现随后完成 | 协议明确分离模型选择、末期稳定性和最终泛化测试。进度统计保留 planned/submitted/completed/missing。 | 旧 best/p90/last 结果继续作为历史证据。正式论文结果需要采用锁定 validation-best 与 held-out test。 | 9.5 |
| 08-18 至 08-19 | 启动 DelivCoal 37-job 正式训练矩阵;完成15个 OOM job recovery;保存逐 episode actor。 | 工程有效;训练期方向有效 | 合并后37/37训练完成,54,197个逐 episode actor。末期训练 HATT full sent 0.888、reward54.08;MAPPO64为0.820、31.40;MAPPO288为0.825、40.48。Always sent 0.498、reward−22.98。 | OOM 恢复完整。训练末期统计只用于方向检查。Always reconfiguration 的损害得到再次确认。 | 9.0 |
| 08-19 至 08-20 | 在当前 DelivCoal 协议下训练 HATT v3.2R full、no-transition、no-member,各3 seeds。修正保持动作与 source-leave/target-join 表示。 | 工程有效;member增益未确认 | 9/9训练完成。full没有稳定超过 no-member。member gate从0.5移动到约0.507–0.509。Deliver candidate约占全部 task slot的4%–5%。该组未执行正式 held-out test。 | 当前 member residual 的独立性能增益没有证据。该结果不评价全局AA;no-member保留v2全局AA。v3.2R不具备替代v2.0的证据。 |
8.0 |
| 08-20 至 08-21 | 拆分 observer-relative geometry 与 coverage state;训练 HATT/MAPPO geometry-only和 HATT no-AA+no-coalition;恢复31个正式 job的 periodic validation与held-out测试。 | 明显有效 | 三共同 seed validation-best:HATT full 70.8%,no-coverage 33.9%,geometry-only 31.5%;MAPPO full 8.3%,no-coverage 12.8%,geometry-only 17.4%。joint消融为57.8%。 | Geometry无法解释 coverage的大部分收益。HATT在无coverage条件下仍保留结构优势。joint消融损失主要来自coalition context。 | 10.0 |
| 08-21 至 08-22 | 完成正式 held-out评估和最后10%逐 checkpoint补评。 | 完成且有效 | Held-out:HATT full validation-best/last为72.2%/65.2%,MAPPO288为22.8%/5.9%,MAPPO64为10.2%/1.1%。最后10%:HATT full 75.5%,no-AA 76.5%,no-coalition 58.9%,MAPPO288 5.1%,MAPPO64 3.7%。40/40 final-window job完成;46,568/48,000评估单元完成;1,432个缺失单元来自未保存的中间 actor。 | HATT相对MAPPO、coverage作用和coalition context作用获得正式协议证据。v2全局AA独立增益没有得到支持。MAPPO后期性能下降明显。 | 10.0 |
| 08-22 | 诊断AA未生效原因;实现HATT v3.3AA同构typed AA/AT边;设计learned-AA与uniform-AA配对训练和同checkpoint learned/uniform/zero干预。 | 实现与冒烟有效;性能评估进行中 | v2 AA entropy约2.279–2.345,理论最大值为2.398;v3.2R约2.314–2.387。query/key变化低于value/output。新网络6项专项测试通过,learned和uniform各3 episode冒烟通过。正式6-job sweep已启动。 | 当前证据支持“旧AA学成接近均匀的全局聚合”。新typed-edge AA是否提高性能尚无结果。 | 9.0 |
| 命题 | 当前状态 | 证据强度 | 准确表述 |
|---|---|---|---|
| 当前 DelivCoal 协议中 HATT 优于 MAPPO | 已确认 | 高 | 五训练 seed、128-seed held-out 和最后10%评估方向一致。 |
| 优势来源于更多参数 | 已证伪 | 高 | MAPPO288参数量接近HATT,性能明显较低。 |
| 优势来源于固定任务槽顺序 | 已证伪 | 高 | HATT对Deliver/Explore槽位置换稳定。 |
| Coverage search-state改善HATT | 已确认 | 高 | matched held-out与final-window均显示约30个百分点以上差距。 |
| Observer-relative geometry解释全部coverage收益 | 已证伪 | 高 | geometry-only与no-coverage接近,均明显低于full。 |
| Coalition context提供增益 | 已确认 | 中高 | 五seed held-out和末期窗口均下降,幅度约10–17个百分点。 |
| v2全局AA提供独立增益 | 未确认 | 高置信负结果 | full与no-AA在三种口径接近,方向不一致。 |
| agent-agent关系没有价值 | 无法判断 | 无直接证据 | 现有no-AA只关闭任务无关全局AA。新typed AA/AT实验正在检验。 |
| Event性能稳定高于legacy | 未确认 | 中 | Event语义清晰,任务指标没有稳定超过legacy。 |
| Learned gate提高任务结果 | 已证伪 | 高 | 多种参数化、多seed和同checkpoint干预均未显示收益。 |
| 提高Idle比例可形成有效reserve | 已证伪,限当前动力学 | 高 | 原地reserve平均完成更慢,结果依赖待命位置和服务承诺。 |
| HATT在CapCoal中更优 | 部分确认 | 中高 | 中规模legacy显示效率和后期保持优势;统一新协议尚未完成。 |
| HATT可泛化到GymRT2A | 未验证 | 无有效性能证据 | 当前只有适配器smoke和接口失败记录。 |
| HATT结构单独决定性能 | 已证伪 | 中高 | team-mean reward显著降低HATT-MAPPO,性能依赖结构、可观测状态和个体credit共同作用。 |
当前证据最充分的方法描述为:
使用observer-relative exploration-state representation、task-wise shared candidate scorer和task-indexed coalition context的结构化Actor,在event-triggered动态联盟任务分配中学习agent-to-task assignment。
各组成部分的证据等级:
| 组成部分 | 当前评价 |
|---|---|
| Task-wise shared candidate scorer与任务槽等变性 | 高置信结构证据;独立性能贡献尚未完全拆分 |
| Task-indexed coalition context | 算法端结构;中高置信正贡献 |
| Coverage search-state | 环境端观测表示;对HATT为高置信正贡献 |
| Observer-relative geometry | 小到中等贡献 |
| Event reconfiguration | 决策语义有效;相对legacy性能优势未确认 |
| Individual shaped credit | 高重要性条件 |
| v2 global AA | 高置信负结果,限当前实现 |
| v3.2R member residual | 负结果,正式held-out证据缺失 |
| v3.3 typed AA/AT | 正在评估 |
HATT v3.3AA正式实验目录:runs/20260822-1223_delivcoal_hatt-v33aa-focused。
该实验需要回答两个问题:
判定规则已经预先固定。learned与uniform采用相同拓扑、参数量、成员信息和AT计算。性能差异可归因于AA关系门的学习能力。同checkpoint干预用于测量已训练策略对AA的即时依赖。
best/p90/last 数字属于旧模型选择协议。2026-08-21完成的validation-best/last held-out结果属于当前更严格协议。_explored_cells,candidate novel coverage 和 remaining unexplored 均依赖该全局搜索历史。完全去中心化部署需要共享地图、地图融合或通信机制作为实现条件。Coverage 由DelivCoal环境维护并写入actor observation。环境在连续地图上建立coverage网格,沿所有智能体的实际移动与感知线段更新 _explored_cells,再为每个observer的sector candidate生成executable goal、leg distance、novel coverage和remaining unexplored。该功能不直接修改配送动力学和reward coefficient。
因此,coverage的准确定位是:
observer-relative exploration-state representation / observability repair
它属于环境端观测建模,也属于完整任务求解系统。它不属于HATT网络算法。HATT与MAPPO在matched实验中接收相同coverage字段,因此HATT/MAPPO的算法比较保持输入公平。
当前实现包含一项部署假设:_explored_cells 汇总全队搜索历史,remaining unexplored也是全局量。该信息等价于全队共享coverage map。论文需要明确地图共享来源,并通过global-shared、local-only和communication-fused coverage对照测量依赖程度。
现有证据支持以下表述:
Coverage-aware observation substantially improves HATT performance in DelivCoal.
共同seed的validation-best中,HATT full、no-coverage、geometry-only分别为70.8%、33.9%、31.5%。MAPPO对应结果为8.3%、12.8%、17.4%。Coverage没有形成跨算法一致增益,当前证据支持architecture × observation interaction。HATT在无coverage条件下仍高于对应MAPPO,no-coverage差值为21.1个百分点,geometry-only差值为14.1个百分点。
环境在ego/others中提供当前coalition ID。MAPPO可直接读取这些原始字段。HATT将coalition ID用于任务槽路由,把当前成员的hidden representation按task slot聚合为coalition sum、mean、count,并把对应联盟上下文注入每个candidate task context。该聚合与融合属于算法端structured actor。
现有no-coalition消融关闭显式sum/mean/count注入,保留AA边中的same-coalition关系和focal assigned关系。该实验隔离显式task-indexed coalition context,未删除全部联盟信息。
现有证据支持以下表述:
Explicit task-indexed coalition context provides an additional performance gain within HATT.
Full相对no-coalition的validation-best增加10.3个百分点,最后10%增加16.6个百分点。No-coalition仍显著高于MAPPO。显式coalition context解释HATT总差距的一部分。
本节检索截至2026-08-22。期刊“一区”采用2024 JCR口径;中科院分区和SJR分区未混用。IEEE Robotics and Automation Letters、IEEE Transactions on Neural Networks and Learning Systems、IEEE Internet of Things Journal、Engineering Applications of Artificial Intelligence和Journal of Manufacturing Systems在该口径下均为Q1。
| 工作 | 发表与代码 | 与当前工作的关系 | 处理建议 |
|---|---|---|---|
| Learning Policies for Dynamic Coalition Formation in Multi-Robot Task Allocation | RA-L 2025,JCR Q1;官方代码 | MAPPO、动态coalition、部分可观测、空间动作、任务重选和意图共享;对应本工程GyMRT2A | 完成官方复现和本地HATT比较,列为最高优先级外部benchmark |
| Heterogeneous Multi-robot Task Allocation and Scheduling via Reinforcement Learning | RA-L 2025,JCR Q1;官方代码 | 异构skills、task requirements、同步到达、动态联盟、agent/task cross-attention、共享task selector | 最适合验证coalition-conditioned candidate scorer和跨规模泛化 |
| Dynamic Coalition Formation and Routing for Multirobot Task Allocation via Reinforcement Learning | ICRA 2024;官方代码 | task/agent encoder、cross-attention、当前联盟人数、共享task selector;提供CTAS-D和OR-Tools基线 | 用于验证task数量、agent数量和coalition-size泛化 |
| Multiagent Reinforcement Learning With Heterogeneous Graph Attention Network | TNNLS 2023,JCR Q1 | agent-level与relation-level heterogeneous attention;在predator-prey和heterogeneous SMAC验证 | 作为近邻关系编码基线或结构实现参照 |
| MAPG²: Multiagent Policy Gradient via Potential Game for Multirobot Task Allocation Problems | IEEE IoT Journal 2026,JCR Q1 | graph attention、potential game、CTDE、多类型任务和资源需求 | 纳入相关工作;代码缺失期间不作为近期必跑项 |
| A Two-stage Reinforcement Learning-based Approach for Multi-entity Task Allocation | EAAI 2024,JCR Q1;官方代码 | 动态entity/task属性、attention、可变数量和zero-shot generalization;包含4个实验环境 | 作为结构化动态分配补充benchmark,优先级低于两个MRTA环境 |
| Multirobot collaborative task dynamic scheduling based on MARL with heuristic graph convolution | Journal of Manufacturing Systems 2024,JCR Q1 | 多关系图、图卷积、服务性能退化和动态调度 | 场景差异较大,作为相关工作引用 |
| Learning for Dynamic Subteaming and Voluntary Waiting 与 SADCHER | ICRA 2024;MRS 2025 | robot/task graph attention、动态subteam、voluntary waiting、bipartite matching和imitation learning | 说明近邻结构与求解范式,时间允许时加入离线调度比较 |
近期工作已经覆盖agent/task encoder、cross-attention、共享task selector、当前联盟人数、异构skill requirement、动态图关系、动态任务重选和联盟形成。HATT的论文主张需要收敛到以下可检验结构:
A coalition-conditioned, task-permutation-equivariant structured actor that injects current coalition composition into every agent-task candidate before shared decoding.
Coverage适合作为观测表示贡献。Event-triggered reconfiguration适合作为决策语义和系统实现。AA/AT typed relation的贡献取决于v3.3AA正式结果。
在DelivCoal中比较四种设置:
第一阶段使用HATT三seed筛选,第二阶段对形成明显差异的设置补五seed HATT/MAPPO matched正式评估。该实验用于确定coverage收益、去中心化部署假设和共享信息敏感性。
当前工程已经引入官方环境、官方MARL-MRT2A、PCFA和HATT spatial actor。2026-08-07的本地六个job在runner返回值解包处失败,尚未产生算法性能证据。
建议比较:
当前spatial HATT主要验证空间candidate共享评分和AA聚合。第5项用于把DelivCoal的coalition-conditioned机制迁移到外部环境。所有方法沿用官方局部可观测性、意图共享和任务生成协议,不加入DelivCoal全局coverage字段。
HeteroMRTA天然包含多维agent skills、多维task requirements、动态联盟、同步到达、等待成本和可变agent/task数量。建议比较官方HeteroMRTA policy、HATT、参数匹配task-agent cross-attention baseline和Greedy;小规模场景加入CTAS-D、SAS或TACO。
主要指标包括success、makespan、平均等待时间、能力浪费、推理时间,以及agent/task数量变化下的zero-shot generalization。该环境对task-indexed coalition context的验证价值最高。
增加HeteroMRTA-style task/agent cross-attention actor,保持相同PPO、observation、reward、参数量和checkpoint协议,并移除显式task-indexed coalition aggregation。该比较用于区分一般set/attention encoder、共享candidate scorer和coalition-conditioned candidate context的贡献。
在all-discovered或delivery-only子问题中比较PCFA、Greedy、OR-Tools或CTAS-D,报告solution quality、makespan和推理时间。该切片具有完整任务信息,适合与离线优化器比较。完整DelivCoal包含在线搜索和部分可观测性,不宜直接套用离线solver作为全任务基线。
SMAC和predator-prey可验证一般关系编码,缺少MRTA与联盟语义。围捕、攻击和新建自定义场景会增加控制与战术协同变量。现阶段优先完成公开MRTA benchmark,外部证据强于新增自定义环境。
CHANGELOG.yamlhtml_logs/hatt_formal_delivcoal_20260818_handoff.mddocs/PROJECT_RESEARCH_HANDOFF_20260817.mddocs/EVALUATION_PROGRESS_HANDOFF_20260817.mddocs/HATT_V33AA_EXPERIMENT_DESIGN_20260822.mdruns/20260821-1045_delivcoal_final-window-evaluation/status.jsonruns/20260822-1223_delivcoal_hatt-v33aa-focused/status.jsonenvs/delivcoal/env_core.pyalgorithms/algorithm/HATTV20Network.pythird_party/marl_mrt2a/README.md