从 Legacy GAT 到 delivcoal HATT 主线:现象、修改与原因复盘

依据 CHANGELOG、对应提交、历史评估报告和后续消融实验,追溯四个性能阶段的形成条件。本文关注能够由实验支持的机制解释,并区分结构改进、状态建模、环境调度、诊断干预和实验工程修复。

一、结论总览

四个阶段由两条相互独立的演化线共同形成。第一条线从通用节点级 GAT 演化到面向 agent-task 候选关系的 HATT,解决动作输出与任务实体缺少结构对应、任务排列共享不足、当前联盟信息表达薄弱等问题。第二条线发生在 delivcoal,coverage 状态和 sector 重决策修正补齐探索过程中的信息与调度语义,event 重组进一步提供任务状态变化后的再分配时机。最终结果来自 HATT 结构、可观测探索状态和动态重组日程的组合。
阶段主要条件主导机制关键修改
早期 GAT 表现偏弱通用图嵌入直接进入普通动作 MLP图表示形成信息瓶颈,动作维度与任务实体缺少显式对应cat/gated 保留原始观测;随后转向结构化观测
HATT 在 capcoal 形成优势能力—需求匹配、任务集合、联盟成员构成异构编码、候选边共享打分、联盟聚合、任务置换等变性7139214147da4d2385
HATT 在 delivcoal 落后探索、配送、待命、补给混合;探索历史影响未来动作特殊动作与配送任务共用表示,sector 后果缺少 agent-relative 描述,覆盖历史不可见,动作完成后的再决策时机不完整多轮信息路径、Idle、reward 和重组诊断定位问题
delivcoal 下 HATT 重新领先observer-relative coverage、正确 sector 调度、event 重组探索决策获得可辨识后果,任务事件触发再分配,HATT 在相同条件下发挥关系建模优势6831b9724362da1e783e3a1f03ed79

二、早期 GAT 表现偏弱:需要按融合方式拆分

早期结果中,纯图观测路径和保留原始观测的融合路径表现差异很大。2026-06-23 的32回合统一评估记录为:gatobs 25.0%,MAPPO 40.6%,legacy GAT gated 68.8%,legacy GAT cat 71.9%。因此,“GAT 低于 MAPPO”准确对应纯图瓶颈及部分早期实现;cat/gated 已经显示图关系信息能够产生收益。

2.1 纯图路径的信息压缩

Legacy GAT 先把 agent 和 task 放进统一图结构,经 GATConv 聚合后得到节点 embedding,再由普通 MLP 输出动作。节点特征的对齐、异构实体 padding、邻居聚合和全局池化会压缩自身资源、精确任务属性及其他局部观测。gatobs 让 actor 主要依赖这份压缩表示,导致与动作有关的细节难以恢复。cat 将原始观测与图 embedding 拼接,gated 允许网络调节图表示贡献,两者保留了直接信息通路,对应性能随之提升。

2.2 节点表示与任务动作缺少显式绑定

Legacy GAT:graph nodes → GAT embedding / pooling → MLP → M 个动作 logits

普通 MLP 的第 m 个输出参数与 task m 的输入实体之间没有共享计算结构。模型需要从数据中学习每个输出位置和任务槽位置之间的映射,任务数量、排列和场景随机化都会增加学习负担。图消息传播能够表达实体关系,最终动作头仍采用固定维度分类器,关系表示与候选动作之间存在一层未结构化的转换。

2.3 联盟状态表达不足

联盟组建动作依赖任务需求、当前成员能力和新成员的边际贡献。Legacy GAT 的通用消息聚合没有为“属于 task m 的成员集合”提供专门统计路径,任务节点也缺少稳定的当前联盟 sum、mean 和成员数描述。网络可以通过训练近似恢复这些关系,所需样本和优化难度较高。

阶段定性:cat/gated 修复了纯图输入的瓶颈,属于合理的信息通路修正;它仍保留固定动作 MLP和通用节点聚合。Legacy GAT 的结构局限推动了后续 HATT 候选边建模。

三、HATT 在 capcoal 形成优势:结构与问题对象对齐

这一阶段包含三个连续提交。713921 将观测拆成 ego、others 和 tasks,并贯通 env、buffer、runner 与 policy;4147da 引入异构编码和 agent-agent 关系注意力;4d2385 的 HATT v2.0 为每个 agent-task 候选关系生成分数,并把当前联盟成员聚合到对应任务上下文。性能变化对应一条完整的信息链改造,单个 PPO 参数无法覆盖这些结构差异。

3.1 结构化实体边界

Dict 观测保留了自身、其他智能体和任务的实体轴。HATT 为三类输入使用各自编码器,避免将异构语义提前混入同一个扁平向量或同一种节点投影。critic 继续使用全局状态,actor 则保留实体集合结构。

3.2 候选边共享解码

HATT v2.0:score(i,m) = Decoder(agent_context[i], task_context[i,m], pair_features[i,m])

所有 task 候选共享同一个 decoder。task m 的输入直接生成 task m 的 logit,任务交换时对应分数随之交换。网络学习的是一套可复用的候选评价规则,内容包括能力匹配、空间关系和联盟上下文。MAPPO 的 flatten MLP 为不同输入位置和输出位置维护位置相关参数,在实体增多与任务随机排列时承担更高的映射学习负担。

3.3 当前联盟聚合

HATT v2.0 对每个任务聚合当前成员的隐藏表示,并使用 sum、mean 和成员规模更新任务上下文。这个计算直接表达“当前任务已经得到什么资源”,候选 agent 的加入价值由 decoder 结合自身与任务上下文判断。capcoal 的核心状态正是能力、需求和联盟构成,这一结构能够充分利用环境提供的信息。

3.4 后续验证对原因解释的约束

阶段定性:候选边共享解码、任务置换等变性和当前联盟聚合属于算法结构改进。capcoal 的任务定义与这些结构高度一致,实验结果反映了归纳偏置在对应问题上的作用范围。

四、迁移到 delivcoal 后的性能下降:任务语义和可观测性同时变化

delivcoal 将动作集合扩展为 Deliver、Explore、Idle 和 Resupply,并加入任务发现、载荷、补给、deadline、priority 和持续移动。策略需要同时处理联盟分配、探索控制和资源阶段切换。HATT v2.0 的候选任务假设在这里受到两项挑战:候选槽的语义不再同质,探索动作的合理性依赖过去覆盖历史。

4.1 特殊动作进入配送联盟表示

早期实现使用相近的候选任务路径处理 Deliver、Explore、Idle 和 Resupply。Deliver 的联盟成员表示具有明确含义;Explore 表示方向控制;Idle 表示等待;Resupply 表示资源恢复。将四类槽统一放入配送式联盟聚合,会把特殊动作的执行者和历史分配编码成类似任务联盟的上下文,Idle 偏好和特殊动作 logits 因此受到额外影响。

6831b9 引入 detached、split 和 type-conditioned 对照。detached 三 seed best 成功率约0.75、1.00、0.875,原始 HATT v2.0 同期 best 均值约0.50;固定状态干预也显示,清除 Idle 联盟上下文会降低 Idle 相对优势。这些结果确认特殊动作表示存在干扰。detached 的 last 仍为约0、0.375、0,后续 detached×coverage 因子实验中 detached 和 detached+coverage 低于 coverage alone,表明这项修正覆盖了局部机制,未覆盖探索状态和训练后期漂移。

4.2 sector 观测缺少 agent-relative 动作后果

原 sector 槽主要描述抽象探索方向。不同位置的 agent 选择同一方向后会走向不同 waypoint,经过的区域和新增覆盖也不同。共享 nominal 特征无法区分这些后果,候选分数面对相近输入时需要输出依赖当前位置和搜索历史的不同决策。

4.3 覆盖历史缺失造成状态混叠

同一个位置和任务可见集合可能对应不同搜索历史:某个 sector 已被充分搜索,另一个 sector 仍包含大片未知区域。前馈策略在缺少 coverage 状态时看到相近观测,合理动作却取决于历史。RNN-only best 约24.2%,coverage 前馈 HATT best 约74.5%,说明显式搜索状态比仅增加递归记忆更直接地解决了这一批实验中的主要信息缺口。

4.4 探索动作完成后的调度语义

6831b9 同时修正 sector waypoint 到达和新任务发现后的重新决策:agent 到达探索目标后立即请求策略决策,新任务出现时探索中的 agent 获得重新分配机会,地图边界处缺少有效移动的方向被屏蔽。真实 sector 设置下,原始 HATT best 成功率为0,加入重新决策后约29.2%,任务完成率从约27.5%提高到约76.7%。这一变化直接连接动作终止条件和策略调用时机。

4.5 多条候选解释的实验结果

尝试观察解释范围
Idle-25单次等待被限制,策略被唤醒后继续选择 Idle排查 persistent Idle 的持续时间语义
No-Idlebest 提升,策略自由度被直接删除诊断 Idle 是否成为有害吸引点
raw / physics / resource / setctx部分 checkpoint 改善,latest 仍波动检查 decoder 信息量和资源阶段特征
reward v1-v5算法与 reward mode 高度耦合,跨 checkpoint 稳定性不足检查局部 credit 和 potential shaping
learned/switch/hierarchical gate重组动作更可解释,成功率未稳定超过规则日程检查学习式重组时机
coverage发现率、任务完成率和成功率同步大幅提高直接补充探索动作的状态与后果信息

五、delivcoal 主线形成:coverage、sector 调度与 event 的组合

5.1 724362:observer-relative coverage

该提交增加 coverage 网格,使用 agent 感知范围近似记录已搜索区域;每个 agent 的 sector 候选根据自身位置计算实际目标;Explore 观测加入沿路径预计新增覆盖、路径长度和全局未搜索比例。网络输入维度保持兼容,新增特征通过已有结构化任务行进入策略。

三 seed 对照中,HATT+coverage best 约74.5%,HATT+RNN约24.2%,HATT+coverage+RNN约70.3%,MAPPO+coverage约4.4%。HATT+coverage 的发现率约98.2%、任务完成率约96.9%,执行探索比例下降,执行配送比例上升。结果显示 coverage 主要改变了探索行为的可辨识性和阶段切换。

5.2 da1e78:event reconfiguration

event 日程在新任务发现、任务完成、当前任务失效和 mandatory 状态变化时重新激活 agent。它为持续移动和长期任务承诺提供明确的中断点,使策略能够使用新状态重新分配。learned gate 系列进一步分离了保持与重选动作,当前实验中规则 event 的性能和可解释性更稳定。

5.3 严格 matched 对照

3e3a1f 建立相同 coverage、event、训练长度、评估场景和 checkpoint 选择的 MAPPO64 对照;4fca7b3 加入参数量接近的 MAPPO288;03ed796 修复 MAPPO288 checkpoint 重建参数透传,并扩展到五个随机种子。最终128回合独立评估汇总如下:

方法Best successP90 successLast success说明
HATT coverage/event68.0%63.1%63.9%五 seed
MAPPO64 coverage/event11.9%1.1%2.5%五 seed
MAPPO288 coverage/event8.1%3.4%5.8%五 seed,actor 参数量接近 HATT

Deliver 槽位置换对 HATT best/last 成功率影响为0;Explore-sector 置换后 HATT 基本保持,MAPPO best 均值从约14.6%降到约2.6%。这些结果将容量、单 seed、单 checkpoint 和固定槽位记忆几个因素纳入了控制。

六、各项修改的性质与适用边界

修改性质实验支持边界
GAT cat/gated保留原始信息通路cat/gated 明显高于 pure gatobs固定动作 MLP 和通用节点聚合仍然存在
结构化 Dict 观测实体边界建模为 HATT 异构编码提供基础单独提交缺少独立性能归因
候选边共享 decoder任务集合归纳偏置槽位置换和规模实验提供支持候选类型高度异质时需要类型语义
联盟聚合当前成员集合建模capcoal 和 HATT v2.0 结果支持Explore、Idle、Resupply 的“联盟”含义需要单独处理
detached / split / No-Idle机制诊断和局部干预确认特殊动作与 Idle 的影响组合实验中未形成最终稳定方案
sector waypoint 重决策动作终止和策略调用语义修正成功率和任务完成率同步提高收益覆盖调度错误,仍需要可观测探索状态
observer-relative coverage探索状态与候选后果建模coverage、RNN 和 delivery-only 对照支持coverage 是近似网格;传感器或地图系统需能提供相应信息
event reconfiguration任务事件驱动的决策日程delivcoal 主线和 capcoal 因果矩阵均显示稳定化作用它会同时帮助 HATT 和 MAPPO,算法贡献需要 matched 条件比较
reward variants / learned gate训练目标与重组机制探索提供失败模式和行为指标当前结果未形成稳定主线
MAPPO288、五 seed、slot permutation结论可靠性验证控制容量、随机种子和槽位依赖这些实验提高归因可信度,不直接改变策略能力
关于“环境对齐”和“trick”的判断:coverage 改变了策略可获得的信息,sector 重决策改变了动作执行语义,event 改变了策略被调用的时机。这三项都需要在方法描述和实验配置中独立列出。coverage 的合理性取决于任务设定是否允许共享覆盖地图;event 的合理性取决于系统是否允许任务事件触发再规划。matched MAPPO 对照确保各方法获得相同状态和调度条件,HATT 在此基础上的剩余差距可归到结构和训练行为。detached、No-Idle 和多种 reward variant 更适合作为消融或诊断条件。

七、可用于论文或阶段报告的技术表述

早期 legacy GAT 使用通用节点消息传播生成图表示,再通过固定维度 MLP 输出任务动作。纯图输入会压缩局部观测,节点表示与候选任务动作之间也缺少显式共享打分结构。HATT 将观测保留为 agent 与 task 实体集合,使用异构编码和关系注意力构造 agent context,并对每个 agent-task 候选关系共享解码,同时把当前联盟成员聚合到对应任务上下文。这一结构在能力—需求匹配的 capcoal 中提高了任务排列泛化、完成效率和训练稳定性。

delivcoal 增加探索、待命、补给和持续资源调度后,候选动作语义发生扩展,探索决策还依赖过去搜索覆盖。早期 sector 观测缺少 agent-relative 动作后果及覆盖历史,waypoint 到达和新任务发现后的策略重调用也不完整。特殊动作分离实验确认了混合候选表示的局部干扰;coverage、RNN 和重决策对照进一步显示,探索状态可观测性和动作调度是影响该环境性能的主要因素。

后续实现向所有学习方法提供 observer-relative coverage,并在任务事件发生时触发再分配。五 seed、best/p90/last、参数量匹配 MAPPO 和任务槽位置换实验显示,HATT 在相同 coverage/event 条件下保持更高成功率和任务完成率。现有证据支持将最终提升拆成三部分:探索状态建模提供有效决策信息,事件日程提供动态重组机会,HATT 通过候选关系和联盟结构利用这些信息。

八、证据强度

直接验证pure GAT 与 cat/gated 的差异;特殊动作联盟上下文对 Idle logit 的影响;waypoint 重决策的行为变化;coverage 与 RNN 对照;五 seed matched MAPPO;MAPPO288 参数量控制;slot permutation。

较强推断HATT 的候选共享和联盟聚合共同解释 capcoal 与 delivcoal matched 条件下的优势。现有实验同时改变了多个 HATT 结构部件,候选 decoder 与联盟聚合各自贡献仍可通过更细的正式消融继续量化。

条件依赖coverage 对现实任务的适用性依赖可用传感与地图共享;event 对真实系统的适用性依赖任务事件后的通信和再规划能力;小规模 all-visible capcoal 存在天花板,主要适合链路检查。