一、结论总览
| 阶段 | 主要条件 | 主导机制 | 关键修改 |
|---|---|---|---|
| 早期 GAT 表现偏弱 | 通用图嵌入直接进入普通动作 MLP | 图表示形成信息瓶颈,动作维度与任务实体缺少显式对应 | cat/gated 保留原始观测;随后转向结构化观测 |
| HATT 在 capcoal 形成优势 | 能力—需求匹配、任务集合、联盟成员构成 | 异构编码、候选边共享打分、联盟聚合、任务置换等变性 | 713921、4147da、4d2385 |
| HATT 在 delivcoal 落后 | 探索、配送、待命、补给混合;探索历史影响未来动作 | 特殊动作与配送任务共用表示,sector 后果缺少 agent-relative 描述,覆盖历史不可见,动作完成后的再决策时机不完整 | 多轮信息路径、Idle、reward 和重组诊断定位问题 |
| delivcoal 下 HATT 重新领先 | observer-relative coverage、正确 sector 调度、event 重组 | 探索决策获得可辨识后果,任务事件触发再分配,HATT 在相同条件下发挥关系建模优势 | 6831b9、724362、da1e78、3e3a1f、03ed79 |
二、早期 GAT 表现偏弱:需要按融合方式拆分
早期结果中,纯图观测路径和保留原始观测的融合路径表现差异很大。2026-06-23 的32回合统一评估记录为:gatobs 25.0%,MAPPO 40.6%,legacy GAT gated 68.8%,legacy GAT cat 71.9%。因此,“GAT 低于 MAPPO”准确对应纯图瓶颈及部分早期实现;cat/gated 已经显示图关系信息能够产生收益。
2.1 纯图路径的信息压缩
Legacy GAT 先把 agent 和 task 放进统一图结构,经 GATConv 聚合后得到节点 embedding,再由普通 MLP 输出动作。节点特征的对齐、异构实体 padding、邻居聚合和全局池化会压缩自身资源、精确任务属性及其他局部观测。gatobs 让 actor 主要依赖这份压缩表示,导致与动作有关的细节难以恢复。cat 将原始观测与图 embedding 拼接,gated 允许网络调节图表示贡献,两者保留了直接信息通路,对应性能随之提升。
2.2 节点表示与任务动作缺少显式绑定
普通 MLP 的第 m 个输出参数与 task m 的输入实体之间没有共享计算结构。模型需要从数据中学习每个输出位置和任务槽位置之间的映射,任务数量、排列和场景随机化都会增加学习负担。图消息传播能够表达实体关系,最终动作头仍采用固定维度分类器,关系表示与候选动作之间存在一层未结构化的转换。
2.3 联盟状态表达不足
联盟组建动作依赖任务需求、当前成员能力和新成员的边际贡献。Legacy GAT 的通用消息聚合没有为“属于 task m 的成员集合”提供专门统计路径,任务节点也缺少稳定的当前联盟 sum、mean 和成员数描述。网络可以通过训练近似恢复这些关系,所需样本和优化难度较高。
三、HATT 在 capcoal 形成优势:结构与问题对象对齐
这一阶段包含三个连续提交。713921 将观测拆成 ego、others 和 tasks,并贯通 env、buffer、runner 与 policy;4147da 引入异构编码和 agent-agent 关系注意力;4d2385 的 HATT v2.0 为每个 agent-task 候选关系生成分数,并把当前联盟成员聚合到对应任务上下文。性能变化对应一条完整的信息链改造,单个 PPO 参数无法覆盖这些结构差异。
3.1 结构化实体边界
Dict 观测保留了自身、其他智能体和任务的实体轴。HATT 为三类输入使用各自编码器,避免将异构语义提前混入同一个扁平向量或同一种节点投影。critic 继续使用全局状态,actor 则保留实体集合结构。
3.2 候选边共享解码
所有 task 候选共享同一个 decoder。task m 的输入直接生成 task m 的 logit,任务交换时对应分数随之交换。网络学习的是一套可复用的候选评价规则,内容包括能力匹配、空间关系和联盟上下文。MAPPO 的 flatten MLP 为不同输入位置和输出位置维护位置相关参数,在实体增多与任务随机排列时承担更高的映射学习负担。
3.3 当前联盟聚合
HATT v2.0 对每个任务聚合当前成员的隐藏表示,并使用 sum、mean 和成员规模更新任务上下文。这个计算直接表达“当前任务已经得到什么资源”,候选 agent 的加入价值由 decoder 结合自身与任务上下文判断。capcoal 的核心状态正是能力、需求和联盟构成,这一结构能够充分利用环境提供的信息。
3.4 后续验证对原因解释的约束
- Deliver task-slot permutation 中,HATT 的成功率和任务完成率保持稳定,说明共享候选打分在实际 checkpoint 中体现了置换等变性。
- Explore 槽位置换对 MAPPO 影响较大,对 HATT 影响较小,显示固定槽位参数化会形成可测的顺序依赖。
- MAPPO288 actor 参数约250,530,HATT actor 参数约262,341,参数差约4.5%;容量接近后,MAPPO在 delivcoal matched 条件下仍显著落后。
- 中规模 capcoal 的有效独立评估显示,两者 best 成功率都接近满分,HATT 的回报、完成长度和训练后期稳定性更好。该结果将能力上限与部署稳定性分开描述。
四、迁移到 delivcoal 后的性能下降:任务语义和可观测性同时变化
delivcoal 将动作集合扩展为 Deliver、Explore、Idle 和 Resupply,并加入任务发现、载荷、补给、deadline、priority 和持续移动。策略需要同时处理联盟分配、探索控制和资源阶段切换。HATT v2.0 的候选任务假设在这里受到两项挑战:候选槽的语义不再同质,探索动作的合理性依赖过去覆盖历史。
4.1 特殊动作进入配送联盟表示
早期实现使用相近的候选任务路径处理 Deliver、Explore、Idle 和 Resupply。Deliver 的联盟成员表示具有明确含义;Explore 表示方向控制;Idle 表示等待;Resupply 表示资源恢复。将四类槽统一放入配送式联盟聚合,会把特殊动作的执行者和历史分配编码成类似任务联盟的上下文,Idle 偏好和特殊动作 logits 因此受到额外影响。
6831b9 引入 detached、split 和 type-conditioned 对照。detached 三 seed best 成功率约0.75、1.00、0.875,原始 HATT v2.0 同期 best 均值约0.50;固定状态干预也显示,清除 Idle 联盟上下文会降低 Idle 相对优势。这些结果确认特殊动作表示存在干扰。detached 的 last 仍为约0、0.375、0,后续 detached×coverage 因子实验中 detached 和 detached+coverage 低于 coverage alone,表明这项修正覆盖了局部机制,未覆盖探索状态和训练后期漂移。
4.2 sector 观测缺少 agent-relative 动作后果
原 sector 槽主要描述抽象探索方向。不同位置的 agent 选择同一方向后会走向不同 waypoint,经过的区域和新增覆盖也不同。共享 nominal 特征无法区分这些后果,候选分数面对相近输入时需要输出依赖当前位置和搜索历史的不同决策。
4.3 覆盖历史缺失造成状态混叠
同一个位置和任务可见集合可能对应不同搜索历史:某个 sector 已被充分搜索,另一个 sector 仍包含大片未知区域。前馈策略在缺少 coverage 状态时看到相近观测,合理动作却取决于历史。RNN-only best 约24.2%,coverage 前馈 HATT best 约74.5%,说明显式搜索状态比仅增加递归记忆更直接地解决了这一批实验中的主要信息缺口。
4.4 探索动作完成后的调度语义
6831b9 同时修正 sector waypoint 到达和新任务发现后的重新决策:agent 到达探索目标后立即请求策略决策,新任务出现时探索中的 agent 获得重新分配机会,地图边界处缺少有效移动的方向被屏蔽。真实 sector 设置下,原始 HATT best 成功率为0,加入重新决策后约29.2%,任务完成率从约27.5%提高到约76.7%。这一变化直接连接动作终止条件和策略调用时机。
4.5 多条候选解释的实验结果
| 尝试 | 观察 | 解释范围 |
|---|---|---|
| Idle-25 | 单次等待被限制,策略被唤醒后继续选择 Idle | 排查 persistent Idle 的持续时间语义 |
| No-Idle | best 提升,策略自由度被直接删除 | 诊断 Idle 是否成为有害吸引点 |
| raw / physics / resource / setctx | 部分 checkpoint 改善,latest 仍波动 | 检查 decoder 信息量和资源阶段特征 |
| reward v1-v5 | 算法与 reward mode 高度耦合,跨 checkpoint 稳定性不足 | 检查局部 credit 和 potential shaping |
| learned/switch/hierarchical gate | 重组动作更可解释,成功率未稳定超过规则日程 | 检查学习式重组时机 |
| coverage | 发现率、任务完成率和成功率同步大幅提高 | 直接补充探索动作的状态与后果信息 |
五、delivcoal 主线形成:coverage、sector 调度与 event 的组合
5.1 724362:observer-relative coverage
该提交增加 coverage 网格,使用 agent 感知范围近似记录已搜索区域;每个 agent 的 sector 候选根据自身位置计算实际目标;Explore 观测加入沿路径预计新增覆盖、路径长度和全局未搜索比例。网络输入维度保持兼容,新增特征通过已有结构化任务行进入策略。
三 seed 对照中,HATT+coverage best 约74.5%,HATT+RNN约24.2%,HATT+coverage+RNN约70.3%,MAPPO+coverage约4.4%。HATT+coverage 的发现率约98.2%、任务完成率约96.9%,执行探索比例下降,执行配送比例上升。结果显示 coverage 主要改变了探索行为的可辨识性和阶段切换。
5.2 da1e78:event reconfiguration
event 日程在新任务发现、任务完成、当前任务失效和 mandatory 状态变化时重新激活 agent。它为持续移动和长期任务承诺提供明确的中断点,使策略能够使用新状态重新分配。learned gate 系列进一步分离了保持与重选动作,当前实验中规则 event 的性能和可解释性更稳定。
5.3 严格 matched 对照
3e3a1f 建立相同 coverage、event、训练长度、评估场景和 checkpoint 选择的 MAPPO64 对照;4fca7b3 加入参数量接近的 MAPPO288;03ed796 修复 MAPPO288 checkpoint 重建参数透传,并扩展到五个随机种子。最终128回合独立评估汇总如下:
| 方法 | Best success | P90 success | Last success | 说明 |
|---|---|---|---|---|
| HATT coverage/event | 68.0% | 63.1% | 63.9% | 五 seed |
| MAPPO64 coverage/event | 11.9% | 1.1% | 2.5% | 五 seed |
| MAPPO288 coverage/event | 8.1% | 3.4% | 5.8% | 五 seed,actor 参数量接近 HATT |
Deliver 槽位置换对 HATT best/last 成功率影响为0;Explore-sector 置换后 HATT 基本保持,MAPPO best 均值从约14.6%降到约2.6%。这些结果将容量、单 seed、单 checkpoint 和固定槽位记忆几个因素纳入了控制。
六、各项修改的性质与适用边界
| 修改 | 性质 | 实验支持 | 边界 |
|---|---|---|---|
| GAT cat/gated | 保留原始信息通路 | cat/gated 明显高于 pure gatobs | 固定动作 MLP 和通用节点聚合仍然存在 |
| 结构化 Dict 观测 | 实体边界建模 | 为 HATT 异构编码提供基础 | 单独提交缺少独立性能归因 |
| 候选边共享 decoder | 任务集合归纳偏置 | 槽位置换和规模实验提供支持 | 候选类型高度异质时需要类型语义 |
| 联盟聚合 | 当前成员集合建模 | capcoal 和 HATT v2.0 结果支持 | Explore、Idle、Resupply 的“联盟”含义需要单独处理 |
| detached / split / No-Idle | 机制诊断和局部干预 | 确认特殊动作与 Idle 的影响 | 组合实验中未形成最终稳定方案 |
| sector waypoint 重决策 | 动作终止和策略调用语义修正 | 成功率和任务完成率同步提高 | 收益覆盖调度错误,仍需要可观测探索状态 |
| observer-relative coverage | 探索状态与候选后果建模 | coverage、RNN 和 delivery-only 对照支持 | coverage 是近似网格;传感器或地图系统需能提供相应信息 |
| event reconfiguration | 任务事件驱动的决策日程 | delivcoal 主线和 capcoal 因果矩阵均显示稳定化作用 | 它会同时帮助 HATT 和 MAPPO,算法贡献需要 matched 条件比较 |
| reward variants / learned gate | 训练目标与重组机制探索 | 提供失败模式和行为指标 | 当前结果未形成稳定主线 |
| MAPPO288、五 seed、slot permutation | 结论可靠性验证 | 控制容量、随机种子和槽位依赖 | 这些实验提高归因可信度,不直接改变策略能力 |
七、可用于论文或阶段报告的技术表述
早期 legacy GAT 使用通用节点消息传播生成图表示,再通过固定维度 MLP 输出任务动作。纯图输入会压缩局部观测,节点表示与候选任务动作之间也缺少显式共享打分结构。HATT 将观测保留为 agent 与 task 实体集合,使用异构编码和关系注意力构造 agent context,并对每个 agent-task 候选关系共享解码,同时把当前联盟成员聚合到对应任务上下文。这一结构在能力—需求匹配的 capcoal 中提高了任务排列泛化、完成效率和训练稳定性。
delivcoal 增加探索、待命、补给和持续资源调度后,候选动作语义发生扩展,探索决策还依赖过去搜索覆盖。早期 sector 观测缺少 agent-relative 动作后果及覆盖历史,waypoint 到达和新任务发现后的策略重调用也不完整。特殊动作分离实验确认了混合候选表示的局部干扰;coverage、RNN 和重决策对照进一步显示,探索状态可观测性和动作调度是影响该环境性能的主要因素。
后续实现向所有学习方法提供 observer-relative coverage,并在任务事件发生时触发再分配。五 seed、best/p90/last、参数量匹配 MAPPO 和任务槽位置换实验显示,HATT 在相同 coverage/event 条件下保持更高成功率和任务完成率。现有证据支持将最终提升拆成三部分:探索状态建模提供有效决策信息,事件日程提供动态重组机会,HATT 通过候选关系和联盟结构利用这些信息。
八、证据强度
直接验证pure GAT 与 cat/gated 的差异;特殊动作联盟上下文对 Idle logit 的影响;waypoint 重决策的行为变化;coverage 与 RNN 对照;五 seed matched MAPPO;MAPPO288 参数量控制;slot permutation。
较强推断HATT 的候选共享和联盟聚合共同解释 capcoal 与 delivcoal matched 条件下的优势。现有实验同时改变了多个 HATT 结构部件,候选 decoder 与联盟聚合各自贡献仍可通过更细的正式消融继续量化。
条件依赖coverage 对现实任务的适用性依赖可用传感与地图共享;event 对真实系统的适用性依赖任务事件后的通信和再规划能力;小规模 all-visible capcoal 存在天花板,主要适合链路检查。