文档日期:2026-08-23
适用对象:论文作者、项目协作者、代码代理、首次接触本项目的读者
证据范围:截至 2026-08-23 已完成的代码、原稿、CHANGELOG.yaml、正式训练与评估结果
核心环境:DelivCoal;补充环境:CapCoal;外部环境接口:GymRT2A
本文档从零开始说明项目研究内容,并将工程事实与论文主张分开组织。
全文回答五个问题:
文档包含两套核心材料:
两套材料不要求逐项对应。环境修复、训练稳定化、失败分支和评估工程具有重要研究价值,其中部分内容适合进入实验、附录或复现说明。论文创新需要形成更集中、更抽象的方法主线。
项目研究多智能体联盟形成与多机器人任务分配问题。系统包含异构无人机 UAV 和无人车 UGV。机器人在连续二维地图中执行探索、发现任务、选择任务、形成联盟、配送物资、补给能源和规避危险等行为。
配送任务具有位置、剩余需求、优先级、期限或紧迫度等状态。机器人具有位置、能力、载荷、电量、类型和当前任务等状态。单个机器人可能无法满足任务需求,多个机器人选择同一任务后形成执行联盟。
项目的主要训练框架为 MAPPO/RMAPPO。HATT 为 actor 提供结构化的机器人—任务表示和逐候选任务评分。集中式 critic 在训练阶段使用全局状态,actor 在执行阶段根据其观测独立产生任务动作。
项目包含两类内部环境和一个外部环境接口:
| 环境 | 主要用途 | 当前状态 |
|---|---|---|
| DelivCoal | 探索、隐藏任务发现、联盟配送、补给和动态重决策 | 当前论文主环境,正式五 seed 结果已完成 |
| CapCoal | 全任务可见条件下的能力需求匹配与联盟执行 | 中规模结果显示 HATT 的效率与训练后期保持优势 |
| GymRT2A | 对接公开 MARL-MRT2A 问题、官方 PCFA 和空间动作策略 | 接口和 smoke 已建立,尚无有效正式性能结果 |
当前研究关注以下问题:
一个 episode 中的主要流程如下:
初始化地图、机器人、隐藏配送任务和危险区域
↓
机器人选择探索区域、配送任务、补给或待命
↓
移动与路径执行,更新能量、载荷和地图覆盖
↓
探索过程中发现新的配送任务或危险区域
↓
任务事件触发高层重新决策
↓
多个机器人选择相同任务并形成当前执行联盟
↓
联盟成员到达任务点并完成物资配送
↓
所有任务完成或达到最大步数后结束 episode
机器人状态包含:
UAV 与 UGV 在移动、视野、载荷和地形通过能力上存在差异。异构性同时影响探索效率、路径可达性和配送能力。
任务集合包含:
配送任务在默认 DelivCoal 设置中初始不可见。任务被发现后,任务位置和状态进入 actor 的任务观测。当前实现使用团队共享的已发现任务状态。
每个机器人选择一个任务 token:
\[ a_i^t\in\mathcal A_i^t. \]
多个机器人选择同一任务 \(j\) 时,当前任务联盟为:
\[ C_j^t=\{i\mid a_i^t=j\}. \]
该动作语义直接从联合任务选择诱导联盟结构。actor 只需要输出机器人对可用任务的分类分布,无需在每一步显式列举所有机器人子集和联盟划分。
环境支持多种高层任务重选日程:
当前正式主设置使用 Event。实验显示 Always 容易导致频繁重选和性能下降;Event 可以稳定运行;Event 相对 Legacy 的任务成功优势尚未形成稳定证据;Learned gate 可以改变切换行为,但没有稳定提高任务成功率。
因此,Event 在当前论文结构中适合作为决策协议。各种重选方式适合进入消融和响应—稳定性分析。
Actor 使用 Dict 观测:
ego 当前机器人自身状态
tasks 当前机器人可见的任务候选矩阵
others 其他机器人状态矩阵,对角线自身位置置零
任务观测在不同设置下可以包含:
Actor 可以观察其他机器人的状态。任务一旦发现即进入团队共享任务状态。Coverage 使用全队共享的 _explored_cells。因此,当前执行假设包含共享任务信息和共享探索地图。论文需要明确通信或地图融合条件。
奖励由多种事件组成:
当前 HATT-MAPPO 的性能依赖个体 shaped credit。Team-mean reward 实验显著退化,说明关系结构、可观测状态与个体信用共同决定可学习性。论文实验需要保证所有学习基线使用相同奖励和环境配置。
| 功能 | 文件 |
|---|---|
| 训练入口 | train/train.py |
| 共享训练循环 | runner/shared/macf_runner.py |
| HATT/GAT策略路由 | algorithms/algorithm/gaRMAPPOPolicy.py |
| HATT v2.0 主方法 | algorithms/algorithm/HATTV20Network.py |
| HATT v3.3AA 扩展 | algorithms/algorithm/HATTV33AANetwork.py |
| PPO更新 | algorithms/algorithm/ga_rmappo.py |
| HATT专用buffer | utils/shared_gat_buffer.py |
| DelivCoal环境 | envs/delivcoal/env_core.py |
| 观测与state工具 | utils/obs_utils.py |
| 配置参数 | config.py、config.yaml、rewards.yaml |
ego / others / tasks
↓
类型专属 FeatureEncoder
↓
focal agent 表示、other agent 表示、task 表示
↓
全局 A-A attention(v2 full 可选)
↓
按当前任务编号将成员 scatter 到对应任务槽
↓
每个任务得到 coalition sum / mean / count
↓
任务状态与当前联盟状态融合
↓
共享 CandidateEdgeDecoder 逐任务输出 logit
↓
available-action mask + categorical softmax
↓
每个机器人选择任务,联合动作诱导新联盟
HATT 分别编码:
三类实体投影到相同隐藏维度,但参数独立。任务编号和联盟编号不作为连续语义特征直接进入实体编码器。编号主要用于动作对应、关系特征和联盟成员路由。
HATT v2.0 对 focal agent 和其他机器人计算多头 A-A attention。边特征包括:
No-AA 实验显示该分支没有稳定的独立性能收益。注意力熵接近最大值,说明 v2 的全局、任务无关 A-A attention 学成了接近均匀的聚合。
对于候选任务 \(j\),当前成员集合为 \(C_j^t\)。每个成员先经过 agent encoder:
\[ h_k^t=\phi_A(o_k^t). \]
联盟集合表示为:
\[ \rho(C_j^t)= \left[ \sum_{k\in C_j^t}h_k^t, \frac{1}{|C_j^t|}\sum_{k\in C_j^t}h_k^t, |C_j^t| \right]. \]
实际实现使用 scatter-add 将成员表示送入对应任务槽,并计算 latent sum、mean 和 normalized count。
任务条件表示为:
\[ z_j^t=F_T\left(x_j^t,\rho(C_j^t)\right). \]
其中 \(x_j^t\) 为任务特征。该结构使每个任务候选都携带其当前联盟执行状态。
对于机器人 \(i\) 和候选任务 \(j\),actor 计算:
\[ p_{ij}^t= G_\theta\left(h_i^t,z_j^t,e_{ij}^t\right), \]
其中:
动作分布为:
\[ \pi_\theta(a_i^t=j)= \frac{\exp(p_{ij}^t)} {\sum_{m\in\mathcal A_i^t}\exp(p_{im}^t)}. \]
这里的 \(p_{ij}^t\) 可以定义为状态依赖的条件联盟偏好。它表示当前机器人在任务 \(j\) 的现有联盟和执行状态下选择该任务的策略偏好。
该 logit 没有精确联盟价值、Shapley value 或边际效用保证。HATT v2.0 也没有显式构造机器人加入前后的反事实联盟。
对于探索候选 \(j\),任务特征可写成:
\[ x_{ij}^{\mathrm{explore}}= \left[ g_{ij}, d_{ij}, \Delta\mathrm{Cov}_{ij}, 1-\mathrm{Cov}^t \right], \]
其中:
配送候选包含任务需求、期限、优先级和当前联盟状态。探索、配送、补给和待命共同进入候选评分空间。
设 \(P_A\) 为任务 \(j\) 当前联盟成员顺序的任意置换。由于 sum、mean 和 count 均为对称聚合:
\[ \rho(P_A C_j^t)=\rho(C_j^t). \]
因此,忽略浮点误差并保持成员特征与 membership 不变时:
\[ p_{ij}^t(P_A C_j^t)=p_{ij}^t(C_j^t). \]
该性质来自网络结构。论文方法章节可以给出简短命题和证明。建议补充一个成员顺序置换测试,与现有任务槽置换实验形成对应。
设 \(P_T\) 为候选任务槽的一致置换,同时置换:
共享任务编码器、共享候选评分器和任务索引联盟聚合共同给出:
\[ \mathbf p_i(P_T O)=P_T\mathbf p_i(O). \]
Softmax 与置换可交换,因此:
\[ \pi_\theta(P_Ta_i\mid P_TO)= P_T\pi_\theta(a_i\mid O). \]
当前 Deliver 槽置换实验结果一致,Explore 槽置换影响很小,为实现层提供了验证。
当前模型采用固定最大任务槽数和 mask。上述性质适用于该固定候选预算内的一致重标号。它不自动推出任意未见任务规模的零样本泛化。
设机器人数量为 \(N\),任务候选数量为 \(M\)。显式联合任务动作最多包含:
\[ M^N \]
种组合。当前 actor 为每个机器人评价 \(M\) 个任务候选。忽略隐藏维度常数:
该复杂度说明策略前向计算随机器人和任务数量按多项式增长。它不提供全局最优联盟划分保证。
下表完整记录当前项目已经完成的主要内容。表中“论文角色”用于区分主方法、问题设置、训练条件、实验对照和历史探索。
| 层级 | 已完成内容 | 解决的问题 | 当前证据 | 论文角色 |
|---|---|---|---|---|
| 问题建模 | DelivCoal 动态异构环境 | 联合探索、发现、联盟配送、补给与危险规避 | 可稳定训练和正式评估 | 主问题 |
| 异构机器人 | UAV/UGV 类型、能力、视野、速度、载荷、能量差异 | 表达能力和资源约束 | 两类内部环境已运行 | 问题定义 |
| 隐藏任务 | Delivery 初始不可见,探索后发现 | 联合信息获取与执行 | 发现率和覆盖指标完整 | 问题定义 |
| 联盟形成 | 多机器人选择同一任务形成联盟 | 避免显式枚举机器人子集 | 所有正式实验采用 | 方法建模 |
| 事件重决策 | 发现、完成和执行事件触发重选 | 控制高层决策时机 | Event 稳定;相对 Legacy 优势未确认 | 决策协议 |
| Urgency重构 | 多种紧迫度聚合与阈值 | 检验紧迫度触发逻辑 | 未稳定提高任务结果 | 消融 |
| Learned gate | mixture、switch、hierarchical、事件上下文、切换成本 | 学习保持或重选 | 改变切换行为;任务收益未确认 | 负结果/附录 |
| Actor观测 | ego/tasks/others Dict | 保留实体和候选结构 | 正式训练已完成 | 方法输入 |
| 团队共享状态 | 其他机器人、已发现任务、共享 coverage | 支持联盟和探索状态 | 性能重要;含通信假设 | 方法假设 |
| 类型编码 | ego、other、task 独立编码 | 处理异构实体语义 | 主路径稳定 | 方法组件 |
| ID路由 | task/coalition ID 用于关系和 scatter,不进入实体语义编码 | 保持任务对应关系 | 槽置换实验支持 | 方法组件 |
| v2全局AA | 多头 A-A attention | 聚合队友状态 | No-AA 与 full 接近 | 辅助组件 |
| 任务索引联盟聚合 | 成员按当前任务 scatter | 为每个任务建立当前联盟状态 | Full/no-coalition 差异稳定 | 核心组件 |
| 联盟集合表示 | latent sum、mean、count | 表达成员动态状态和规模 | 中高强度正向证据 | 核心组件 |
| 任务上下文融合 | task embedding 与 coalition state 融合 | 形成逐任务执行上下文 | Coalition消融支持 | 核心组件 |
| 共享候选评分 | 同一 MLP 评价全部 agent-task 候选 | 形成一致的候选策略 | 槽置换支持 | 核心组件 |
| 动作mask | 屏蔽未发现、已完成和不可行动作 | 保证动作可执行 | 全部正式实验采用 | 实现细节 |
| Sector探索 | 探索动作映射到区域候选 | 将搜索方向纳入高层任务空间 | 修复后稳定可学 | 状态/动作设计 |
| Relative geometry | per-agent sector goal、leg distance | 表示探索执行代价 | 小到中等收益 | 状态表示 |
| Coverage state | novel coverage、remaining unexplored | 表示探索进展和信息增益 | 约30个百分点以上收益 | 重要状态贡献 |
| 特殊动作 | Explore/Idle/Resupply/Delivery统一候选集合 | 联合控制与配送行为 | 分离版本跨协议结果不一致 | 系统设计 |
| Idle语义 | 统一时间成本、有限等待、reserve诊断 | 排除待命偏置 | 原地reserve无普遍收益 | 环境/消融 |
| Reward shaping | 个体与联盟奖励、距离、发现、补给、终局 | 提供可学习信号 | 对HATT-MAPPO重要 | 训练条件 |
| Individual credit | focal行为相关奖励 | 缓解信用传播 | team-mean显著退化 | 训练条件 |
| MAPPO训练 | HATT actor + 集中式critic + PPO | 学习分散任务策略 | 五seed正式完成 | 优化方法 |
| MAPPO-288 | 参数量匹配扁平actor | 排查网络容量 | 22.8%对HATT 72.2% | 主要基线 |
| MAPPO-64 | 标准小网络actor | 标准MAPPO比较 | Validation-best 10.2% | 主要基线 |
| No-coalition | 联盟上下文置零并保持参数形状 | 检验联盟状态作用 | 72.2%降至61.9% | 核心消融 |
| No-AA | 全局AA输出置零 | 检验v2机器人关系分支 | 独立收益未确认 | 核心消融 |
| Joint消融 | 同时移除AA和coalition | 检验剩余候选结构 | 共同seed约57.8% | 结构归因 |
| 槽位置换 | 一致置换Deliver/Explore候选 | 检验任务编号依赖 | HATT稳定,MAPPO更敏感 | 性质验证 |
| Formal validation | 每50 episode、32 seeds | 独立模型选择 | 已完成 | 评估协议 |
| Held-out test | validation-best/last各128 seeds | 检验锁定模型泛化 | 已完成 | 主要结果 |
| Final-window | 最后10%逐checkpoint评估 | 检查训练末期稳定性 | HATT明显较强 | 稳定性结果 |
| CapCoal | 全任务可见能力联盟环境 | 分离探索变量 | HATT效率和后期保持较好 | 补充环境 |
| GymRT2A | 官方环境和MARL-MRT2A接口 | 外部公开环境比较 | 接口已建立,性能未完成 | 待补证据 |
| PCFA | 市场化规则联盟基线 | 提供非学习比较 | 已重写,未进正式矩阵 | 待补基线 |
| QMIX/VDN | 普通与HATT值分解路径 | 比较off-policy路线 | 当前性能较弱 | 补充/附录 |
| v3.2R | transition、member residual、候选加入变化 | 研究候选转换 | 未稳定超过no-member | 历史探索 |
| v3.3AA | typed AA/AT、learned/uniform gate | 研究任务路由后的AA选择 | learned约62.5%,uniform约54.2%,仍低于v2 | 扩展分析 |
| 实验工程 | 原子状态、异步评估、checkpoint冻结、进度发布 | 保证可恢复和可追踪 | 已支撑正式矩阵 | 复现说明 |
本节采用两级组织。一级总结每个研究阶段解决的核心问题和形成的阶段结论;二级保留日期、具体改动、有效性与重要性,供实验追溯。重要性采用 10 分制:9–10 分表示直接决定论文结论或正式实验可信度,7–8.5 分表示重要机制、对照或环境修复,5–6.5 分表示辅助研究和工程保障。
| 阶段 | 时间 | 核心研究目标 | 阶段产出 | 对论文的作用 |
|---|---|---|---|---|
| I. 问题与原型形成 | 06-28 至 07-08 | 将动态异构联盟研究落实为可训练的问题、环境和结构原型 | HATT v3.x 探索分支;sector/survey;CapCoal/DelivCoal 分工;事件重决策语义 | 确定问题边界和后续研究对象 |
| II. 环境语义与状态表征定位 | 07-17 至 08-01 | 区分网络结构、环境语义、观测缺失和特殊动作带来的影响 | 独立评估对齐;候选信息路径;sector 修复;coverage state;Idle 语义审计 | 确立候选级探索状态这一环境端贡献 |
| III. 动态重构与主方法筛选 | 08-01 至 08-09 | 评价重构日程并排除容量、任务编号等替代解释 | Event 主协议;Learned/Urgency/Always 对照;参数匹配 MAPPO;槽位置换 | 收敛主方法,形成第一轮高置信结构证据 |
| IV. 跨环境与优化路线检验 | 08-10 至 08-17 | 检查方法在能力联盟环境和不同 MARL 优化路线中的表现 | 中规模 CapCoal;QMIX/VDN/HATT-QMIX;individual credit 诊断 | 明确 MAPPO 路线与奖励信用条件,补充环境边界 |
| V. 正式证据闭环与结构归因 | 08-17 至 08-23 | 建立可用于论文的模型选择、held-out 和机制归因证据 | 37-job 正式矩阵;五 seed;128-seed held-out;final-window;coalition/coverage/AA 归因 | 形成当前论文主结论与证据边界 |
阶段判断: 这一阶段完成了研究问题落地。主要价值来自环境与决策语义的形成,早期网络版本承担机制探索和诊断工具建设,其短评估数字只用于产生后续假设。
| 日期 | 关键改动 | 是否有效 | 阶段价值 | 重要性 |
|---|---|---|---|---|
| 06-28 至 06-29 | 建立 HATT v3.0、v3.1、v3.2,引入候选加入变化、成员交互、过渡信息和诊断量;重写 PCFA。 | 工程有效;性能依据有限 | 建立关系与候选转换的研究接口,为 v3.2R、v3.3AA 和结构干预提供基础。 | 8.0 |
| 06-29 至 07-03 | 引入 sector/survey 探索、coalition_delivery、PPO KL/clip early stopping 和配送 reward shaping。 |
语义修复后有效 | waypoint 到达和任务发现后的重决策修复使 HATT best 从 0 提高到约 29.2%,确认高层决策必须与环境事件对齐。 | 9.0 |
| 07-03 至 07-08 | 拆分 CapCoal 与 DelivCoal;增加 HATT v2.4–v2.7、任务类型、动态服务聚合、局部 credit、potential shaping 和 requirement 表征。 | 部分有效 | CapCoal 承担能力—需求联盟研究,DelivCoal 承担探索—配送耦合研究;best/latest 分离推动评估协议升级。 | 9.0 |
阶段判断: 这一阶段将性能问题分解为环境事件、候选状态、特殊动作和网络信息路径。Coverage progress state 成为最重要的环境端改动;RNN、raw bypass 和原地 reserve 等分支完成了有依据的筛选。
| 日期 | 关键改动 | 是否有效 | 阶段价值 | 重要性 |
|---|---|---|---|---|
| 07-17 | 增加 task-type 行为指标,使训练期评估与独立评估对齐,并分析 checkpoint 关系。 | 有效 | 固定多 seed validation 取代单局 reward/length,best 与 latest 的差距进入稳定性分析。 | 9.0 |
| 07-19 | 接入 GymRT2A、空间候选 HATT actor 和 MARL-MRT2A 官方入口。 | 接口与 smoke 有效;性能证据尚缺 | 建立公开环境验证路径,同时明确当前跨环境证据缺口。 | 7.0 |
| 07-21 至 07-23 | 增加 raw、physics、task-attention、resource、set-context、no-idle 路径及 Idle-25 诊断。 | 诊断有效 | raw bypass 没有改善;resource 与 set-context 的旧协议信号把研究焦点推进到载荷阶段、候选集合和特殊动作语义。 | 8.5 |
| 07-24 至 07-28 | 分离特殊控制动作与 Deliver 联盟聚合;修复 sector event redecision 和无效边界方向;统一进度与 checkpoint 状态。 | 环境修复有效;detached 条件有效 | sector 修复带来明确改善。detached 的早期高结果未跨协议保持,因此保留为特殊动作污染的机制诊断。 | 9.5 |
| 07-29 至 07-30 | 增加 observer-relative goal、leg distance、coverage 网格、novel coverage 和 remaining unexplored;比较前馈、RNN 与 coverage。 | 明显有效 | HATT+coverage best 约 74.5%,HATT+RNN 约 24.2%。探索进展需要显式候选状态,RNN 无法补足该信息。 | 10.0 |
| 07-30 | 执行 all-discovered 和 delivery-only 条件评估。 | 有效 | all-discovered deterministic success 约 94.8%,将 coverage 的主要作用定位到搜索观测和搜索调度。 | 8.0 |
| 07-31 至 08-01 | 统一 Idle 时间成本,构造延迟任务、待命位置和服务承诺诊断。 | 奖励语义修复有效;reserve 未进入主方法 | 取消额外 Idle 惩罚后 HATT best 从约 13.3%提高到约 27.3%;待命位置与服务承诺成为环境边界。 | 7.5 |
阶段判断: 重构研究确定了 Event 作为稳定且语义清晰的执行协议。参数匹配、五训练 seed 和任务槽置换把主方法优势收敛到结构化候选策略,容量和固定槽位置得到直接控制。
| 日期 | 关键改动 | 是否有效 | 阶段价值 | 重要性 |
|---|---|---|---|---|
| 08-01 至 08-05 | 实现 Legacy、Always、Periodic、Event、Urgency 和 Learned 重构;测试多种 gate、事件上下文和切换成本。 | Event 有效;学习型 gate 完成筛选 | Always 和 force-closed 明显退化;Learned gate 改变切换行为但未稳定改善成功率。Event 成为正式主协议。 | 9.0 |
| 08-05 至 08-09 | 完成 detached×coverage、MAPPO-64/204/288、训练 seed 4/5 和任务槽置换。 | 明显有效 | HATT 五 seed 优势稳定;MAPPO-288 参数量接近 HATT;HATT 对 Deliver/Explore 槽置换稳定。 | 10.0 |
阶段判断: CapCoal 补充了全任务可见条件下的联盟执行证据;值分解路线与 team-mean reward 实验说明当前性能依赖结构化 actor、MAPPO 更新和个体 shaped credit 的共同作用。
| 日期 | 关键改动 | 是否有效 | 阶段价值 | 重要性 |
|---|---|---|---|---|
| 08-10 至 08-13 | 重建 30-agent、25-task 中规模 CapCoal,并修复交叉评估 guard 和配置继承。 | 有效 | HATT best/p90/last 约 99.5%/97.4%/97.9%,完成步数低于 MAPPO;结果支持效率和后期保持,成功率存在天花板。 | 8.5 |
| 08-13 至 08-17 | 建立 QMIX、VDN、HATT-QMIX,修复 off-policy 更新与 mask,并筛选更新强度和 reward scale。 | 工程有效;性能较弱 | QMIX 系列未接近 HATT-MAPPO;team-mean HATT-MAPPO 明显退化,确认 individual credit 是当前主结果的重要训练条件。 | 8.0 |
阶段判断: 这一阶段把早期性能信号转化为可用于投稿的证据链。模型选择、独立测试、训练末期稳定性和组件归因分别评价,HATT 主结果、coverage 作用和 coalition context 作用获得多训练 seed 支持。
| 日期 | 关键改动 | 是否有效 | 阶段价值 | 重要性 |
|---|---|---|---|---|
| 08-17 | 固定每 50 episode × 32 validation seeds、锁定 validation-best、best/last × 128 held-out 和最后 10% 逐 actor 评估。 | 有效 | 分离模型选择、独立泛化和训练末期稳定性,建立论文主结果协议。 | 9.5 |
| 08-18 至 08-19 | 完成 DelivCoal 37-job 正式训练矩阵、15 个 OOM job 恢复和逐 episode actor 保存。 | 有效 | 37/37 训练完成,共 54,197 个 actor checkpoint;正式比较矩阵保持完整。 | 9.0 |
| 08-19 至 08-20 | 训练 v3.2R full、no-transition、no-member 各 3 seeds,并修正 source-leave/target-join 表示。 | 实现有效;member residual 未进入主方法 | 9/9 训练完成,full 未稳定超过 no-member;v3.2R 保留为候选转换探索。 | 8.0 |
| 08-20 至 08-21 | 分离 geometry 与 coverage state,训练 matched HATT/MAPPO 和 coalition joint 消融。 | 明显有效 | HATT full/no-coverage/geometry-only 为 70.8%/33.9%/31.5%;结果将主要环境端贡献定位为 coverage state,将主要算法端增益定位为 coalition context。 | 10.0 |
| 08-21 至 08-22 | 完成 held-out test 和最后 10% checkpoint 评估。 | 完成且有效 | HATT validation-best/last/末期为 72.2%/65.2%/75.5%,显著高于 MAPPO-288 和 MAPPO-64;性能、泛化和末期稳定性方向一致。 | 10.0 |
| 08-22 至 08-23 | 诊断 v2 AA 的近均匀注意力,完成 v3.3AA typed AA/AT 与 learned/uniform 对照。 | 扩展分析有效 | learned AA held-out 均值约 62.5%,uniform 约 54.2%;条件关系选择出现初步信号,绝对性能仍低于 v2 主结果。 | 9.0 |
这段研究演进形成了四项可以直接进入阶段报告的认识:
| 方法 | Validation-best success | Last success | 最后10% success |
|---|---|---|---|
| HATT full | 72.2% | 65.2% | 75.5% |
| MAPPO-288 | 22.8% | 5.9% | 5.1% |
| MAPPO-64 | 10.2% | 1.1% | 3.7% |
HATT actor 约262,341个参数,MAPPO-288约250,530个参数,差异约4.5%。当前协议下的性能差异无法由参数量单独解释。
| 方法 | Validation-best success | Last success | 最后10% success |
|---|---|---|---|
| HATT full | 72.2% | 65.2% | 75.5% |
| HATT no-coalition | 61.9% | — | 58.9% |
Validation-best 和末期窗口方向一致,支持任务索引联盟上下文在当前 DelivCoal 协议中的正向作用。
共同训练 seed 的 held-out validation-best:
| 设置 | Success |
|---|---|
| HATT full | 70.8% |
| HATT no-coverage | 33.9% |
| HATT geometry-only | 31.5% |
Geometry 只能解释较小部分收益,coverage progress state 提供主要贡献。当前结论适用于团队共享 coverage 的设置。
| 方法 | Validation-best | Last | 最后10% |
|---|---|---|---|
| HATT full | 72.2% | 65.2% | 75.5% |
| HATT no-AA | 69.2% | 69.2% | 76.5% |
三种口径方向不一致,差异较小。v2 全局、任务无关 AA 的独立增益没有得到支持。
该实验支持 HATT 对任务重标号的结构一致性,并说明扁平 MAPPO 更容易依赖固定槽位置。
这些结果适合形成重构日程的行为分析和方法边界。
在三训练 seed、128-seed held-out test 中:
该结果提供了 learned typed AA 相对 uniform gate 的初步正向信号。其绝对性能低于 v2.0 主结果;原计划的同 checkpoint learned/uniform/zero 因果干预未随192项正式任务完成。v3.3AA 目前适合进入扩展分析。
| 工作 | 已覆盖内容 | 对本文的影响 |
|---|---|---|
| ScheduleNet, RSS 2020 | 异构图注意力、多机器人调度、机器人与时空约束节点 | 通用异构图注意力已有成熟先例 |
| DCMRTA, ICRA 2024 | agent/task encoder、cross-attention、共享任务选择、动态联盟 | 共享候选选择和动态联盟已有相邻设计 |
| LVWS, ICRA 2024 | 机器人—任务奖励矩阵、动态子联盟、Idle、图注意力与匹配 | 候选奖励矩阵和动态subteam已有相邻设计 |
| HeteroMRTA, RA-L 2025 | 异构skills、任务需求、剩余能力需求、当前工作状态、cross-attention | 与coalition-conditioned candidate最接近的公开结构之一 |
| Learning Policies for Dynamic Coalition Formation, RA-L 2025 | MAPPO、部分可观测、空间动作、任务修订、意图共享 | 动态联盟MARL和任务重选已有直接基线 |
| SADCHER | 动态异构联盟、任务先后约束、assignment reward、实时重分配 | 逐robot-task reward预测已有相邻工作 |
| IAOM, RA-L 2026 | 未知scout-rescue任务、目标/角色/ETA意图、residual demand、active commitments、GAT-PPO | 场景与执行承诺建模最接近,需要专门比较 |
现有代码和结果能够支持:
以下主张缺少充分支持:
原稿提出三条主线:互补—适配异构图对合作与竞争关系进行显式建模;紧迫性感知重构在响应效率与执行稳定性之间进行权衡;在异构救援环境中验证完成率、响应时间、能量效率和可扩展性。三条主线的研究动机完整,理论措辞也较强。当前代码与实验对其中若干关键机制给出了更细致的结果。
| 原稿主张 | 当前实现与结果 | 发表层面的判断 | 建议处理 |
|---|---|---|---|
| 互补—适配异构图显式表达合作与竞争 | HATT 实际采用类型专属编码、任务索引联盟集合聚合和共享候选评分。v2 A-A attention 接近均匀;现有 logit 没有预定义的正负关系语义。 | 原稿概念高度较强,机制定义与实验归因仍有缺口。当前方法可由代码、消融和结构性质直接支撑,审稿可验证性更强。 | 将“合作与竞争”保留为动态联盟的现象背景;方法主张聚焦条件联盟偏好和逐候选联盟上下文。 |
| 紧迫性感知重构实现响应—稳定自适应权衡 | Urgency 与多类 Learned gate 已实现。Event 可稳定运行;Learned gate 能改变切换行为,任务成功收益未形成稳定证据。 | 原稿主张需要正向任务指标与机制干预共同支持。当前结果足以形成重构日程分析,尚不足以承担主要算法贡献。 | Event 作为决策协议;Always、Urgency、Learned 作为响应—稳定性消融和局限性讨论。 |
| 异构救援验证性能、能效与可扩展性 | DelivCoal 已有五训练 seed、held-out 和末期窗口;CapCoal 提供补充结果;GymRT2A 尚无正式性能;规模曲线、能效主指标和实机结果仍缺。 | 内部环境证据强度显著提升,跨环境和可扩展性证据仍需补齐。 | 主结果使用 DelivCoal;CapCoal 进入补充实验;公开 MRTA、推理规模曲线和通信假设审计列为投稿前重点。 |
从发表角度看,当前实际方法具备更强的可论证性。优势来自三点:方法定义与代码一致;核心组件已有成组消融;成员置换不变性、任务重标号等变性和候选计算规模可以写成明确的结构性质。原稿提供了有价值的问题动机,其中“显式合作—竞争”和“自适应重构收益”需要更多机制与实验支撑,现阶段适合放在背景、讨论或后续研究中。
当前描述需要随实际证据收敛。建议摘要、引言和贡献列表统一使用“联盟条件候选策略”主线,并把理论高度建立在条件偏好定义、集合不变性、任务等变性和复杂度分析上。这样得到的理论陈述范围清晰,也能够与 HeteroMRTA、DCMRTA、SADCHER 和 IAOM 做逐项比较。
中文:
面向动态异构联盟形成的联盟条件候选策略
英文:
Coalition-Conditioned Candidate Policy for Dynamic Heterogeneous Multi-Robot Task Allocation
若论文强调结构性质,可以使用:
Coalition-Conditioned, Task-Equivariant Candidate Policy
建议题目:
HATT: Coalition-Conditioned Equivariant Candidate Policies for Dynamic Heterogeneous Multi-Robot Task Allocation
包含探索场景的题目:
Coalition-Conditioned Equivariant Policies for Coupled Exploration and Dynamic Multi-Robot Task Allocation
建议将论文研究问题写成:
在任务逐步发现、机器人资源持续变化、联盟在线形成的执行过程中,如何为每个候选任务构造与其当前联盟状态相对应的策略表示,并在不枚举联合联盟结构的条件下学习任务选择?
建议使用以下方法概括:
动态联盟任务分配中的任务选择偏好受到当前机器人、候选任务和该任务当前联盟执行状态共同影响。HATT 为每个候选任务聚合当前承诺成员的动态状态,将联盟表示与任务表示保持索引对齐,并通过共享评分器学习状态依赖的条件联盟偏好。多个机器人根据该策略选择任务,联合动作进一步诱导新的联盟结构。
| 预计创新点 | 论文级观点 | 对应实现 | 当前证据 | 完整度 | 待补内容 |
|---|---|---|---|---|---|
| 条件联盟偏好建模 | 任务偏好由机器人、候选任务和当前联盟状态共同决定 | Coalition-by-action、task-indexed aggregation、candidate score | Coalition消融、参数匹配 | 较高 | 与IAOM/HeteroMRTA细化差异 |
| 联盟条件候选策略 | 每个任务拥有对应联盟状态,共享评分器逐候选决策 | Typed encoders、sum/mean/count、task fusion、shared decoder | Full/no-coalition、槽位置换 | 高 | 增加cross-attention近邻基线 |
| 成员置换不变性 | 联盟表示不依赖成员排列 | 对称集合聚合 | 结构可推导 | 较高 | 补成员置换测试 |
| 任务重标号等变性 | 一致置换任务、membership和mask时输出同步置换 | 共享encoder/scorer、ID路由 | Deliver/Explore置换 | 高 | 方法章节给出命题 |
| 多项式候选计算 | 每机器人评价M个候选,避免M^N联合枚举 | Candidate decoder | 代码结构明确 | 较高 | 报告推理时间和规模曲线 |
| 探索—配送统一候选状态 | 探索和配送均具有候选级执行状态 | Sector geometry、coverage、task/coalition context | Coverage消融强 | 中高 | 审计共享coverage;与IAOM比较 |
| 事件驱动联盟演化 | 任务事件后重新计算条件偏好 | Event reconfiguration | 可稳定运行 | 中 | 作为协议与实验分析 |
| 条件机器人关系 | 机器人关系随任务与联盟状态变化 | v2隐式聚合;v3.3 typed AA/AT | v3.3初步正信号 | 中低 | 关系语义和同checkpoint干预 |
| 响应—稳定权衡 | 重构日程改变任务响应和联盟切换 | Always/Event/Urgency/Learned | 多组行为结果 | 中低 | 当前不单列算法创新 |
| 机制归因评估 | 结构干预区分参数量、槽位置、联盟和探索状态 | 正式评估矩阵 | 高强度 | 高 | 增加公开环境和近邻结构基线 |
将任务动作诱导的在线联盟形成表示为状态依赖的条件偏好学习问题。机器人针对每个候选任务,联合考虑自身状态、任务状态及该任务当前联盟的动态执行状态,并通过任务选择共同形成联盟结构。
提出一种联盟条件候选策略。该策略使用置换不变的集合聚合构造逐任务联盟状态,将其注入对应任务候选,并利用共享评分器生成任务选择分布。该结构具有联盟成员置换不变性和任务重标号等变性,主要关系计算规模为 \(O(N^2+NM)\)。
面向任务逐步发现的动态环境,为探索候选构造可执行目标、路径段长度、预期新增覆盖和剩余未探索状态,为配送候选构造任务需求和当前联盟执行状态,使信息获取、联盟配送和补给决策能够通过统一候选策略进行评价。
实验贡献可以写成第四项,也可以并入第三项之后:
通过参数匹配、结构消融、任务槽置换、独立 held-out test 和末期 checkpoint 评估,分析候选结构、联盟上下文和探索状态在当前环境中的作用。
| 论文主张 | 实现是否存在 | 证据是否充分 | 当前处理建议 |
|---|---|---|---|
| 状态依赖的条件联盟偏好 | 是 | 间接且较完整 | 作为理论定义使用 |
| 联盟条件候选策略 | 是 | 较充分 | 作为主要算法创新 |
| 联盟成员置换不变性 | 是 | 结构推导为主 | 补置换测试后写成命题 |
| 任务重标号等变性 | 是 | 有实验支持 | 写入方法性质 |
| 避免联合联盟枚举 | 是 | 动作建模和复杂度支持 | 明确无最优性保证 |
| 探索—配送统一候选状态 | 是 | Coverage证据强 | 作为问题/状态贡献 |
| Event在线重决策 | 是 | 可运行,性能优势未确认 | 作为决策协议 |
| 显式合作—竞争关系 | 部分 | 不充分 | 放入动机或扩展分析 |
| Learned gate提高任务结果 | 是 | 当前结果不支持 | 放入消融或附录 |
| 精确联盟价值或边际效用 | 否 | 无 | 不进入论文主张 |
| 任意规模零样本泛化 | 部分 | 外部证据不足 | 等待公开环境验证 |
| 完全局部无通信执行 | 与当前观测不一致 | 无 | 明确共享信息假设 |
建议按以下逻辑展开:
建议分为四类:
相关工作比较表建议使用以下列:
| 方法 | 异构能力 | 多机器人任务 | 隐藏/动态任务 | 当前联盟/承诺 | 候选级联盟集合 | 探索状态 | 分散策略 | 训练范式 |
|---|
需要定义:
建议依次介绍:
建议回答六个问题:
应主动说明:
增加 HeteroMRTA-style task/agent cross-attention actor:
该对照用于区分一般 set/cross-attention 和联盟条件候选上下文。
优先级建议:
建议报告:
完整 DelivCoal 含在线搜索,离线优化器与学习策略的信息条件不同。可以在 all-discovered 或 delivery-only 子问题中比较:
比较中需要明确任务是否全部可见、是否允许全局信息以及规划时间预算。
建议补充两个低成本实验:
这些结果可以直接对应方法章节的置换不变性和复杂度分析。
建议至少报告当前使用的 shared coverage 设置,并在局限性中说明。若时间允许,可比较:
首次接触项目时,建议按以下顺序阅读:
AGENTS.md:项目架构、运行规范、评估和 CHANGELOG 规则;envs/delivcoal/env_core.py:当前主环境、观测、任务和奖励;algorithms/algorithm/HATTV20Network.py:当前证据最充分的 actor;algorithms/algorithm/gaRMAPPOPolicy.py:网络路由和策略接口;runner/shared/macf_runner.py:rollout、训练和日志;utils/shared_gat_buffer.py:Dict观测如何进入buffer;CHANGELOG.yaml:研究演进、实验结论和失败分支;html_logs/stage_progress_report_20260628_20260822.md:阶段性证据汇总;docs/EVALUATION_PROGRESS_HANDOFF_20260817.md:正式评估协议;docs/HATT_V33AA_EXPERIMENT_DESIGN_20260822.md:v3.3AA设计目标。处理论文相关任务时应先确认:
项目已经完成从环境建模、HATT结构、动态重构、奖励信用、训练稳定化到正式评估的大规模研究闭环。DelivCoal 中的 HATT v2.0 在五训练 seed、独立 validation、128-seed held-out test 和末期 checkpoint 评估中持续优于参数匹配 MAPPO。
现有证据最充分的组成包括:
现有证据较弱或呈负结果的组成包括:
建议以“联盟条件候选策略”为论文方法主线。该主线将任务动作、当前联盟和成员执行状态放在同一候选级策略表示中,并通过共享评分器学习状态依赖的条件联盟偏好。
建议最终贡献结构为:
从内部方法闭环和实验工作量看,稿件已经接近应用型机器人、自动化和智能系统一区论文的主体规模。最终竞争力仍取决于近邻 cross-attention 基线、公开 MRTA 环境和共享 coverage 假设审计。理论导向更强的期刊还会期待最优性、稳定性、泛化界限或经过正式验证的反事实联盟推理。
AGENTS.mdold_old_logs/Works-中文-Chap1-5-260201.docxCHANGELOG.yamlalgorithms/algorithm/HATTV20Network.pyalgorithms/algorithm/HATTV33AANetwork.pyenvs/delivcoal/env_core.pyhtml_logs/stage_progress_report_20260628_20260822.mdhtml_logs/hatt_formal_delivcoal_20260818_handoff.mddocs/PROJECT_RESEARCH_HANDOFF_20260817.mddocs/EVALUATION_PROGRESS_HANDOFF_20260817.mddocs/HATT_V33AA_EXPERIMENT_DESIGN_20260822.mdruns/20260818-0040_hatt-formal-training-sequence/runs/20260821-1045_delivcoal_final-window-evaluation/runs/20260822-1223_delivcoal_hatt-v33aa-focused/