%0 Dataset %T 多无人机协同围捕训练与轨迹仿真结果数据集 %J 国家冰川冻土沙漠科学数据中心 %I 国家冰川冻土沙漠科学数据中心(www.ncdc.ac.cn) %U http://www.ncdc.ac.cn/portal/metadata/e60ccb9a-ecf2-4e0a-963d-02d66926768f %W NCDC %R 10.12072/ncdc.db7477.2026 %A 马文瑞 %K 多无人机;协同围捕;深度强化学习;MADDPG;训练奖励;轨迹仿真 %X 本数据集面向受限二维空间内多无人机协同围捕多目标任务中的深度强化学习训练过程分析与轨迹仿真展示,数据来源于论文《Deep Reinforcement Learning-Based Cooperative Encirclement Strategy for Multi-UAVs》的仿真实验。论文在集中训练、分散执行(CTDE)框架下,构建了阶段奖励与多任务驱动的MADDPG算法,通过将围捕任务分解为接近、跟踪、包围和捕获等连续阶段,缓解多智能体围捕任务中的奖励稀疏问题;同时结合贪婪算法进行目标分配,并为目标无人机设计基于人工势场思想的逃逸策略,以形成更贴近对抗场景的动态仿真环境。实验基于Python、PyTorch和OpenAI Gym的多智能体仿真环境开展,训练六架围捕无人机对两个目标无人机进行协同围捕,并在动态障碍物条件下评估训练后策略的表现。汇交文件按metadata、data、images目录组织,共包含1份元数据表、2个CSV数据文件、2张PNG可视化图片和1份README说明文件;核心数据实体包括data/score_history.csv、data/score_history_original_row62.csv、images/MADDPG_Training_Reward.png和images/Encirclement_Trajectory.png。训练奖励CSV包含episode、reward和moving_average_100三个字段,其中episode为1至10000的回合编号,reward为单回合累计奖励,moving_average_100为100回合滑动平均奖励;reward和moving_average_100均为仿真奖励值,无物理量纲。该数据集可用于分析多智能体深度强化学习训练收敛过程、阶段奖励与多任务机制的效果,以及多无人机协同围捕策略在复杂动态环境中的轨迹表现。