汉唐归来
惟有中华

汉风军事知识库:高层策略 + 低层机动:分层「强化学习」打造战机智能体|2026-10-10

在真实空战中,飞行员需要在瞬息万变的环境中做出机动和战术决策,而我们希望让 AI 也能学会这些技能。通过强化学习,多架战斗机智能体可以自主判断何时攻击、何时撤退,并选择最优机动方式,实现“击杀最大化 + 生存最优”。

空中对抗的核心是智慧,决定胜败的往往是通过层次决策形成的精准机动,而非单纯的武力硬碰硬。


通过分层决策,高层负责战术指令(fight / escape / 选择目标),低层负责连续控制(航向、速度、武器发射)这样AI 不仅能做大局决策,还能执行精细动作。

1 项目目标

通过训练多架战斗机智能体,让它们在虚拟空战中自主做出决策。每架战机输入自身的观测信息(位置、速度、航向、敌我角度、雷达/武器状态等),输出高层动作(fight/escape/目标选择)或者低层连续控制(航向、速度、导弹发射)。通过这种方式,AI 能够同时掌握战术决策与精细机动。


2  系统架构

系统分为三大模块:

1. 环境层(仿真器):CmanoSimulator 提供时钟管理、单位管理、事件系统和地图绘制,HighLevelEnv 实现分层执行、奖励聚合和周边事件检测。

2. 模型与策略层:高层策略 CommanderGru 负责战术决策,低层控制飞行动作和武器使用。

3. 训练与评估层:使用 Ray RLlib 驱动强化学习算法(如 PPO/IMPALA/A2C),并通过 evaluation.py 评估策略效果和可视化训练结果。


3 分层强化学习设计

系统的高层负责战术级别的判断,低层则负责把战术意图转成可执行的机动动作。高层每发出一次抽象指令,低层会连续执行若干仿真子步,直到达到触发条件(距离接近、攻角变化、状态异常等)再返回高层做下一轮决策。

图片


1. 高层(指挥官):做战术级决策,例如 fight/escape、选择攻击目标。奖励基于击杀、局部战术优势和逃脱成功等因素。

2. 低层(机动控制):执行航向、速度、武器发射等动作,通常遵循高层指令直到触发终止条件(如靠近敌人或达到子步上限)。

3. 多智能体协作:我方和敌方智能体共存,奖励可共享(glob_frac 控制共享比例),支持从自私到完全团队协作的训练策略。


4 仿真建模

虚拟空战环境包括:

1. 单位模型:飞机和导弹属性(位置、速度、航向、最大转角等)。

赞(0)
请您分享转发:汉风1918-汉唐归来-惟有中华 » 汉风军事知识库:高层策略 + 低层机动:分层「强化学习」打造战机智能体|2026-10-10
分享到