93.8% 有效率的另一面:FRAMe 给大模型飞行规划配了一个教练智能体

让一位运控调度员用一句话说清航线要求,比如「送这批药品到城东医院,避开一中和三小的上空,尽量沿着河道飞」,然后系统自动生成一份合规可执行的飞行计划——这件事,传统的路径规划算法做不到。

做不到的原因不是算力不够,而是人类的偏好难以形式化。A 星搜索、混合整数规划这类经典算法能把「最短」「最省电」优化到极致,但「尽量沿着河道」「这段我希望飞低一点」这种带有柔性、模糊、经验色彩的诉求,根本无法写进目标函数。

Amin Tabrizian、Arsyi Aziz、Aarifah Ullah、Mahyar Ghazanfari、Pouria Razzaghi、Peng Wei 六人团队提出的 FRAMe 框架,试图用大语言模型填上这道缝。论文《End-to-End LLM Flight Planning with RAG-based Memory and Multi-modal Coach Agent》(arXiv:2607.06964,2026 年 7 月 8 日提交)已被 ICML 2026 LM4Plan Workshop 接收,代码已在 GitHub 开源。

系统设计:规划器之外,再加一个教练

FRAMe 不是简单地把飞行规划任务丢给一个大模型,而是构建了三个角色分工的组件:

组件角色定位解决的具体问题
规划器大模型
(Planner LLM)
把自然语言任务指令转换成结构化飞行计划意图理解与方案生成,承接人类的模糊表达
多模态教练智能体
(Multi-modal Coach Agent)
审阅规划器的输出,结合地图等视觉信息给出反馈与纠正建议大模型直出方案常违反硬约束,需要独立的校验回路
检索增强记忆
(RAG-based Memory)
检索历史飞行计划与该操作员的既往偏好,作为上下文注入偏好无法一次说清,需要从历史行为中沉淀

其中教练智能体是整个设计的关键。它体现的是近两年逐渐成型的「生成器加验证器」范式:不指望单次生成就正确,而是让一个独立模块专职挑错,通过多轮反馈把方案逼近可行域。之所以强调多模态,是因为空域态势、地形、禁飞区这些信息以图形方式呈现远比文字描述高效,教练需要具备读图能力。

实验结果:93.8% 的有效率,以及它的另一面

团队在一组受真实场景启发、难度分级的任务上做了验证,横跨四个不同的大语言模型作为规划器。核心结论有两条:

但这个 93.8% 需要反过来读:大约每 16 份计划中就有 1 份不合法。放在航空安全的语境下,这个数字距离可用还非常遥远。民航适航体系对灾难性失效的要求通常在每飞行小时十的负九次方量级,两者之间隔着好几个数量级的鸿沟。

对 eVTOL 与低空运营意味着什么

这项研究的产业价值,不在于替代飞行员或调度员,而在于改变人机分工的位置。

局限与展望

论文的定位需要被准确理解,避免过度解读:

把大模型接进飞行规划,方向上是对的——人机意图对齐确实是 eVTOL 商业运营绕不开的一环。但从研讨会论文走到适航审定,中间要补的是可验证性、确定性边界与失效行为的完整论证,这条路远比刷高有效率指标漫长。

相关阅读

常见问题

大模型规划飞行航线,安全性如何保证?

就论文报告的水平而言,安全性尚不足以支撑自主执飞。93.8% 的方案有效率意味着仍有相当比例的输出违反约束,因此必须采用人在回路架构:大模型负责生成候选方案,教练智能体做初筛,最终由人工或确定性求解器完成合规校验后才能执行。可以把它理解为一位效率很高但需要复核的助手,而不是可以放手的自动驾驶系统。

教练智能体和规划器为什么要分开,用一个更强的模型不行吗?

分离带来两个好处。一是职责单一化,生成任务与批判任务对模型的提示方式和上下文需求不同,混在一起会互相干扰。二是形成独立的校验回路,同一个模型很难发现自己的错误,而一个以挑错为目标的独立模块更容易识别约束冲突。论文的消融结果也印证了这一点:同时启用记忆与教练的完整系统,在所有测试的规划器上都优于缺少组件的版本。

这套系统对国内低空运营商有什么现实参考价值?

最直接的价值是检索增强记忆这一部分。国内低空运营正处于快速扩张期,资深调度人员严重不足,而运行经验大量以隐性知识形式存在于个人身上。把历史航线决策与操作偏好结构化沉淀为可检索的知识库,即便暂不引入大模型自动规划,也能显著缩短新人培养周期。至于自动生成航线的能力,建议先在预案生成、应急改航候选方案等非实时环节试点,积累数据后再评估是否前移到实时链路。

常见问题(FAQ)

📚 参考来源