中文

面向空中交通管控的语言理解系统安全导向评估

计算与语言 2026-05-13 v1

摘要

空中交通管控(Air Traffic Control, ATC)是安全关键领域,错误的指令解释可能导致严重的运营后果。虽然大型语言模型(LLM)显示出强大的通用性能,但其在实际ATC环境中的可靠性尚不明确。现有的评估方法主要基于如F1或宏准确率等聚合指标,对所有错误统一对待,未能考虑高风险语义错误(例如错误的跑道标识符或运动约束)的非对称后果。为此,我们提出了针对ATC操作的安全导向、后果感知评估框架。我们的结果表明,尽管当前LLM在整体准确率上表现合理,但其操作可靠性严重受限。在干净的转录稿上,最高风险得分(Risk Score)仅为0.69,大多数模型得分低于0.6,尽管宏观F1性能良好。进一步的分析显示,错误集中在高影响实体上,尽管动作类型分类相对稳定,这表明存在结构性 grounding 缺陷。这些发现凸显了针对负责任部署AI辅助ATC系统所需的后果感知评估协议的必要性。

关键词

引用

@article{arxiv.2605.11769,
  title  = {Safety-Oriented Evaluation of Language Understanding Systems for Air Traffic Control},
  author = {Yujing Chang and Yash Guleria and Duc-Thinh Pham and Nhut-Huy Pham and Ningli Wang and Vu N. Duong and Sameer Alam},
  journal= {arXiv preprint arXiv:2605.11769},
  year   = {2026}
}