JFTA-Bench:评估大语言模型跟踪与分析故障树的能力
人工智能
2026-03-25 v1
摘要
在复杂系统维护中,故障树用于定位问题并提供针对性解决方案。为使大语言模型能够直接处理以图像形式存储的故障树,从而辅助故障定位与分析,我们提出一种新型故障树文本表述。基于此,我们构建了一个强调在复杂环境中鲁棒交互的多轮对话系统基准,评估模型在故障定位方面的能力,该基准包含3130个条目,平均每条目40.75个对话轮次。我们训练了一个端到端模型生成模糊信息以反映用户行为,引入长距离回滚与恢复程序以模拟用户错误场景,使可评估模型在任务跟踪与错误恢复方面的综合能力。实验结果表明,Gemini 2.5 pro取得了最佳性能。
引用
@article{arxiv.2603.22978,
title = {JFTA-Bench: Evaluate LLM's Ability of Tracking and Analyzing Malfunctions Using Fault Trees},
author = {Yuhui Wang and Zhixiong Yang and Ming Zhang and Shihan Dou and Zhiheng Xi and Enyu Zhou and Senjie Jin and Yujiong Shen and Dingwei Zhu and Yi Dong and Tao Gui and Qi Zhang and Xuanjing Huang},
journal= {arXiv preprint arXiv:2603.22978},
year = {2026}
}