中文

T-FIX:基于文本的专业人员可解释特征解释

计算与语言 2026-05-19 v3

摘要

随着大语言模型在知识密集型场景(如手术、天文学、治疗)中部署,用户往往是领域专家,他们期望不仅获得答案,还能获得类似专业推理的解释。然而,评估大语言模型是否'像专家一样思考'仍然困难:现有方法依赖逐例专家标注,成本高昂、难以扩展,且局限于每个领域单一的正确推理观念。为此,我们提出T-FIX,一个统一的评估框架,将专家对齐作为大语言模型生成解释的期望属性加以 operationalization。T-FIX涵盖三个领域中的七个科学任务,每个任务都根据专家定义的准则进行评估,这些准则捕捉的是领域内的推理,而非通用的解释质量。我们的框架实现了对专家对齐的自动化、可定制化评估,能够在无需持续专家参与的情况下对未出现的解释进行泛化。代码已公开:https://github.com/BrachioLab/FIX-2/。

关键词

引用

@article{arxiv.2511.04070,
  title  = {T-FIX: Text-Based Explanations with Features Interpretable to eXperts},
  author = {Shreya Havaldar and Weiqiu You and Chaehyeon Kim and Anton Xue and Helen Jin and Marco Gatti and Bhuvnesh Jain and Helen Qu and Amin Madani and Daniel A. Hashimoto and Gary E. Weissman and Rajat Deo and Sameed Khatana and Lyle Ungar and Eric Wong},
  journal= {arXiv preprint arXiv:2511.04070},
  year   = {2026}
}