中文

FINEST:通过细粒度评估提升LLM对敏感话题的响应

计算与语言 2026-03-05 v1

摘要

大型语言模型(LLM)常常在敏感话题上生成过于谨慎和模糊的响应,牺牲了帮助fulness以换取安全性。现有的评估框架缺乏系统的方法来识别和解决对敏感话题响应特定弱点的识别,这使得同时提高安全性和帮助fulness变得困难。为此,我们引入FINEST,即面向敏感话题的细粒度响应评估分类法,将帮助fulness和无害性在三个主要类别:内容、逻辑和恰当性中划分为错误。针对韩语敏感问题数据集进行实验,表明我们基于FINEST的评分和错误改进管道(以评分和依据为导向),显著提升了模型响应在所有三个类别中的表现,优于无指导的精炼。值得注意的是,基于评分的改进——提供类别特定的评分和依据——获得了最显著的提升,将恰当性的错误句子比率降低最高可达33.09%。本工作为更具可解释性和全面性地评估和改进LLM对敏感问题的响应奠定了基础。

关键词

引用

@article{arxiv.2603.04123,
  title  = {FINEST: Improving LLM Responses to Sensitive Topics Through Fine-Grained Evaluation},
  author = {Juhyun Oh and Nayeon Lee and Chani Jung and Jiho Jin and Junho Myung and Jongwon Lee and Taeui Song and Alice Oh},
  journal= {arXiv preprint arXiv:2603.04123},
  year   = {2026}
}

备注

Accepted to EACL 2026 Findings