中文

CSEval:基于自校准大语言模型的自动化、多维度、无参考计数语评估

计算与语言 2025-02-11 v2 人工智能 计算机与社会 社会与信息网络

摘要

计数语作为一种流行且有效的缓解线上仇恨言论的策略,正在引发日益增长的研究兴趣,以自动化其生成。然而,该领域仍缺乏标准化的评估协议和与人类判断一致的可靠自动评估指标。当前的自动评估方法主要基于相似性指标,无法有效捕捉计数语质量的复杂且独立属性,如情境相关性、攻击性或论证连贯性。这导致对自动化计数语生成方法的评估更依赖耗时的专业人工评估。为此,我们提出CSEval,这是一个用于评估计数语质量的新型数据集和框架,涵盖四个维度:情境相关性、攻击性、论证连贯性和适宜性。此外,我们提出了一种基于大语言模型的自校准链式思维计数语评估方法(Auto-CSEval)。我们的实验表明,Auto-CSEval在与人类判断相关性方面优于传统指标,如ROUGE、METEOR和BertScore,显著提升了自动化计数语评估的效果。

关键词

引用

@article{arxiv.2501.17581,
  title  = {CSEval: Towards Automated, Multi-Dimensional, and Reference-Free Counterspeech Evaluation using Auto-Calibrated LLMs},
  author = {Amey Hengle and Aswini Kumar and Anil Bandhakavi and Tanmoy Chakraborty},
  journal= {arXiv preprint arXiv:2501.17581},
  year   = {2025}
}

备注

18 pages, 5 figures