中文

CLEAR:大型语言模型论文改写的综合语言评估

计算与语言 2025-09-19 v1 人工智能

摘要

尽管大型语言模型(LLM)在一般文本生成任务上受到广泛研究,但关于文本改写——与一般文本生成相关的任务,尤其是模型在此类任务上的表现,仍有较少研究。本文分析了大型语言模型在文本改写场景中所作出的更改。我们特别关注论证性文本及其改进,称为论证改进(Argument Improvement, ArgImp)。我们提出CLEAR:一个由57个指标构成的评估管道,映射到四个语言层次:词汇、句法、语义和语用。该管道用于检验在广泛的论证语料库上,由大型语言模型改写后的论证质量,并比较不同大型语言模型在该任务上的表现。我们发现,综合考虑四个语言层次后,模型通过缩短文本、同时增加平均词长和合并句子来实现论证改进。总体而言,随着语言层次的考察,我们观察到说服力和连贯性维度的提升。

关键词

引用

@article{arxiv.2509.15027,
  title  = {CLEAR: A Comprehensive Linguistic Evaluation of Argument Rewriting by Large Language Models},
  author = {Thomas Huber and Christina Niklaus},
  journal= {arXiv preprint arXiv:2509.15027},
  year   = {2025}
}

备注

Accepted at EMNLP 2025 Findings