指令遵循大语言模型时代的论点质量评估
计算与语言
2024-03-26 v1
摘要
由于对观点形成、决策制定、写作教育等方面的预期影响,关于争议性问题的论点的计算处理一直受到广泛的 NLP 研究。任何此类应用中的一项关键任务是评估论点的质量——但这同样极具挑战性。在这篇立场论文中,我们从简要回顾论点质量研究开始,指出质量概念的多样性与感知的主观性是阻碍论点质量评估取得实质性进展的主要障碍。我们论证了指令遵循大语言模型(LLM)跨上下文利用知识的能力能够实现更可靠的评估。与其仅仅为了在评估任务排行榜上追逐名次而微调 LLM,不如用论辩理论和场景,以及解决论点相关问题的方法来系统地指导它们。我们讨论了由此产生的现实机遇与伦理问题。
引用
@article{arxiv.2403.16084,
title = {Argument Quality Assessment in the Age of Instruction-Following Large Language Models},
author = {Henning Wachsmuth and Gabriella Lapesa and Elena Cabrio and Anne Lauscher and Joonsuk Park and Eva Maria Vecchi and Serena Villata and Timon Ziegenbein},
journal= {arXiv preprint arXiv:2403.16084},
year = {2024}
}
备注
Accepted to LREC-COLING 2024