融合人类与大语言模型思考过程以提升文本评估效果
计算与语言
2025-02-21 v2
摘要
本研究引入 InteractEval 框架,将人类专长与大语言模型 (LLMs) 结合使用思考过程 (Think-Aloud, TA) 方法,用于生成基于清单的文本评估属性。通过将人类的灵活性和推理能力与 LLM 的一致性相结合,InteractEval 在包含连贯性、流畅性、一致性和相关性四个不同维度的评估中超越了传统基于非 LLM 和基于 LLM 的基线方法。实验还探讨了 TA 方法的有效性,表明其促进了人类和 LLM 之间的思维发散,导致生成更广泛的相关属性并提升文本评估性能。比较分析显示,人类在识别与内部质量相关的属性(如连贯性和流畅性)方面表现更好,但 LLM 在与外部对齐相关的属性(如一致性和相关性)方面表现更好。因此,有效地将人类和 LLM 结合在一起可产生最佳的评估结果。换句话说,本研究强调了在自动化基于清单的文本评估框架中有效地结合人类和 LLM 的必要性。该代码已在 https://github.com/BBeeChu/InteractEval.git 上提供。
引用
@article{arxiv.2409.07355,
title = {Think Together and Work Better: Combining Humans' and LLMs' Think-Aloud Outcomes for Effective Text Evaluation},
author = {SeongYeub Chu and JongWoo Kim and MunYong Yi},
journal= {arXiv preprint arXiv:2409.07355},
year = {2025}
}