优化 LLM 基于口述文档摘要系统中人类评估的作用
人工智能
2024-10-25 v1 计算与语言
声音
音频与语音处理
摘要
强大的大语言模型的出现导致了口述文档抽象摘要方法的范式转变。使 LLM 对于这一任务如此有价值的特性——创造力、产生流畅语音的能力以及从大型语料库中抽象信息的能力——也带来了对其内容进行评估的新挑战。快速且高性价比的自动评估方法,如 ROUGE 和 BERTScore,虽有前景,但与人类评估相比尚未表现出竞争性能。我们借鉴社会科学的方法,提出一种明确针对生成式 AI 内容的口述文档摘要评估范式。我们提供详细的评估标准和最佳实践指南,以确保实验设计的稳健性、可复制性和人类评估研究的可信度。我们另外包括两个案例研究,展示了这些人类在环评估方法如何在一家美国大型科技公司的实际应用中得到实施。
引用
@article{arxiv.2410.18218,
title = {Optimizing the role of human evaluation in LLM-based spoken document summarization systems},
author = {Margaret Kroll and Kelsey Kraus},
journal= {arXiv preprint arXiv:2410.18218},
year = {2024}
}