中文

LMStyle Benchmark:评估聊天机器人的文本风格迁移

计算与语言 2024-03-15 v1

摘要

自 ChatGPT 取得突破以来,大型语言模型(LLMs)在研究界引起了广泛关注。随着 LLMs 的发展,对话模型的文本风格迁移问题作为一种自然延伸而出现,其中聊天机器人可能拥有自己的风格甚至角色。然而,针对这一新场景尚未建立标准的评估指标。本文旨在通过提出 LMStyle Benchmark 来解决这一问题,这是一种适用于聊天式文本风格迁移(C-TST)的新型评估框架,能够以自动化和可扩展的方式衡量 LLMs 的风格迁移质量。除了常规的风格强度指标外,LMStyle Benchmark 还进一步考虑了一种称为恰当性的新型指标维度,这是一种在无参考样本辅助下兼顾连贯性、流畅性及其他隐式因素的高级指标。我们的实验表明,LMStyle Benchmark 引入的新评估方法在恰当性方面与人类判断具有更高的相关性。基于 LMStyle Benchmark,我们提供了流行 LLMs 的全面评估结果列表,包括 LLaMA、Alpaca 和 Vicuna,反映了它们的风格属性(如正式性和情感强度)及其恰当性。

关键词

引用

@article{arxiv.2403.08943,
  title  = {LMStyle Benchmark: Evaluating Text Style Transfer for Chatbots},
  author = {Jianlin Chen},
  journal= {arXiv preprint arXiv:2403.08943},
  year   = {2024}
}