中文

CS-Sum:代码切换对话摘要的基准与大语言模型的局限性

计算与语言 2025-05-21 v1 机器学习

摘要

代码切换(CS)是大语言模型(LLM)面临的一项重大挑战,但其可理解性在 LLM 中仍未被充分探索。我们提出 CS-Sum,通过将代码切换对话摘要为英文来评估 LLM 对 CS 的可理解性。CS-Sum 是首个跨越普通话-英语(EN-ZH)、泰米尔语-英语(EN-TA)和马来语-英语(EN-MS)的代码切换对话摘要基准,每种语言对包含 900–1300 个人工标注对话。我们评估了十种 LLM,包括开源和闭源模型,并分析了少样本、翻译-摘要和微调(LoRA、基于合成数据的 QLoRA)方法的性能。我们的发现表明,尽管自动指标得分较高,但 LLM 会犯细微的错误,从而改变对话的完整含义。为此,我们引入了 LLM 处理代码切换输入时最常见的三类错误。错误率因代码切换语言对和 LLM 而异,某些 LLM 在特定语言对上表现出更频繁的错误,强调了需要在代码切换数据上进行专门训练。

关键词

引用

@article{arxiv.2505.13559,
  title  = {CS-Sum: A Benchmark for Code-Switching Dialogue Summarization and the Limits of Large Language Models},
  author = {Sathya Krishnan Suresh and Tanmay Surana and Lim Zhi Hao and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2505.13559},
  year   = {2025}
}

备注

17 pages, 5 figures and 11 tables