大语言模型能否通过用户生成内容理解网络流行语
计算与语言
2025-05-22 v1
摘要
中文社交媒体中大量可用的用户生成内容(UGC)为研究网络流行语提供了可能。本文研究了大型语言模型(LLMs)能否基于 UGC 示例为这些流行语生成准确的定义。我们的工作有三重贡献。第一,我们引入了 CHEER,这是第一个中文网络流行语数据集,每个样本都附有定义和相关的 UGC。第二,我们提出了一种新方法 RESS,以有效引导 LLM 的理解过程,从而生成更准确的流行语定义,模拟人类语言学习的技能。第三,借助 CHEER,我们对各种现成定义生成方法和我们的 RESS 进行了基准测试。我们的基准测试验证了 RESS 的有效性,同时揭示了关键的共同挑战:对先前接触的过度依赖、不充分的推理能力,以及难以识别高质量的 UGC 来促进理解。我们相信我们的工作为基于 LLM 的定义生成未来的发展奠定了基础。我们的数据集和代码可在 https://github.com/SCUNLP/Buzzword 获取。
引用
@article{arxiv.2505.15071,
title = {Can Large Language Models Understand Internet Buzzwords Through User-Generated Content},
author = {Chen Huang and Junkai Luo and Xinzuo Wang and Wenqiang Lei and Jiancheng Lv},
journal= {arXiv preprint arXiv:2505.15071},
year = {2025}
}
备注
ACL 2025 Main Paper. Our dataset and code are available at https://github.com/SCUNLP/Buzzword