LCTG基准:面向LLM可控文本生成的基准
计算与语言
2025-01-28 v1
摘要
大型语言模型(LLM)的兴起导致机器生成文本更加多样化和高质量。然而,其高表达能力使得基于特定业务指令控制输出变得困难。为此,已开发针对 LLM 可控性的基准测试,但仍存在若干问题:(1)它们主要覆盖英语和中文等主要语言,忽略日文等低资源语言;(2)当前基准采用任务特定评估指标,缺乏统一框架以基于可控性在不同用例中选择模型。为此,本研究引入 LCTG Bench,首个面向评估 LLM 可控性的日文基准。LCTG Bench 提供统一的评估框架,使用户能够基于可控性选择最适合自身用例的模型。通过评估九个 diverse 的日语特定和多语言 LLM(如 GPT-4),我们揭示了日语 LLM 可控性的当前水平与挑战,以及多语言模型与日语特定模型之间的显著差距。
引用
@article{arxiv.2501.15875,
title = {LCTG Bench: LLM Controlled Text Generation Benchmark},
author = {Kentaro Kurihara and Masato Mita and Peinan Zhang and Shota Sasaki and Ryosuke Ishigami and Naoaki Okazaki},
journal= {arXiv preprint arXiv:2501.15875},
year = {2025}
}
备注
15 pages, 11 figures. Project page: this [URL](https://github.com/CyberAgentAILab/LCTG-Bench)