仍未实现:在诗句转 prose 任务上,大语言模型能否超越较小的任务特定 Seq2Seq 模型?
计算与语言
2025-11-12 v1
摘要
大语言模型 (LLM) 越来越被视为跨越 NLP 任务的通用通用解答方案,尤其是在英语语境下。但这种假设在面对低资源、形态丰富的语言(如梵语)时是否成立呢?我们通过将指令调优和情境提示驱动的 LLM 与较小的任务特定编码器-解码器模型,在梵语诗句转 prose 任务上进行比较来回答此问题。该任务本身具有挑战性:梵语诗句具有自由词序结合严格的韵律约束,其转换以标准化 prose (anvaya) 形式呈现,需要涉及复合分段、依赖解析和句法线性化的多步骤推理。这使其成为评估 LLM 是否能超越专用模型的理想测试基准。对于 LLM,我们对通用模型进行指令微调,并设计基于 Paninian 语法和古典注释 heuristi 的情境学习模板。对于任务特定建模,我们完全对 ByT5-梵语 Seq2Seq 模型进行微调。我们的实验表明,基于 ByT5-梵语的领域特定微调显著优于所有指令驱动的 LLM 方法。人类评估强力支持这一结果,评分与 Kendall's Tau 分数高度相关。此外,我们的提示策略在缺乏领域特定诗句语料库时提供了一种替代微调的方案,而任务特定的 Seq2Seq 模型在跨域评估中表现出鲁健的泛化能力。
引用
@article{arxiv.2511.08145,
title = {Still Not There: Can LLMs Outperform Smaller Task-Specific Seq2Seq Models on the Poetry-to-Prose Conversion Task?},
author = {Kunal Kingkar Das and Manoj Balaji Jagadeeshan and Nallani Chakravartula Sahith and Jivnesh Sandhan and Pawan Goyal},
journal= {arXiv preprint arXiv:2511.08145},
year = {2025}
}