中文

PINGALA:面向梵文诗歌生成的抑韵感解码

计算与语言 2026-03-26 v1

摘要

梵文诗歌生成通常需要诗句在语义连贯且遵循严格的韵律规则。梵文韵律中,每行诗句通常是固定长度的音节序列,遵循规定的音节重量的二进制模式。我们观察到,将诗句视为分组行而非整体序列,可在保持韵律的前提下显著提升语义连贯性约10%。具体而言,我们提出的 PINGALA 解码方法旨在鼓励每行诗句包含结构化的单词,同时通过偏好更长的 token 来影响模型的 token 选择。梵文遵循音义一一对应拼写方案,采用声学感知的 transliteration 方案 SLP1 可将韵律对齐提升46%,同时保持相当的语义相似度,适用于经过指令微调的大语言模型如 Phi-4。我们还引入了一种基于 cross-encoder 的无参考评估方法,实现了对真实诗歌实例的更好对齐。

关键词

引用

@article{arxiv.2603.24413,
  title  = {PINGALA: Prosody-Aware Decoding for Sanskrit Poetry Generation},
  author = {Manoj Balaji Jagadeeshan and Atul Singh and Nallani Chakravartula Sahith and Amrith Krishna and Pawan Goyal},
  journal= {arXiv preprint arXiv:2603.24413},
  year   = {2026}
}