多语言表格转文本生成中实现可归因性的挑战:基于问答蓝图
计算与语言
2025-10-22 v1 人工智能
机器学习
摘要
多语言自然语言生成 (NLG) 因低资源语言缺乏训练数据而具有挑战性。然而,一些低资源语言拥有数百万全球使用者,改善这些语言的 NLG 工具备为重要。表格转文本 NLG 是评估模型推理能力的优良指标,但在多语言环境下则极具挑战性。系统输出往往不可归因,或不忠实于源表格中的数据。问答 (QA) 蓝图等中间规划技术已在摘要生成任务中证明可提高可归因性。本工作探讨 QA 蓝图是否使多语言表格转文本输出更加可归因于输入表格。本文扩展了包含非洲语言的具有挑战性的多语言表格转文本数据集 TaTA,加入 QA 蓝图。随后对序列到序列语言模型在该数据集上进行微调,分别带有和不带有蓝图。结果表明,QA 蓝图对仅在英文示例上进行微调和评估的模型提升了性能,但在多语言环境下未显示出收益。这归因于在生成训练数据时将蓝图从英文机器翻译成目标语言时存在不准确,而模型未能严格依赖所生成的蓝图。对为何具有挑战性进行了深入分析。
引用
@article{arxiv.2503.23204,
title = {The Challenge of Achieving Attributability in Multilingual Table-to-Text Generation with Question-Answer Blueprints},
author = {Aden Haussmann},
journal= {arXiv preprint arXiv:2503.23204},
year = {2025}
}