中文

从人类判断到预测模型:解构代码混合句子的可接受性

计算与语言 2025-05-06 v2 人工智能

摘要

当前用于分析或生成代码混合句子的计算方法未显式建模“自然性”或“可接受性”,但依赖训练语料来反映可接受代码混合句子的分布。建模代码混合文本可接受性的人类判断有助于区分自然代码混合文本并实现受控的代码混合文本生成。为此,我们构建了 Cline - 一个包含人类可接受性判断的英-印地语代码混合文本数据集。Cline 是其中的最大数据集,包含 16,642 句子,由两个来源的样本组成:合成生成的代码混合文本和来自在线社交媒体的样本。我们的分析表明,诸如 CMI、换点数、Burstines 等流行代码混合度量标准用于筛选/筛选/比较代码混合语料,其与人类可接受性判断之间的相关性较低,凸显了本数据集的必要性。使用 Cline 的实验表明,仅使用代码混合度量标准作为特征训练的简单多层感知机(MLP)模型,优于在预训练的多语言大型语言模型(MLLM)微调后的模型。具体而言,XLM-Roberta 和 Bernice 在不同配置下均优于 IndicBERT。在编码器模型中,mBART 在各配置下均优于 mT5,但编码器-解码器模型无法优于编码器-only 模型。解码器-only 模型在所有 MLLM 中表现最佳,Llama 3.2 - 3B 模型在规模相似的 Qwen、Phi 模型方面表现更佳。与 ChatGPT 的零样本和少样本能力比较表明,针对更大数据集微调的 MLLM 在代码混合任务中优于 ChatGPT,为该领域的改进提供了潜力。从 En-Hi 到 En-Te 的零样本迁移接受性判断优于随机基线。

关键词

引用

@article{arxiv.2405.05572,
  title  = {From Human Judgements to Predictive Models: Unravelling Acceptability in Code-Mixed Sentences},
  author = {Prashant Kodali and Anmol Goel and Likhith Asapu and Vamshi Krishna Bonagiri and Anirudh Govil and Monojit Choudhury and Ponnurangam Kumaraguru and Manish Shrivastava},
  journal= {arXiv preprint arXiv:2405.05572},
  year   = {2025}
}