何时对齐有害:多语言模型中表示空间的解耦
计算与语言
2025-08-19 v1
摘要
与高资源标准语言的对齐常被假设为有助于建模相关的低资源变体。我们挑战这一假设,通过展示对主导变体(如阿拉伯语标准语MSA与阿拉伯方言)的过度表征纠缠如何实际阻碍生成式建模。我们提出了首个针对这一现象的全面因果研究,通过分析和直接干预大语言模型(LLM)内部表示的几何结构。我们的关键贡献是一种在微调期间持续估计标准变体子空间的在线变分探测框架,使能够基于投影实现对该空间的解耦。虽然我们的研究以阿拉伯语为案例,因为其在25种方言中拥有异常丰富的平行资源,但更广泛的动机是方法论的:方言MT作为生成任务的受控代理,其中缺乏可用的多变体语料库。对于25种方言,我们的干预在生成质量方面提升了最高可达+4.9的chrF++和平均+2.0,尽管对标准语言性能有所牺牲。这些结果提供了对高资源变体主导地位对相关变体生成能力限制的因果证据。更广泛地说,我们将几何探测与信息论探测与子空间级因果干预统一起来,为改进紧密相关语言家族中生成式建模(以及更广泛地用于控制多语言和多域LLM表示分配)提供了实用工具。代码将公开发布。
引用
@article{arxiv.2508.12803,
title = {When Alignment Hurts: Decoupling Representational Spaces in Multilingual Models},
author = {Ahmed Elshabrawy and Hour Kaing and Haiyue Song and Alham Fikri Aji and Hideki Tanaka and Masao Utiyama and Raj Dabre},
journal= {arXiv preprint arXiv:2508.12803},
year = {2025}
}