一条指令无法适配所有人:嵌入模型在低资源印度语言中如何对齐角色与指令?
计算与语言
2026-01-16 v1 人工智能
摘要
将多语言助手与基于文化的用户偏好对齐,对于服务印度超过十亿使用多种文字的语言多样化人口至关重要。然而,现有的基准要么专注于单一语言,要么将检索与生成混为一谈,留下了当前嵌入模型是否能在不依赖响应合成的情况下编码角色-指令兼容性的问题。我们提出了一个统一的基准,涵盖12种印度语言和四个评估任务:单语和跨语言的角色到指令检索、从指令到角色的反向检索,以及二元兼容性分类。在冻结编码器设置下,使用一个薄的逻辑回归头进行分类,评估了八个多语言嵌入模型。E5-Large-Instruct在单语检索上达到了27.4%的最高Recall@1,在跨语言迁移上达到了20.7%,而BGE-M3在反向检索上以32.1%的Recall@1领先。对于分类,LaBSE达到了75.3%的AUROC,并具有良好的校准性。这些发现为印度语多语言检索中的模型选择提供了实用指导,并为未来的工作建立了可复现的基线。
引用
@article{arxiv.2601.10205,
title = {One Instruction Does Not Fit All: How Well Do Embeddings Align Personas and Instructions in Low-Resource Indian Languages?},
author = {Arya Shah and Himanshu beniwal and Mayank Singh},
journal= {arXiv preprint arXiv:2601.10205},
year = {2026}
}
备注
12 pages, 4 figures, 10 tables