English

Can Embedding Similarity Predict Cross-Lingual Transfer? A Systematic Study on African Languages

Computation and Language 2026-01-07 v1 Machine Learning

Abstract

Cross-lingual transfer is essential for building NLP systems for low-resource African languages, but practitioners lack reliable methods for selecting source languages. We systematically evaluate five embedding similarity metrics across 816 transfer experiments spanning three NLP tasks, three African-centric multilingual models, and 12 languages from four language families. We find that cosine gap and retrieval-based metrics (P@1, CSLS) reliably predict transfer success (ρ=0.40.6\rho = 0.4-0.6), while CKA shows negligible predictive power (ρ0.1\rho \approx 0.1). Critically, correlation signs reverse when pooling across models (Simpson's Paradox), so practitioners must validate per-model. Embedding metrics achieve comparable predictive power to URIEL linguistic typology. Our results provide concrete guidance for source language selection and highlight the importance of model-specific analysis.

Keywords

Cite

@article{arxiv.2601.03168,
  title  = {Can Embedding Similarity Predict Cross-Lingual Transfer? A Systematic Study on African Languages},
  author = {Tewodros Kederalah Idris and Prasenjit Mitra and Roald Eiselen},
  journal= {arXiv preprint arXiv:2601.03168},
  year   = {2026}
}

Comments

13 pages, 1 figure, 19 tables

R2 v1 2026-07-01T08:52:53.590Z