PreCogIIITH 在 HinglishEval 上的工作:利用码混合度量与语言模型嵌入估计码混合质量
人工智能
2022-06-17 v1
摘要
码混合是在一个言语事件中混合两种或更多语言的现象,且在多语社会中普遍存在。鉴于码混合的低资源性质,机器生成码混合文本是一种普遍的数据增强方法。然而,评估此类机器生成码混合文本的质量是一个开放问题。在我们提交给 HinglishEval(与 INLG2022 联合举办的共享任务)的工作中,我们尝试通过预测码混合质量的评分,构建影响合成生成码混合文本质量的因素的模型。
引用
@article{arxiv.2206.07988,
title = {PreCogIIITH at HinglishEval : Leveraging Code-Mixing Metrics & Language Model Embeddings To Estimate Code-Mix Quality},
author = {Prashant Kodali and Tanmay Sachan and Akshay Goindani and Anmol Goel and Naman Ahuja and Manish Shrivastava and Ponnurangam Kumaraguru},
journal= {arXiv preprint arXiv:2206.07988},
year = {2022}
}