开放域对话生成中上下文长度的实证研究
计算与语言
2024-09-04 v1 人工智能
机器学习
摘要
近年来,基于Transformer的开放域对话模型日益流行。这些模型通常将上下文表示为对话历史的拼接。然而,目前尚无标准来决定上下文中应保留多少条语句才算足够。我们试图探究上下文长度的选择如何影响模型。我们从粗到细对三个问题进行了实验:(i) 更长的上下文是否有助于模型训练?(ii) 在处理不同上下文长度的对话时,是否有必要改变训练上下文长度?(iii) 不同的对话样本对上下文长度的偏好是否相同?我们的实验结果表明,上下文长度这一常被忽视的设置,在实现基于Transformer的对话模型时值得关注。
引用
@article{arxiv.2409.00315,
title = {An Empirical Study on Context Length for Open-Domain Dialog Generation},
author = {Xinyi Shen and Zuoquan Lin},
journal= {arXiv preprint arXiv:2409.00315},
year = {2024}
}
备注
6 pages, 2 figures, 2 tables