响应设计与类别比例如何影响验证数据的准确性
应用统计
2020-02-04 v1
摘要
为验证土地覆盖图而收集的参考数据通常被认为没有误差。然而在实践中,尽管尽一切努力将其最小化,它们仍包含误差。这些误差随后会传播到精度评估阶段并影响验证结果。对于基于照片解译的参考数据,研究最广泛的三种误差来源是系统性错误标注、警觉性下降和人口统计学因素。内部估计误差,即响应设计固有的误差,如何影响参考数据的准确性则远未被充分理解。我们分析了两种图例类型以及基于点和基于分区的响应设计在一系列子样本大小下估计误差的影响。我们表明,响应设计的准确性取决于采样单元内的类别比例,复杂景观更容易出错。因此,子样本数量固定的响应设计效率低下,且参考数据集的标签具有不一致的置信水平。为了控制估计误差,保证验证数据的高精度标准,并最小化数据收集工作量,我们提出依赖照片解译数据的置信区间来确定应标注多少子样本。在实践中,迭代地选择和标注子样本,直到估计的类别比例达到所需的置信水平。结果,在标注明显案例上花费的精力更少,节省的精力可以分配到更复杂的案例上。这种方法在我们的研究区域可以将标注工作量减少50%至75%,在均质景观中收益更大。我们认为,采用这种优化方法不仅会提高参考数据收集的效率,还将有助于向用户群体提供可靠的精度估计。
引用
@article{arxiv.1906.11396,
title = {How response designs and class proportions affect the accuracy of validation data},
author = {Julien Radoux and François Waldner and Patrick Bogaert},
journal= {arXiv preprint arXiv:1906.11396},
year = {2020}
}