数据漂移

简而言之:数据漂移是指实时生产数据与模型训练所用数据发生变化。准确率会下降,而解决方法是使用新鲜数据重新训练。

数据漂移发生在生产数据偏离训练数据时。现实世界在变化,但模型不会自动变化。价格会波动,语言会演变,行为会改变。模型的准确率会悄然下降。模型漂移就是由此产生的性能下降。尽早检测漂移对于可靠的 AI 至关重要。

漂移类型

  1. 数据漂移(协变量偏移):输入分布随时间发生变化。
  2. 概念漂移:输入与输出之间的关系发生变化。
  3. 标签漂移:目标标签的分布发生变化。
  4. 上游漂移:管道变化在不知不觉中改变了输入。

漂移的原因

  1. 行为变化:用户习惯和趋势不断演变。
  2. 季节性:需求会随一年中的不同时段而变化。
  3. 新产品或新市场:模型在训练中从未见过的输入。
  4. 管道变化:上游格式或架构发生变化。
  5. 外部冲击:一夜之间重塑数据的事件。

如何检测漂移

  1. 监控输入:将实时特征分布与训练数据进行比较。
  2. 跟踪准确率:根据基准真值数据质量指标观察性能。
  3. 统计检验:PSI 和 KL 散度可量化漂移程度。
  4. 告警:当漂移超过阈值时触发警报。

如何修复漂移

修复漂移的关键是新鲜数据。使用近期且具有代表性的数据重新训练模型。按计划或根据漂移告警自动重新训练。保持持续的数据馈送流入模型。这可以让推理随时间保持准确。

用新鲜数据对抗漂移

漂移是一个数据问题,也需要用数据来解决。当训练数据保持最新时,模型才能保持准确。Bright Data 的数据集网页抓取工具可持续交付新鲜的 Web 数据。这能让模型与现实世界保持一致,同时减少由陈旧数据导致的 AI 幻觉

准备好开始了吗?