深度学习模型的性能上限由数据决定。对安检 AI 而言,图像数据的价值不仅在于训练时的「一次性」使用,更在于部署后形成的持续学习闭环。理解这条数据价值链,是评估一家安检 AI 厂商技术纵深的重要视角。

一、数据从哪来:采集与标注的工程化

安检图像数据的采集面临天然约束:真实违禁品图像在正常运营中是小概率事件,单站点的正样本积累速度远不能满足训练需求。因此,高质量的数据体系需要组合多种来源:真实场景图像的合规采集与脱敏处理、公开数据集(如 SIXray、HiXray、OPIXray 等安检领域公开数据集)的迁移利用、以及基于物理仿真的图像增强。标注环节同样需要工程化:建立统一标注规范、多轮质检机制、以及针对 X 光成像特点的标注细节约定(遮挡目标、堆叠目标的标注策略),才能保证数据质量的一致性。

二、数据怎么用:训练与验证的科学方法

有了数据,还需要科学的训练与验证方法。安检场景的类别不平衡、代价不对称等特性,要求在数据层面采用重采样、合成少数类样本等策略,在模型层面采用焦点损失、难例挖掘等技术。验证环节尤其重要:仅用整体准确率评估会掩盖类别不平衡下的性能塌陷,必须按类别拆分评估,并以 ROC/PR 曲线刻画不同工作点下的权衡,确保模型在真实分布上的表现可预期。

三、数据闭环:让模型越用越聪明

部署不是终点,而是数据闭环的起点。生产环境中,人工复核的结论——尤其是 AI 误报与漏检的案例——是最高价值的反馈信号。将这些反馈定期回流至标注与训练流程,形成「采集—标注—训练—部署—反馈—再训练」的持续迭代循环,模型才能随场景数据分布的变化持续进化。这一闭环能力,决定了安检 AI 系统是「越用越准」还是「上线即巅峰」。道信德辰在多个车站的长期运营中验证了闭环的价值:持续学习机制使系统的误报率随运营时长逐步下降,同时保持检出率的稳定。数据闭环,是安检 AI 真正走向成熟的标志。

北京道信德辰科技有限公司 · 让安检更智能,让出行更安全