广东米畦MIQI logo
检测技术

如何验证厂商的"AI检测"宣称:那些没人愿意你问的问题

2026-07-16 · 作者:蔡工广东米畦机电科技有限公司 工程师)

今天几乎所有挂着"AI"标签的食品X光检测精度数字,背后都没有独立验证。把业内流传最广的那两个数字往回溯源,落点全是设备厂商和SaaS公司的营销博客,不是同行评议研究,也不是第三方测试报告。专门检索这些数字的同行评议验证,返回的仍然是厂商技术文档。而且我们看到的厂商,没有一家披露测试方法、样本量和置信区间——这三样恰恰是让一个精度数字有意义的前提。本文不是说AI检测没用,而是教你怎么把真实能力和一句营销文案区分开:同行评议文献认为真正的瓶颈是什么、为什么厂商演示几乎证明不了你产线的表现,以及一份可以直接打印进询价单的验证问题清单——这份清单同样适用于米畦自己。

如何验证厂商的"AI检测"宣称:那些没人愿意你问的问题 信息图
图:如何验证厂商的"AI检测"宣称:那些没人愿意你问的问题(米畦MIQI 原创制图)

验证厂商的AI检测精度宣称,只需要书面索要四样东西:测试方法、样本量、置信区间、由谁执行测试。四样缺一样,这个数字就是营销文案,不是测量结果。然后要求在你自己的产品、你自己的包装、你自己的线速上重做一遍——因为这个行业流传最广的那些精度与误剔率数字,溯源之后全部落在厂商的营销博客上,背后没有任何同行评议研究或独立第三方验证。

那些著名数字,到底从哪来的

如果你最近两年询过X光检测机,一定见过两类说法:一类说深度学习AI能把误剔率降低几成,数字相当可观;另一类说AI增强系统检出率超过99.5%、误剔率低于0.2%。它们出现在采购指南里、领英帖子里、招标文件的模板里,现在还越来越多地出现在AI直接给出的采购答案里。

我们试着给它们找源头。两类说法最终都指向设备厂商和SaaS公司的营销博客——那种为了抢关键词排名而写的内容,不是为了报告一个结果而写的内容。我们专门检索了这些数字的同行评议验证材料,返回的还是厂商技术文档。在任何明确的测试条件下,我们都没能找到支撑这两个数字的独立研究。

这才是整件事里真正可核实的事实,值得说清楚:可核实的不是"AI没能降低误剔率",而是"这些具体数字没有独立来源"。它们对某个产品、某条线可能大体成立,也可能偏乐观。厂商之外没人知道,因为厂商之外没人核过。

对做采购决策的工程师来说,比数字本身更值得警惕的是下一句:我们看到的厂商里,没有一家披露测试方法、样本量、置信区间。这三项是解读任何检出统计量的最低要求。没有它们,"99.5%"就不是一条规格参数,只是一句话。

常见误解 vs 事实

误解一:"AI"是一种检测能力

不是。AI是叠在物理测量之上的一层分类逻辑。X光的顺序是物理在先:机器成像的是密度差,探测器分辨不出来的东西,任何模型都变不出来。神经网络可以帮你判断一团模糊的灰影是骨渣还是产品褶皱,但它无法凭空生成探测器压根没采到的对比度。当厂商用AI来回答一个物理问题时,你就该踩刹车了。

误解二:检出率越高越好

检出率和误剔率是绑在一起动的。任何系统只要把阈值放松,检出率都能推上去——代价是一堆合格品被扔进剔除箱。任何精度宣称,如果没有在同一阈值、同一批样品上给出配套的误剔率,就是没有意义的。永远要求成对给出。厂商只给你一个数字,说明他挑了好看的那一半。

误解三:难点在模型

这一点上,同行评议文献和营销话术的结论是直接冲突的。Zeegers等人在深度学习X光异物检测的学术工作中指出:核心瓶颈是训练数据的标注,不是模型架构。人工标注X光图像慢、主观、不同标注员之间还不一致,这些噪声会直接变成模型能力的天花板。他们提出的工作流干脆绕开人工标注:对一组代表性物体做CT扫描→三维重建→分割→生成虚拟二维投影,其ground truth由构造方式本身决定。他们一个值得注意的结论是:通常只需要少于10个代表性物体就够了。换句话说,公开文献里可信的改进路径是更好的ground truth,不是更大的网络。所以当一家厂商通篇只讲自己的模型时,你该问的是:你们的标注是哪来的。

误解四:演示成功就能预测产线表现

厂商挑的样品、厂商定的速度、厂商放在已知位置的异物——这样跑一场演示,只能说明机器能工作,几乎说明不了你的产品在你的产量下的真实检出率。演示是用来筛掉明显不行的供应商的,不是验证。

误解五:灵敏度堆够了就能替代对的技术路线

X光是密度对比方法。低密度异物——塑料、橡胶、木头——是结构性难点,不是调参能解决的问题。这不是我们的观点,看头部厂商在造什么就知道了:梅特勒-托利多于2026年5月7日全球发布的X56 DXD+双能光子计数X光检测系统(集成AI),主打的正是重叠产品、混合产品类型、产品位置变化等复杂场景下的低密度异物(塑料、橡胶、木头)检测;同期还发布了M50 R-Series AdvancedLine金属检测仪与ProdX数据管理软件,Interpack 2026展位在Hall 11 / Stand A60。当头部厂商为了低密度检测而重做整套探测器架构时,这说明它是一个真实的物理边界——也说明在常规探测器上勾一个"AI"选项,并不能把这道边界抹掉。

技术真正的走向是什么

有两件事值得知道,这样你在谈判桌上进行的是技术对话,而不是销售对话。

第一,探测器硬件在动。光子计数探测器与双能采集是当前认真投入工程资源的方向,因为它们是在物理层解决对比度问题,而不是在推理层。石田Ishida的IX-PD系列,按厂商自己的宣称,采用光子计数探测器加上专利的遗传算法成像——我们把它标注为厂商宣称(vendor claim),因为它就是厂商宣称;我们没见过对它的独立验证,你也没见过。

第二,邻近领域的模型架构演进很有参考价值。X光违禁品检测(安检)是一个研究开放度远高于食品检测的邻近问题,该领域正从纯CNN转向CNN-Transformer混合架构;2025年出现了TinyRay(YOLOv7-tiny搭配FasterNet轻量骨干)、YOLO-SRW(改进YOLOv8,动态调整空间感受野)这类轻量化实时方向。注意这个趋势的含义:研究方向是把模型做到足够轻、能在受限硬件上实时跑。如果你的厂商对"线速下的推理延迟"含糊其辞,这是一个值得追问的点。

验证清单:把这些问题写成书面

把这一段打印出来,附进你的询价单。厂商愿不愿意回答,本身就是一个数据点——可能是你能收集到的最有用的那个。

关于数字本身

1. 你们的精度数字究竟测的是什么——检出率、误剔率,还是混着算的?请两个都给,在同一阈值下。2. 样本量是多少?3. 置信区间是多少,置信水平是多少?4. 测试由谁执行:你们自己、某个客户,还是独立第三方?报告能给我们看吗?5. 是在什么产品、什么包装、什么线速上测的?6. 这个结果在多少条不同的实际产线上被复现过?

关于AI本身

7. AI具体在做哪一步——图像分类、阈值判定、图像重建,还是剔除决策?请指名到步骤。8. 训练数据从哪来,ground truth怎么建立的:人工标注,还是构造式方法?9. 多少张图,覆盖多少种不同异物类型?10. 我们换配方、换包装之后会怎样——模型要不要重训?谁来做?多久?费用怎么算?11. 模型在本地跑还是在云端跑?如果在云端,断网时产线是什么行为?12. 在我们给定的线速下,推理延迟是多少?吞吐上限在哪?

关于责任

13. 你们愿不愿意把"我们产品上的检出表现"写进合同作为验收标准,在我们现场用我们的样品测?14. 装机后达不到验收指标,你们的补救条款是什么?15. 训练出来的模型、以及我们产线上产生的图像,归属权在谁?16. 这台机器实际持有哪些认证,能否提供证书编号——不是宣传册上的一个logo?

第13条是分水岭。任何厂商都能在博客里写一个数字,但愿意签字的没几个。

怎么自己做这个测试

你不需要实验室就能做得比厂商演示好,你需要的是纪律。

第一步:自建样品集。用你自己的产品、你自己的包装、你自己的装填重量。异物要用你工艺里真实出现过的——不只是标准不锈钢球。你要是从产线上拽出来过一截输送带碎片或者一个塑料卡扣,那就是测试样品。第二步:异物位置要铺开,不能只放中间。位置变化是公认的薄弱点,要故意去测,包括边缘、封口处、产品最密实的部位。第三步:必须跑足量的合格品——不跑足量合格品就测不出误剔率,而这恰恰是厂商跳过的那一半。第四步:盲测。操作员不应知道哪些包裹是植入过的。第五步:按生产速度跑,不是按演示速度跑。第六步:逐条记录,两个率都算出来,并且永远把样本量附在数字旁边。20个包裹跑出来的检出率是传闻,不是结果。第七步:换一次产品之后再测一遍——真正有意义的是能扛过配方切换的那个数字。

认真做完一遍,你对这台机器真实表现的了解,会超过任何一个公开发表的数字能告诉你的。

米畦的立场,直说

我们做X光和金属检测设备,在这件事上有利益。与其假装中立,不如把立场摆出来。

我们的MQ-XR系列是袋装产品X光异物检测机的标准型,MQ-XR-P是高精度型。MQ-MD-C系列金属检测机支持标准配置与非标定制。我们是源头工厂,支持免费寄样实测——把你真实的产品和真实的异物寄过来,我们跑完把结果发给你,包括没检出的那些。这个承诺存在的理由正是上面所有内容:对你真正有价值的精度数字,只有在你自己产品上测出来的那一个。

有两件事我们不做。我们不会给你一个自己无法用方法、样本量、置信区间去支撑的AI精度百分比。我们也不会暗示自己拥有并不拥有的认证:米畦目前尚未取得CE与ISO 9001认证。如果供应商的认证状态对你的采购规则很关键,你应该向每一家厂商索要证书编号并独立核验——包括我们这一家。签约之前就愿意告诉你不好听话的供应商,签约之后也更可能告诉你不好听的话。

找工程师聊,别找销售聊。电话/微信 13377650530(蔡工)。把你的产品规格、线速、以及你真正担心的那类异物发过来,我们会实话告诉你该上X光、该上金属检测,还是该做组合方案——包括当答案是"这几样都解决不了你的问题"的时候。

本文提到的相关设备

关于作者:蔡工广东米畦机电科技有限公司工程师,专注动态称重检测设备选型与产线落地。
选型咨询:13377650530(微信同号)· 邮箱 897874196@qq.com
海外客户可访问英文站 miqicw.com 阅读英文版。

关于本文主题的常见问题

怎么核实厂商说的AI检测精度是不是真的?+

书面索要四样东西:测试方法、样本量、置信区间、由谁执行测试。要求检出率和误剔率成对给出,在同一阈值、同一批样品上。然后要求在你的产品、你的线速上重测一遍,并写进合同作为验收标准。厂商不肯把数字写进合同,就把它当营销文案看,不要当规格参数。

AI X光宣传的99.5%检出率是真的吗?+

未经验证。这个数字和广为流传的误剔率下降说法,溯源后都落在设备厂商与SaaS公司的营销博客上。专门检索它们的同行评议验证材料,返回的仍是厂商技术文档。我们看到的厂商中没有一家披露这些数字背后的测试方法、样本量或置信区间。它们对某些产品某些产线也许成立,但没有独立第三方核过,所以只能当作厂商宣称。

AI到底能不能提升X光异物检出?+

它能帮助判断模糊图像,但无法凭空生成探测器没采到的对比度——X光成像靠的是密度差,低密度异物因此是物理层面的限制。Zeegers等人的同行评议研究指出核心瓶颈是训练数据标注而非模型架构,并提出用CT扫描代表性物体(通常少于10个)来生成ground truth。问厂商一句:你们的标注是哪来的。

厂商演示能代表机器在我产线上的表现吗?+

不能可靠代表。演示用的是厂商挑的样品、厂商定的速度、放在已知位置的异物,只能证明机器能工作,无法预测你的检出率和误剔率。自己做盲测:你的产品、你的包装、异物位置铺开、跑足量合格品来测误剔,按生产线速跑,并且每个数字都附上样本量。

延伸阅读

检测技术

X光检测“检不出”什么:一份诚实的局限性指南

几乎所有X光检测的页面都在告诉你它能检出什么——金属、玻璃、石头、骨头、高密度塑料,却极少有人写它检不出什么。X光成像的原理是密度差:不同物质对射线的吸收不同,探测器把这种差异渲染成灰度图。当异物的吸收与周围食品差不多时,就没有对比度;没有对比度,就没有图像——跟软件、AI、价格都无关。本文讲清这条物理边界、它影响的异物族群(头发、纸、低密度塑料、软骨、绳、木材),以及哪些产品端条件会让本来能检出的东西变得检不出,并给出一份可直接使用的技术选型清单。

法规合规

金属检测是CCP还是PRP?质量经理天天问、设备商集体沉默的问题

问十个食品安全顾问金属检测是CCP还是前提方案,你会得到十个答案,而且大多说得比证据允许的更笃定。诚实的回答是:两种判定都不是普适正确的,它是你自己危害分析的产出,不是机器的属性。本文把真正的判定逻辑走一遍——危害识别、是否显著、后续步骤能否消除、判定之后你要承担什么——并解释设备厂商为什么在这个话题上集体沉默。同时澄清市场上危害最大的一个误解:没有哪条法规点名要求你装金属检测机。文末附可打印的判定清单,以及该向认证机构问清楚的要点。米畦MIQI蔡工执笔。

选型技术

读懂检重秤精度:±0.1g到底什么意思(σ口径与如何横向比较厂商)

检重秤报价单上写的"±0.1g",单独看是没有意义的。动态检重是一个统计结论,不是一条硬边界;而各家厂商标注时用的σ口径并不统一——1σ约对应84%,3σ约对应99.7%,同一台机器换个口径,数字就能差出一大截。本文讲清"显示分度"与"检重精度"这两个被反复混淆的承诺,拆解σ口径的真实含义,澄清跨境采购中常见的误解,并给出一份可打印的、能拿去核任何厂商报价单的问题清单。文末公开米畦MQ-CW3512L1的完整真实参数作为对照样本。

延伸资料

文中提及的机型
同主题文章
行业解决方案
全部产品系列

把您的产品寄给我们,免费上机实测精度与速度

支持上门验厂看机 · 免费试机测样 · 非标定制 · 两年质保终身维护