電子機器2026年8月11日

購入前にAI AOIシステムを評価する方法

自社の基板で再現できない限り、ベンダの精度数値には何の意味もありません。持ち込むべき6枚の基板、測定すべき5つの項目、そして合格ラインの具体像。

How to Evaluate an AI AOI System Before You Buy

AI AOIシステムの評価は、仕様書の比較ではなく、自社の基板でメーカーの主張を再現できるかで行うべきです。6つのカテゴリの基板(最も難度の高い多品種ワーク、同色部品、マーキング付きインダクタ、CADデータのないワーク、実欠陥が確認済みの基板、現在最も誤報が多い基板)を用意し、5つの項目(プログラミング時間、誤報率、既知欠陥の流出率、オペレーターの立ち上がり時間、ラン間の再現性)を測定してください。評価はベンダーの公表値ではなく、自社の既存ラインをベースラインとして行います。

DaoAIを含め、すべてのAOIベンダーは精度数値を公表しています。しかし、その数値に価値があるかどうかは、自社製品上で再現できるかどうかに完全に依存します。この記事では、購入検討者が実施すべき検証プロトコル(持ち込むべきもの、測定すべき項目、実施期間、合格ラインの定義)を提示します。これはどのベンダーの装置にも適用可能なプロトコルですが、言葉を鵜呑みにせず、ぜひ当社の装置でも同様にテストしてください。

なぜAOIの精度数値を鵜呑みにできないのか?

AOIの精度数値が比較対象として機能しにくい理由は、分母が統一されていないためです。検出率は、部品単位、基板単位、あるいは欠陥カテゴリ単位で提示されることがあり、同一の装置であってもこの3つの基準間で桁違いの差が生じます。誤報率も同様の問題を抱えています。さらに、公表データにはどの基板、どの欠陥セット、どのような閾値設定ポリシーで測定されたかが明記されていません。数値自体が虚偽とは限りませんが、自社のラインにそのまま適用できるものではありません。

公表されている主張を概観すると、そのばらつきが分かります。2025年および2026年の独立系情報源によると、報告元によって誤報率の30〜40パーセント低減、誤判定の70〜85パーセント低減、重要はんだ接合部における98〜99パーセントの検出率などが示されています(Overview.ai 2025; Boolean & Beyond 2026; Jidoka 2026)。DaoAIでは検出精度を98パーセント以上と規定しており、オペレーターのフィードバックによって誤報が継続的に低減します。これらの数値は、再現可能な詳細が公開されていない別々の実験に基づいているため、性能の検証は必ず自社の基板で行う必要があります。

次の3つの質問を投げかけることで、当社の数値を含むほとんどの曖昧さを排除できます:

これはテストが無意味だということではありません。テストは自社のフロアで実施しなければ意味がないということです。

AOIデモに持ち込むべき基板とは?

特定の検証項目を対象とした6つのカテゴリの基板を用意してください。最も難度の高い多品種ワーク、同色部品が実装された基板、マーキング付きチップインダクタや水晶振動子がある基板、CADデータが存在しないワーク、実欠陥を混入または記録した基板、そして現在最も誤報率が高い基板です。ベンダーは自社のデモ基板を提案してきますが、それでは「その装置が得意なこと」しか分かりません。それは知るべき答えではありません。

Six categories of board to bring to an AOI demo evaluation

持ち込む基板 テスト目的 良好な結果の基準
最も難度の高い多品種ワーク 実際の複雑さにおけるプログラミング時間 ベンダーの介入なしでセットアップが完了すること
同色部品 部品本体が基板のソルダーレジストと同色でも検出を維持できるか 部品が確実に位置特定され、見逃しや誤判定の偏りがないこと
マーキング付きインダクタや水晶振動子 表面のマーキングと欠陥を識別できるか 文字やマークが傷や損傷として誤認識されないこと
CADデータのないワーク CADが本当に不要なのか、実質的に必須なのか CADなしでも実運用可能なプログラムが作成できること
既知欠陥のある基板 実際の流出(見逃し)特性 すべての既知欠陥が検出され、正しく分類されること
現在最も誤報が多い基板 現在の課題が実際に改善されるか 既存システムと比べてフラグ数が測定可能なレベルで減少すること

既知欠陥のある基板には注意が必要です。模擬欠陥ではなく、文書化された実際の欠陥基板を用意してください。自社の廃棄ラインから抽出し、目視確認ステーションでIPC-A-610基準に照らして欠陥内容を確定させた基板が該当します。デモ中、その欠陥リストはベンダーに見せてはいけません。事前に欠陥箇所を把握した状態で行う評価は、正当なテストとは呼べません。

また、一般的な標準基板も1枚用意してください。トラブルの少ない高歩留まりのワークは、誤報の下限ベースラインを定義します。平易な基板でノイズ(誤報)が発生するようなシステムであれば、高難度の基板で何ができたとしても実用には耐えません。

実際に測定すべき項目とは?

測定すべき項目は5つです。プログラミング時間(基板受領から初回検査開始までのストップウォッチ計測)、誤報率(フラグ数を検査部品数で除算、分母を固定)、流出率(検出された既知欠陥数を存在する既知欠陥数で除算)、オペレーターの立ち上がり時間(非エンジニアが支援なしで段取り替えを完了できるか)、そして再現性(同一基板を3回走行させて結果を比較)。測定値はその場で記録してください。デモルームでの印象は1日で薄れてしまいます。

計算式を明記した5つの測定項目:

  1. プログラミング時間。 基板が装置にセットされた時点で計測を開始し、初回検査が始まった時点で停止します。データインポート、ライブラリ設定、ROI設定、閾値調整など、すべてを含めます。ベンダーが主張するセットアップ時間は、最も時間のかかる作業を除外していることが多いため注意が必要です。各手順の具体例については、CAD不要のプログラミングの仕組みを参照してください。
  2. 誤報率。 誤報数を検査部品数で割った値(PPMまたはパーセントで表記)。分母を1つに固定し、既存装置を含むすべての評価対象システムで同じ分母を使用します。このルールを徹底するだけで、他のどのような手順よりも妥当な比較が可能になります。
  3. 流出率。 欠陥記録済み基板において、検出された既知欠陥数を存在する既知欠陥の総数で割った値。これは品質を守るための指標です。たとえ誤報率を半減できたとしても、実欠陥の特定カテゴリを1つでも見逃すようであれば、そのシステムを導入する価値はありません。
  4. オペレーターの立ち上がり時間。 プロセスエンジニアやベンダーのアプリケーションエンジニアではなく、現場のラインオペレーターに段取り替えを一から十まで作業させ、時間を計測します。支援が必要になった箇所をすべて記録してください。専門家がいなければ機能しないワークフローである場合、現場の人員計画を見直す必要が生じます。
  5. 再現性。 設定を変更せずに同一基板を3回走行させ、出力されたフラグを比較します。同一走行間でのばらつきは測定システム自体のノイズであり、どれほど閾値をチューニングしてもこのノイズが改善の限界を決定づけます。これはAOIにおけるGage R&R検証に相当し、既存の装置でも実施する価値があります。現行機のベースラインに驚くことも少なくありません。

測定結果はセッション中に1枚のシートにまとめて記録してください。ベンダーA、ベンダーB、既存ラインを、同一の5行で並べて比較します。

パイロット運用はどれくらいの期間行うべきか?

2時間のデモであれば、プログラミング時間、明確な誤報、既知欠陥の検出動作、オペレーターの習熟度を測定できます。しかし、誤報率が長期的に低減するかどうか、部品のロット変更にどう対応するか、量産規模での真の流出率などは測定できません。これらを把握するには、実際のラインで2〜4週間の運用が必要です。デモは一次選考、パイロット運用は最終判断と位置づけてください。

各段階で把握できる内容の境界線:

2時間のデモで把握できる範囲。 セットアップ時間はここで正確に測定できます。同色部品やマーキングの認識動作も単一画像で判定できるため確認可能です。オペレーターの習熟度も即座に判明します。既知欠陥基板での検出動作も検証可能ですが、それは基板1枚分のサンプル検証に留まります。

ラインでの2〜4週間運用でのみ判明する内容。 オペレーターの修正フィードバックによって誤報率が低下傾向を示すかどうか。これは学習型システムと固定型システムを分ける根本的な仕組みです(詳細なメカニズムはこちら)。また、新規の部品ロットやセカンドソース部品で異常が発生しないか、単一サンプルではなく量産規模で流出率が維持されるか、保守の負荷がベンダーの説明通りかどうかも判明します。

早期に判断を下す際の2つの注意点:デモ環境では「学習機能」の主張を検証できません。学習には生産フィードバックと実稼働時間が必要だからです。また、ベンダーが万全に調整した状態のデモ機は、自社のチームが3か月後に維持できる状態とは関係がありません。訪問前に装置がどう設定されていたかを確認してください。

合格ラインの定義とは?

合否判定の基準は、絶対的な数値ではなく自社の既存ラインを基準に設定してください。現在のプログラミング時間、誤報率、流出率、目視再検査の人員数をベースラインとして測定し、導入費用と現場の混乱に見合う改善幅を事前に決めておきます。デモの前に閾値を文書化しておくことが、客観的な判断を保つ鍵です。ベンダーが操作している間は、どの装置も優れているように見えるからです。

デモ実施前に記入しておくべきスコアシート:

測定指標 現状のベースライン リプレイスを正当化する最低基準 デモ結果 パイロット結果
ジョブごとのプログラミング時間 ___ ___
誤報率(同一分母) ___ ___
既知欠陥の流出率 ___ ___(通常は現状維持以上)
オペレーターによる段取り替え可否 yes / no ___
ラン間の再現性 ___ ___

記入時の2つの鉄則:第一に、「流出率」の項目はトレードオフではなくゲート条件です。他の指標がどれほど向上しても、実欠陥を見逃すシステムは他の列の結果に関わらず不合格とします。第二に、中央の列(基準値)はデモの前に決定してください。デモ後に設定した閾値は、単なる後付けの正当化にすぎません。

ベンダーの主張検証ではなく、装置タイプや構成の選定段階にある場合は、各ベンダーに投げるべき7つの質問を含めた選定ガイドを参照してください。

よくある質問

自社の基板持ち込みをベンダーが拒否した場合はどうすべきか?

その拒否自体を一つの回答と見なしてください。機密保持上の制約は現実に存在しますが、NDAを締結すれば対応可能です。いかなる条件でもユーザーの製品でのテストを拒絶するベンダーは、「自社の公表値は自社の基板でしか成立しない」と言っているようなものです。実効性のある評価は、常にユーザーの実製品で行われます。

有意な結果を得るには何枚の基板が必要か?

デモ段階では、枚数よりも6つのカテゴリを網羅しているかどうかが重要です。パイロット運用の場合は、誤報率が偶然ではなく安定した値として計測できるだけの量産基板が必要です。これは特定の枚数を目標にするのではなく、2〜4週間にわたり通常ラインで稼働させることを意味します。

パイロット期間中、ベンダーのエンジニアがシステムをチューニングしても問題ないか?

問題ありません。むしろ実施させてください。ただし、加えられた調整内容はすべて記録に残してください。その作業ログは、将来の保守工数の予測値となります。パイロット期間中にアプリケーションエンジニアが行った作業は、導入後に自社スタッフが引き継ぐべき作業です。ログが膨大であれば、6か月後に誰がその作業を担うのかを確認する必要があります。

パイロットで良好だったAIシステムが、後の量産時に劣化することはないか?

確認すべき故障モードは「ドリフト(経時変化)」です。モデル学習後に部品ロット、基板リビジョン、照明環境などが変化した際に何が起きるかを確認します。オペレーターのフィードバックから学習するシステムはこれらを吸収するように設計されており、DaoAIでは使用に伴い誤報率が上昇するのではなく低下することが報告されています(DaoAI報告値)。モデルがどのように更新されるのか、誰が更新をトリガーするのか、基板リビジョン変更時に何が起きるのかを各ベンダーに確認してください。

当社の装置でプロトコルをお試しください

候補に挙がっているどの装置に対しても、このプロトコルを実施してください。DaoAIがその候補に含まれているなら、6種類の基板を用意し、欠陥リストは明かさず、他社と同一のスコアシートで評価してください。

関連

登録して、役立つ情報をすぐに受信

AI検査の知見、製品ニュース、業界分析。月一回、必要な情報だけをお届け。

お問い合わせへの回答のためにお客様の情報を使用します。 プライバシーポリシーをご確認ください。