2023 年初頭に GPT-4V が発売されてから間もなく、私たちは長年のクライアントから電話を受けました。
家電メーカーのテクニカルディレクターを務めた。 2年前にYOLOv5ベースの表面検査システムを工場に導入し、それ以来安定して稼動していました。
彼は電話で次のような示唆に富んだ質問をした。
「GPT-4V があらゆる種類の画像を解釈し、ほぼすべてを認識できることがわかりました。品質検査に GPT-4V を直接採用できますか? そうすれば、データのラベル付けが完全に不要になるでしょうか?」
私はそのとき率直な答えを保留した。
実を言うと、私たち自身も同様にそのアイデアに魅了されました。
マルチモーダルな大型モデルのデモは間違いなく印象的です。モデルにランダムな画像を入力すると、内容の概要を示し、欠陥を特定し、障害の種類を分類できます。トレーニングやラベル付けは必要ありません。箱から出してすぐにゼロショットのパフォーマンスを実現します。
この機能がシームレスに工場に導入されれば、工業用外観検査のルールブック全体が書き換えられるでしょう。
私たちは 2 年近くをかけて、複数のプロジェクトにわたって多様なマルチモーダル大規模モデル ソリューションをテストしました。
私たちの結論は明らかです。このテクノロジーは魅力的に見えるかもしれませんが、実際の産業応用には厳しい制限が伴います。
この記事では、この 2 年間で私たちが遭遇した落とし穴をすべて記録します。
マルチモーダルな大規模モデルに取り組む前に、業界のベースラインを確立することが重要です。
今日の工業用外観検査の主流のソリューションは、YOLO シリーズに代表されるオブジェクト検出およびセグメンテーション モデルに依存しています。
これは決して新しい傾向ではありません。 YOLOv3 から始まり、広く展開されている YOLOv8、YOLOv9、YOLOv10 を経て、YOLO ファミリは長年にわたり産業生産ラインに実装され、完全に成熟した技術スタックを誇っています。
まず、超高速の推論速度です。
産業用カメラと組み合わせた標準的なエッジ コンピューティング ボックスに搭載された YOLOv8 は、1 フレームの推論を 10 ~ 30 ミリ秒以内に完了し、ほとんどの生産ラインのタクト タイムと一致します。
第二に、十分な検出精度。
適切なラベル付きデータセットを使用すると、YOLO シリーズは一般的な欠陥カテゴリに対して優れた精度を達成し、90% を超える mAP を容易に達成します。
第三に、成熟した導入エコシステム。
既製のツールチェーンは、ONNX、TensorRT、OpenVINO などの複数のデプロイメント フレームワークをサポートします。モデルのトレーニングからオンサイト展開までの完全なワークフローは、数え切れないほどの産業プロジェクトによって検証されています。
4 番目は、包括的なオープンソース エコシステムです。
活発なオープンソース コミュニティは、豊富な事前トレーニング済み重み、データ拡張キット、およびラベル付けツールをすぐに利用できるようにして、ほとんどの技術的ハードルに対するアクセス可能な修正を提供します。
したがって、YOLO シリーズは、2024 年に開始される工業用外観検査プロジェクトの実質的なデフォルトの選択肢となります。
ディープラーニングを採用すべきかどうかを議論する必要はありません。その問題は 10 年前に解決されました。
ここで、新たな核心的な疑問が生じます。マルチモーダルな大規模モデルの出現により、YOLO は依然として最適なソリューションであり続けるのでしょうか?
2023 年には、マルチモーダルな大型モデルのリリースが爆発的に増加しました。
GPT-4V、Gemini、Claude 3 などのモデルは、強力な一般的な画像理解機能を提供します。
従来のワークフロー: 特定の種類の欠陥を検査するには、まずその欠陥の画像を収集、ラベル付けし、トレーニングする必要があります。データがないということは、使用可能なモデルがないことを意味します。
マルチモーダル大規模モデル: 「この画像に傷があるかどうかを確認してください」などの要求を自然言語で記述するだけで、モデルは即座に結果を返します。トレーニングやラベル付けは必要ありません。
これはどういう意味ですか?コールドスタートのコストはゼロに近くなります。
新製品を発売する場合、データ収集、ラベル付け、モデルのトレーニングに 2 週間を費やす必要はありません。数行のプロンプトを入力するだけでモデルを使用できるようになります。
従来のモデルは、境界ボックスと信頼度スコアのみを出力します。たとえば、「このボックス内に欠陥が存在し、信頼度は 0.87」です。
マルチモーダルな大型モデルは、説明的な自然言語を生成します。「写真の左上隅に約 2cm の傷が表示されますが、これは輸送中に形成されたものと考えられます。梱包プロセスを最適化することをお勧めします。」
これはどういう意味ですか?検査結果をそのまま正式な品質検査報告書に変換できます。
従来のモデルは、トレーニング中に見られる欠陥タイプのみを認識できます。彼らは、まったく新しい目に見えない欠陥を特定できません。
理論的には、マルチモーダル大規模モデルはインターネットから取得した大量の画像を処理し、あらゆる種類のまれで不規則な欠陥を潜在的に認識できるようにしています。
これはどういう意味ですか?ロングテール欠陥と異常なエッジケースのカバー範囲が大幅に向上します。
従来のソリューションでは、固定の検査ルールがモデルに埋め込まれています。検査基準を改訂するには、徹底的な再教育が必要です。
マルチモーダルな大規模モデルは、プロンプトを介した標準の動的な調整をサポートします。たとえば、ある日はしきい値を「1cm以上の傷はNG」として設定し、次の日には基になるモデルを変更せずに「0.5cm」に切り替えることができます。
これはどういう意味ですか?調整検査基準は非常に柔軟になります。
これらすべての利点を読んで、あなたも、当時の私たちと同じように、誘惑に駆られるかもしれません。そのため、私たちはマルチモーダルな大規模モデルをいくつかの実際のプロジェクトに導入することにしましたが、その後、コストのかかる落とし穴に次々と遭遇することになりました。
当社のパイロットプロジェクトは、携帯電話筐体の外観検査に焦点を当てました。
生産ラインは 3 秒ごとに 1 つのワークピースを処理します。つまり、ロボットによる仕分けのために 1 秒を確保するために、合計検査待ち時間は 2 秒未満に抑える必要があります。
GPT-4V API ワークフローをテストしました。
平均遅延は 4 ~ 6 秒に達し、ネットワークの変動中は 10 秒を超える可能性があります。これは組立ラインにとっては遅すぎます。
代わりに、LLaVA や Qwen-VL などのセルフホスト型オープンソース マルチモーダル モデルを提案することもできます。これらもテストしました。 A100 GPU で LLaVA-13B を実行すると、単一画像の推論レイテンシーは約 800 ミリ秒から 1.2 秒になります。
クラウド API よりも高速ですが、依然として YOLO よりも数十倍遅いです。
たとえ議論のためにレイテンシを許容したとしても、コスト計算からは厳しいことがわかります。
1 つの生産ラインでは毎日何枚の画像を処理しますか?
3 秒ごとに 1 つのワークを処理し、毎日 20 時間稼働すると仮定すると、1 つのラインで 1 日あたり約 24,000 枚の検査画像が生成されます。
GPT-4V API の場合、単価は解像度とトークン消費量に応じて、画像あたり 0.01 ドルから 0.03 ドルの範囲でした。
これは 1 つのラインにすぎませんが、当社のクライアントは 12 の生産ラインを運用していましたが、これはメーカーにとっては手の届かない出費です。
セルフホスト型のオープンソース モデルについてはどうですか?
単一の A100 GPU は約 1 ~ 2 QPS (1 秒あたりのクエリ数) を実現します。単一回線のピークは約 0.3 QPS で、複数の回線を 1 枚のカードで管理できるようです。
ただし、サーバー、IDC スペース、メンテナンスを考慮すると、A100 導入の年間運用コストは数十万人民元に達します。
対照的に、YOLO 導入では、1 つの完全な生産ラインをサポートするために数千人民元のコストがかかるエッジ コンピューティング ボックスのみが必要です。
コストの差は 2 桁にも及びます。
これは私たちの最もイライラする障害であることが判明しました。
工業用検査では絶対的な決定性が求められます。同一の画像から毎回同一の検査結果が得られる必要があります。そうでないと、標準化された品質管理とトレーサビリティが不可能になります。
ただし、マルチモーダルな大規模モデルは確率的な出力を生成します。
私たちは制御されたテストを実行しました。つまり、同じ欠陥のある画像を同じプロンプトとともに GPT-4V に 10 回別々に送信しました。結果は大きく異なりました。
すべてまったく同じ入力とプロンプトから行われます。
このようなランダム性は工場の品質管理にとって致命的です。検査官は「欠陥の可能性が 70%」という結果に基づいて行動することはできません。すべてのワークピースに最終的な OK または NG の判定が必要です。
一貫性を保つために温度を 0 に設定することを提案する人もいます。この方法を試しましたが、安定性は向上しましたが、100% 同一の出力を保証することはできませんでした。大規模なモデルはサンプリング メカニズムを介して結果を生成し、温度 = 0 の場合でもエッジ ケースでは小さな偏差が残ります。
マルチモーダル モデルのパフォーマンスは、精度と安定性を高めるために多大な労力を費やして最適化した迅速な設計に完全に依存します。
私たちはすぐに、プロンプトが文言の変更に非常に敏感であることを発見しました。
ほぼ同一のコアリクエストを持つ 3 つのプロンプトでは、大きく異なる検査結果が得られました。
プロンプト A: 「この画像に表面欠陥が存在するかどうかを確認してください。」
指示 B: 「製品の表面を注意深く検査し、傷、穴、異物、その他の欠陥を特定します。」
プロンプト C: 「プロの品質検査員として行動してください。この画像にある製品の外観上の欠陥を見つけて分類してください。」
さらに悪いことに、製品 A 用に微調整されたプロンプトは、製品 B に適用すると有効性が失われ、新しい製品バリエーションごとにプロンプト ロジックを完全に作り直す必要があります。
これは、新製品の YOLO モデルを再トレーニングすることとどう違うのでしょうか?
YOLO トレーニングは、モデルが基準を満たしていることを明確に示す定量化可能な評価指標に依存しています。プロンプト チューニングは完全に主観的な試行錯誤に依存しており、最適なパフォーマンスを実現するための明確なベンチマークはありません。
幻覚は、大規模な言語およびマルチモーダル モデルの欠陥であり、十分に文書化されています。システムは、存在しない詳細を自信を持ってでっち上げます。
工業検査では、これは 3 つの典型的な欠陥として現れます。
1 つのテスト ケースはその深刻さを例示しています。完全に完璧な製品画像から、非常に詳細な加工分析が行われました。「右下隅に長さ約 3 mm の浅い傷が検出され、機能的影響の評価が推奨されています。」
綿密な目視検査の結果、その領域には痕跡や傷はまったく存在しませんでした。
このような幻覚が大量生産ラインに侵入すると、欠陥品が検出されずにすり抜けたり(検査漏れ)、または適格な製品が誤って拒否されたり(誤った拒否)、という深刻な結果が生じます。
クラウド API は待ち時間が長く、コストが高すぎるため、セルフホスト型の展開が代替手段のように思えます。私たちは、主流のオープンソース マルチモーダル モデルのハードウェア要件とソフトウェア要件を評価しました。
YOLOv8-m は、8GB VRAM を搭載した GTX 1080 上でもスムーズに動作します。
わずか数十ワットの消費電力で、NVIDIA Jetson モジュールなどのエッジ コンピューティング ハードウェアに導入することもできます。
計算リソースのしきい値は一桁異なります。
ほとんどの工場にとって、生産フロアに A100 サーバーを設置することは、設備投資と日常の運用とメンテナンスの両方の観点から非現実的です。
上記のすべての落とし穴をくぐり抜けた後、私たちは一歩下がって、根本的な問題について考えてみました。
工業用外観検査では本質的にどのようなコア機能が求められますか?
同一の画像からは 100% 一貫した結果が得られる必要があります。これは、標準化された品質管理と完全なトレーサビリティの基礎を形成します。確率的な出力は受け入れられません。
ミリ秒レベルの応答。生産ラインのタクトタイムは厳しく、検査がボトルネックになることはありません。
10 ミリ秒の推論時間と 1,000 ミリ秒の推論時間は、まったく異なる運用上の現実を表します。
1秒あたり何フレーム処理できますか?一日に何個のワークを検査できますか?
計算コストは制御可能な状態を維持し、単一の生産ラインで年間数十万米ドルに及ぶ支出を回避する必要があります。
工場のネットワーク環境は複雑です。多くのワークショップには、安定したインターネット接続やアクセス可能なインターネット接続がありません。
モデルはクラウド API に依存するのではなく、エッジ デバイス上でローカルに動作する必要があります。
欠陥が検出された場合、システムは検査官にその正確な位置とカテゴリを明確に通知する必要があります。
理想的には、下流のシステム統合のために欠陥座標、面積、信頼度スコアを出力する必要があります。
製品はアップグレードされ、検査基準は定期的に改訂されます。
毎回完全に再構築しなくても、反復ごとの適応コストは管理可能でなければなりません。
これら 6 つのコア要件を 2 つの技術的ルートと照合すると、明らかな対照が明らかになります。
では、マルチモーダルな大規模モデルは YOLO に取って代わることができるのでしょうか?結論は明白です:
技術的成熟の現段階では、マルチモーダル大型モデルは工業用外観検査の主要なソリューションとしては適していません。
ゼロショット推論、深い意味理解、強力な一般化などの強みは、生産ラインではほとんど実用的な価値をもたらしません。その一方で、その重大な欠陥、つまり高い遅延、法外なコスト、不安定な出力は、産業の品質管理にとって致命的です。
これは、マルチモーダルな大型モデルが工業用の外観検査にはまったく役に立たないという意味ではありません。
鍵となるのは、適切なニッチを特定することです。
2 年間にわたるフィールド トライアルを経て、マルチモーダル大規模モデルが具体的な価値を生み出す 4 つのシナリオをまとめました。
アノテーションは、従来の検査プロジェクトの最大のコスト要因となっています。
産業用ビジョンのタスクには通常、数千から数万の注釈付き画像が必要です。アノテーション サービスのアウトソーシングの費用は 1 フレームあたり数十分の 1 から数米ドルで、ラベリング費用はプロジェクト投資総額の 30% ~ 50% を占めます。
マルチモーダル大規模モデルは、事前ラベル付け機能を提供します。
モデルは、最初に生の画像から予備的なアノテーション マスクとボックスを生成します。人間のスタッフは、最初からラベルを付けるのではなく、結果を確認して修正するだけで済みます。
当社のフィールドテストでは、このワークフローにより注釈の効率が 3 ~ 5 倍向上し、画像あたりの平均ラベル付け時間が 30 秒から 10 秒未満に短縮されることが証明されています。
YOLO モデルのパフォーマンスの上限は単純です。YOLO モデルは、トレーニング データセットに含まれる欠陥タイプのみを認識できます。
前例のないまれな欠陥は、YOLO による検出ミスを引き起こす可能性があります。
このようなロングテール異常はめったに発生しませんが、多くの場合、深刻な異常な製造条件を示しており、より高い運用リスクを伴います。
マルチモーダルな大規模モデルは、フォールバック検証レイヤーとして機能します。
YOLO が境界線の信頼スコア (およそ 0.3 ~ 0.7、不確実性のグレーゾーン) を出力すると、対応する画像が二次判定のためにマルチモーダル モデルに送信されます。
大規模モデルのゼロショット汎化の強さは、これらの目に見えないまれな異常をカバーします。
このメカニズムでは、すべての画像の 5% ~ 10% のみがマルチモーダル モデルに転送されるため、総コストを管理可能に保ちながら、ロングテール欠陥のカバー率が大幅に向上します。
YOLO は、境界ボックス、欠陥カテゴリ、信頼スコアなどの構造化データのみを出力します。
これらの生の指標は、バックエンドの産業システムには十分ですが、欠陥はどの程度深刻か?という実際的な質問に対する答えを必要とする人間の検査員にとっては直感的ではありません。何が原因でしょうか?どのような是正措置を講じるべきでしょうか?
マルチモーダルな大規模モデルは、セマンティック レポートの生成を実行します。
入力: 欠陥座標、分類ラベル、製品モデル、製造プロセスパラメータ
出力: 自然言語検査レポート、例: 「製品の左端に 5 mm の傷が検出されました。これは金型の磨耗が原因である可能性があります。金型のメンテナンスをお勧めします。」
このタスクは遅延の影響を受けず (レポートは非同期で生成可能)、コスト効率が高くなります (ボリュームが制限された NG 不適合製品に対してのみ実行されます)。
クライアントは時として厳しい納期に直面することがあります。つまり、翌週に量産予定の新製品には欠陥のあるサンプル画像が数十枚しかなく、完全な YOLO トレーニングには不十分です。
従来のワークフローでは、このような限られたデータの下では検査を開始できません。
マルチモーダルな大規模モデルは、過渡的な一時的なソリューションとして機能します。
ゼロショット機能により、完全な手動検査をはるかに上回る、許容範囲内ではあるが不完全な精度で即時導入が可能になります。十分なサンプルが蓄積されたら、パイロット操作中にデータを継続的に収集して、長期使用に備えた正式な YOLO モデルをトレーニングできます。
上記の分析に基づいて、私たちは最近の産業プロジェクトにハイブリッド デュアルチャネル アーキテクチャを採用しました。
このハイブリッド フレームワークの中心となる設計原則は次のとおりです。
以下は、産業用外観検査アルゴリズムを選択するチームの要約された意思決定ツリーです。
ほとんどの産業シナリオでは、YOLO が引き続き最適な選択肢となります。
マルチモーダルな大規模モデルは、遅延耐性、低スループット需要、安定したクラウド コンピューティングのサポート、極度のデータ不足など、特定の条件下でのみ主要なソリューションとして適しています。
最も実用的な業界ソリューションはハイブリッド アーキテクチャです。
冒頭の質問を再考します: マルチモーダル大規模モデルは YOLO に取って代わることができますか?
2 年間にわたる実践的な試行錯誤を経て、私たちの結論は明らかです。
これは質問の構成が間違っています。
これは「A が B に取って代わる」というゼロサムの競争ではなく、各テクノロジーが独自の生態学的ニッチを占める問題です。
マルチモーダル大規模モデルは恐るべき機能を備えていますが、その核となる強みであるゼロショット推論、深い意味理解、広範な一般化は、中核となる生産検査ワークフローに限定的な価値を提供します。
一方、それらの固有の欠点、つまり、高い遅延、過度の運用コスト、不安定な出力は、まさに工業製造が許容できない交渉不可能な問題点です。
技術選択の本質は、最新のトレンド技術を追うことではなく、現実世界のシナリオの要求にソリューションを適合させることです。
YOLO シリーズは長年にわたり工業用外観検査全体に広く導入されており、事実上の標準としての地位は十分に正当です。
マルチモーダル大規模モデルは強力な補助ツールですが、現在の技術的成熟度では完全な代替として適格ではありません。
おそらく 3 年か 5 年後には状況が変わり、推論速度が大幅に向上し、導入コストが大幅に低下し、決定論の問題が完全に解決されるでしょう。
そうして初めて本格的な代替の議論が再びできるのです。
2023 年初頭に GPT-4V が発売されてから間もなく、私たちは長年のクライアントから電話を受けました。
家電メーカーのテクニカルディレクターを務めた。 2年前にYOLOv5ベースの表面検査システムを工場に導入し、それ以来安定して稼動していました。
彼は電話で次のような示唆に富んだ質問をした。
「GPT-4V があらゆる種類の画像を解釈し、ほぼすべてを認識できることがわかりました。品質検査に GPT-4V を直接採用できますか? そうすれば、データのラベル付けが完全に不要になるでしょうか?」
私はそのとき率直な答えを保留した。
実を言うと、私たち自身も同様にそのアイデアに魅了されました。
マルチモーダルな大型モデルのデモは間違いなく印象的です。モデルにランダムな画像を入力すると、内容の概要を示し、欠陥を特定し、障害の種類を分類できます。トレーニングやラベル付けは必要ありません。箱から出してすぐにゼロショットのパフォーマンスを実現します。
この機能がシームレスに工場に導入されれば、工業用外観検査のルールブック全体が書き換えられるでしょう。
私たちは 2 年近くをかけて、複数のプロジェクトにわたって多様なマルチモーダル大規模モデル ソリューションをテストしました。
私たちの結論は明らかです。このテクノロジーは魅力的に見えるかもしれませんが、実際の産業応用には厳しい制限が伴います。
この記事では、この 2 年間で私たちが遭遇した落とし穴をすべて記録します。
マルチモーダルな大規模モデルに取り組む前に、業界のベースラインを確立することが重要です。
今日の工業用外観検査の主流のソリューションは、YOLO シリーズに代表されるオブジェクト検出およびセグメンテーション モデルに依存しています。
これは決して新しい傾向ではありません。 YOLOv3 から始まり、広く展開されている YOLOv8、YOLOv9、YOLOv10 を経て、YOLO ファミリは長年にわたり産業生産ラインに実装され、完全に成熟した技術スタックを誇っています。
まず、超高速の推論速度です。
産業用カメラと組み合わせた標準的なエッジ コンピューティング ボックスに搭載された YOLOv8 は、1 フレームの推論を 10 ~ 30 ミリ秒以内に完了し、ほとんどの生産ラインのタクト タイムと一致します。
第二に、十分な検出精度。
適切なラベル付きデータセットを使用すると、YOLO シリーズは一般的な欠陥カテゴリに対して優れた精度を達成し、90% を超える mAP を容易に達成します。
第三に、成熟した導入エコシステム。
既製のツールチェーンは、ONNX、TensorRT、OpenVINO などの複数のデプロイメント フレームワークをサポートします。モデルのトレーニングからオンサイト展開までの完全なワークフローは、数え切れないほどの産業プロジェクトによって検証されています。
4 番目は、包括的なオープンソース エコシステムです。
活発なオープンソース コミュニティは、豊富な事前トレーニング済み重み、データ拡張キット、およびラベル付けツールをすぐに利用できるようにして、ほとんどの技術的ハードルに対するアクセス可能な修正を提供します。
したがって、YOLO シリーズは、2024 年に開始される工業用外観検査プロジェクトの実質的なデフォルトの選択肢となります。
ディープラーニングを採用すべきかどうかを議論する必要はありません。その問題は 10 年前に解決されました。
ここで、新たな核心的な疑問が生じます。マルチモーダルな大規模モデルの出現により、YOLO は依然として最適なソリューションであり続けるのでしょうか?
2023 年には、マルチモーダルな大型モデルのリリースが爆発的に増加しました。
GPT-4V、Gemini、Claude 3 などのモデルは、強力な一般的な画像理解機能を提供します。
従来のワークフロー: 特定の種類の欠陥を検査するには、まずその欠陥の画像を収集、ラベル付けし、トレーニングする必要があります。データがないということは、使用可能なモデルがないことを意味します。
マルチモーダル大規模モデル: 「この画像に傷があるかどうかを確認してください」などの要求を自然言語で記述するだけで、モデルは即座に結果を返します。トレーニングやラベル付けは必要ありません。
これはどういう意味ですか?コールドスタートのコストはゼロに近くなります。
新製品を発売する場合、データ収集、ラベル付け、モデルのトレーニングに 2 週間を費やす必要はありません。数行のプロンプトを入力するだけでモデルを使用できるようになります。
従来のモデルは、境界ボックスと信頼度スコアのみを出力します。たとえば、「このボックス内に欠陥が存在し、信頼度は 0.87」です。
マルチモーダルな大型モデルは、説明的な自然言語を生成します。「写真の左上隅に約 2cm の傷が表示されますが、これは輸送中に形成されたものと考えられます。梱包プロセスを最適化することをお勧めします。」
これはどういう意味ですか?検査結果をそのまま正式な品質検査報告書に変換できます。
従来のモデルは、トレーニング中に見られる欠陥タイプのみを認識できます。彼らは、まったく新しい目に見えない欠陥を特定できません。
理論的には、マルチモーダル大規模モデルはインターネットから取得した大量の画像を処理し、あらゆる種類のまれで不規則な欠陥を潜在的に認識できるようにしています。
これはどういう意味ですか?ロングテール欠陥と異常なエッジケースのカバー範囲が大幅に向上します。
従来のソリューションでは、固定の検査ルールがモデルに埋め込まれています。検査基準を改訂するには、徹底的な再教育が必要です。
マルチモーダルな大規模モデルは、プロンプトを介した標準の動的な調整をサポートします。たとえば、ある日はしきい値を「1cm以上の傷はNG」として設定し、次の日には基になるモデルを変更せずに「0.5cm」に切り替えることができます。
これはどういう意味ですか?調整検査基準は非常に柔軟になります。
これらすべての利点を読んで、あなたも、当時の私たちと同じように、誘惑に駆られるかもしれません。そのため、私たちはマルチモーダルな大規模モデルをいくつかの実際のプロジェクトに導入することにしましたが、その後、コストのかかる落とし穴に次々と遭遇することになりました。
当社のパイロットプロジェクトは、携帯電話筐体の外観検査に焦点を当てました。
生産ラインは 3 秒ごとに 1 つのワークピースを処理します。つまり、ロボットによる仕分けのために 1 秒を確保するために、合計検査待ち時間は 2 秒未満に抑える必要があります。
GPT-4V API ワークフローをテストしました。
平均遅延は 4 ~ 6 秒に達し、ネットワークの変動中は 10 秒を超える可能性があります。これは組立ラインにとっては遅すぎます。
代わりに、LLaVA や Qwen-VL などのセルフホスト型オープンソース マルチモーダル モデルを提案することもできます。これらもテストしました。 A100 GPU で LLaVA-13B を実行すると、単一画像の推論レイテンシーは約 800 ミリ秒から 1.2 秒になります。
クラウド API よりも高速ですが、依然として YOLO よりも数十倍遅いです。
たとえ議論のためにレイテンシを許容したとしても、コスト計算からは厳しいことがわかります。
1 つの生産ラインでは毎日何枚の画像を処理しますか?
3 秒ごとに 1 つのワークを処理し、毎日 20 時間稼働すると仮定すると、1 つのラインで 1 日あたり約 24,000 枚の検査画像が生成されます。
GPT-4V API の場合、単価は解像度とトークン消費量に応じて、画像あたり 0.01 ドルから 0.03 ドルの範囲でした。
これは 1 つのラインにすぎませんが、当社のクライアントは 12 の生産ラインを運用していましたが、これはメーカーにとっては手の届かない出費です。
セルフホスト型のオープンソース モデルについてはどうですか?
単一の A100 GPU は約 1 ~ 2 QPS (1 秒あたりのクエリ数) を実現します。単一回線のピークは約 0.3 QPS で、複数の回線を 1 枚のカードで管理できるようです。
ただし、サーバー、IDC スペース、メンテナンスを考慮すると、A100 導入の年間運用コストは数十万人民元に達します。
対照的に、YOLO 導入では、1 つの完全な生産ラインをサポートするために数千人民元のコストがかかるエッジ コンピューティング ボックスのみが必要です。
コストの差は 2 桁にも及びます。
これは私たちの最もイライラする障害であることが判明しました。
工業用検査では絶対的な決定性が求められます。同一の画像から毎回同一の検査結果が得られる必要があります。そうでないと、標準化された品質管理とトレーサビリティが不可能になります。
ただし、マルチモーダルな大規模モデルは確率的な出力を生成します。
私たちは制御されたテストを実行しました。つまり、同じ欠陥のある画像を同じプロンプトとともに GPT-4V に 10 回別々に送信しました。結果は大きく異なりました。
すべてまったく同じ入力とプロンプトから行われます。
このようなランダム性は工場の品質管理にとって致命的です。検査官は「欠陥の可能性が 70%」という結果に基づいて行動することはできません。すべてのワークピースに最終的な OK または NG の判定が必要です。
一貫性を保つために温度を 0 に設定することを提案する人もいます。この方法を試しましたが、安定性は向上しましたが、100% 同一の出力を保証することはできませんでした。大規模なモデルはサンプリング メカニズムを介して結果を生成し、温度 = 0 の場合でもエッジ ケースでは小さな偏差が残ります。
マルチモーダル モデルのパフォーマンスは、精度と安定性を高めるために多大な労力を費やして最適化した迅速な設計に完全に依存します。
私たちはすぐに、プロンプトが文言の変更に非常に敏感であることを発見しました。
ほぼ同一のコアリクエストを持つ 3 つのプロンプトでは、大きく異なる検査結果が得られました。
プロンプト A: 「この画像に表面欠陥が存在するかどうかを確認してください。」
指示 B: 「製品の表面を注意深く検査し、傷、穴、異物、その他の欠陥を特定します。」
プロンプト C: 「プロの品質検査員として行動してください。この画像にある製品の外観上の欠陥を見つけて分類してください。」
さらに悪いことに、製品 A 用に微調整されたプロンプトは、製品 B に適用すると有効性が失われ、新しい製品バリエーションごとにプロンプト ロジックを完全に作り直す必要があります。
これは、新製品の YOLO モデルを再トレーニングすることとどう違うのでしょうか?
YOLO トレーニングは、モデルが基準を満たしていることを明確に示す定量化可能な評価指標に依存しています。プロンプト チューニングは完全に主観的な試行錯誤に依存しており、最適なパフォーマンスを実現するための明確なベンチマークはありません。
幻覚は、大規模な言語およびマルチモーダル モデルの欠陥であり、十分に文書化されています。システムは、存在しない詳細を自信を持ってでっち上げます。
工業検査では、これは 3 つの典型的な欠陥として現れます。
1 つのテスト ケースはその深刻さを例示しています。完全に完璧な製品画像から、非常に詳細な加工分析が行われました。「右下隅に長さ約 3 mm の浅い傷が検出され、機能的影響の評価が推奨されています。」
綿密な目視検査の結果、その領域には痕跡や傷はまったく存在しませんでした。
このような幻覚が大量生産ラインに侵入すると、欠陥品が検出されずにすり抜けたり(検査漏れ)、または適格な製品が誤って拒否されたり(誤った拒否)、という深刻な結果が生じます。
クラウド API は待ち時間が長く、コストが高すぎるため、セルフホスト型の展開が代替手段のように思えます。私たちは、主流のオープンソース マルチモーダル モデルのハードウェア要件とソフトウェア要件を評価しました。
YOLOv8-m は、8GB VRAM を搭載した GTX 1080 上でもスムーズに動作します。
わずか数十ワットの消費電力で、NVIDIA Jetson モジュールなどのエッジ コンピューティング ハードウェアに導入することもできます。
計算リソースのしきい値は一桁異なります。
ほとんどの工場にとって、生産フロアに A100 サーバーを設置することは、設備投資と日常の運用とメンテナンスの両方の観点から非現実的です。
上記のすべての落とし穴をくぐり抜けた後、私たちは一歩下がって、根本的な問題について考えてみました。
工業用外観検査では本質的にどのようなコア機能が求められますか?
同一の画像からは 100% 一貫した結果が得られる必要があります。これは、標準化された品質管理と完全なトレーサビリティの基礎を形成します。確率的な出力は受け入れられません。
ミリ秒レベルの応答。生産ラインのタクトタイムは厳しく、検査がボトルネックになることはありません。
10 ミリ秒の推論時間と 1,000 ミリ秒の推論時間は、まったく異なる運用上の現実を表します。
1秒あたり何フレーム処理できますか?一日に何個のワークを検査できますか?
計算コストは制御可能な状態を維持し、単一の生産ラインで年間数十万米ドルに及ぶ支出を回避する必要があります。
工場のネットワーク環境は複雑です。多くのワークショップには、安定したインターネット接続やアクセス可能なインターネット接続がありません。
モデルはクラウド API に依存するのではなく、エッジ デバイス上でローカルに動作する必要があります。
欠陥が検出された場合、システムは検査官にその正確な位置とカテゴリを明確に通知する必要があります。
理想的には、下流のシステム統合のために欠陥座標、面積、信頼度スコアを出力する必要があります。
製品はアップグレードされ、検査基準は定期的に改訂されます。
毎回完全に再構築しなくても、反復ごとの適応コストは管理可能でなければなりません。
これら 6 つのコア要件を 2 つの技術的ルートと照合すると、明らかな対照が明らかになります。
では、マルチモーダルな大規模モデルは YOLO に取って代わることができるのでしょうか?結論は明白です:
技術的成熟の現段階では、マルチモーダル大型モデルは工業用外観検査の主要なソリューションとしては適していません。
ゼロショット推論、深い意味理解、強力な一般化などの強みは、生産ラインではほとんど実用的な価値をもたらしません。その一方で、その重大な欠陥、つまり高い遅延、法外なコスト、不安定な出力は、産業の品質管理にとって致命的です。
これは、マルチモーダルな大型モデルが工業用の外観検査にはまったく役に立たないという意味ではありません。
鍵となるのは、適切なニッチを特定することです。
2 年間にわたるフィールド トライアルを経て、マルチモーダル大規模モデルが具体的な価値を生み出す 4 つのシナリオをまとめました。
アノテーションは、従来の検査プロジェクトの最大のコスト要因となっています。
産業用ビジョンのタスクには通常、数千から数万の注釈付き画像が必要です。アノテーション サービスのアウトソーシングの費用は 1 フレームあたり数十分の 1 から数米ドルで、ラベリング費用はプロジェクト投資総額の 30% ~ 50% を占めます。
マルチモーダル大規模モデルは、事前ラベル付け機能を提供します。
モデルは、最初に生の画像から予備的なアノテーション マスクとボックスを生成します。人間のスタッフは、最初からラベルを付けるのではなく、結果を確認して修正するだけで済みます。
当社のフィールドテストでは、このワークフローにより注釈の効率が 3 ~ 5 倍向上し、画像あたりの平均ラベル付け時間が 30 秒から 10 秒未満に短縮されることが証明されています。
YOLO モデルのパフォーマンスの上限は単純です。YOLO モデルは、トレーニング データセットに含まれる欠陥タイプのみを認識できます。
前例のないまれな欠陥は、YOLO による検出ミスを引き起こす可能性があります。
このようなロングテール異常はめったに発生しませんが、多くの場合、深刻な異常な製造条件を示しており、より高い運用リスクを伴います。
マルチモーダルな大規模モデルは、フォールバック検証レイヤーとして機能します。
YOLO が境界線の信頼スコア (およそ 0.3 ~ 0.7、不確実性のグレーゾーン) を出力すると、対応する画像が二次判定のためにマルチモーダル モデルに送信されます。
大規模モデルのゼロショット汎化の強さは、これらの目に見えないまれな異常をカバーします。
このメカニズムでは、すべての画像の 5% ~ 10% のみがマルチモーダル モデルに転送されるため、総コストを管理可能に保ちながら、ロングテール欠陥のカバー率が大幅に向上します。
YOLO は、境界ボックス、欠陥カテゴリ、信頼スコアなどの構造化データのみを出力します。
これらの生の指標は、バックエンドの産業システムには十分ですが、欠陥はどの程度深刻か?という実際的な質問に対する答えを必要とする人間の検査員にとっては直感的ではありません。何が原因でしょうか?どのような是正措置を講じるべきでしょうか?
マルチモーダルな大規模モデルは、セマンティック レポートの生成を実行します。
入力: 欠陥座標、分類ラベル、製品モデル、製造プロセスパラメータ
出力: 自然言語検査レポート、例: 「製品の左端に 5 mm の傷が検出されました。これは金型の磨耗が原因である可能性があります。金型のメンテナンスをお勧めします。」
このタスクは遅延の影響を受けず (レポートは非同期で生成可能)、コスト効率が高くなります (ボリュームが制限された NG 不適合製品に対してのみ実行されます)。
クライアントは時として厳しい納期に直面することがあります。つまり、翌週に量産予定の新製品には欠陥のあるサンプル画像が数十枚しかなく、完全な YOLO トレーニングには不十分です。
従来のワークフローでは、このような限られたデータの下では検査を開始できません。
マルチモーダルな大規模モデルは、過渡的な一時的なソリューションとして機能します。
ゼロショット機能により、完全な手動検査をはるかに上回る、許容範囲内ではあるが不完全な精度で即時導入が可能になります。十分なサンプルが蓄積されたら、パイロット操作中にデータを継続的に収集して、長期使用に備えた正式な YOLO モデルをトレーニングできます。
上記の分析に基づいて、私たちは最近の産業プロジェクトにハイブリッド デュアルチャネル アーキテクチャを採用しました。
このハイブリッド フレームワークの中心となる設計原則は次のとおりです。
以下は、産業用外観検査アルゴリズムを選択するチームの要約された意思決定ツリーです。
ほとんどの産業シナリオでは、YOLO が引き続き最適な選択肢となります。
マルチモーダルな大規模モデルは、遅延耐性、低スループット需要、安定したクラウド コンピューティングのサポート、極度のデータ不足など、特定の条件下でのみ主要なソリューションとして適しています。
最も実用的な業界ソリューションはハイブリッド アーキテクチャです。
冒頭の質問を再考します: マルチモーダル大規模モデルは YOLO に取って代わることができますか?
2 年間にわたる実践的な試行錯誤を経て、私たちの結論は明らかです。
これは質問の構成が間違っています。
これは「A が B に取って代わる」というゼロサムの競争ではなく、各テクノロジーが独自の生態学的ニッチを占める問題です。
マルチモーダル大規模モデルは恐るべき機能を備えていますが、その核となる強みであるゼロショット推論、深い意味理解、広範な一般化は、中核となる生産検査ワークフローに限定的な価値を提供します。
一方、それらの固有の欠点、つまり、高い遅延、過度の運用コスト、不安定な出力は、まさに工業製造が許容できない交渉不可能な問題点です。
技術選択の本質は、最新のトレンド技術を追うことではなく、現実世界のシナリオの要求にソリューションを適合させることです。
YOLO シリーズは長年にわたり工業用外観検査全体に広く導入されており、事実上の標準としての地位は十分に正当です。
マルチモーダル大規模モデルは強力な補助ツールですが、現在の技術的成熟度では完全な代替として適格ではありません。
おそらく 3 年か 5 年後には状況が変わり、推論速度が大幅に向上し、導入コストが大幅に低下し、決定論の問題が完全に解決されるでしょう。
そうして初めて本格的な代替の議論が再びできるのです。