logo
продукты
новостная информация
Дом > Новости >
Промышленный визуальный контроль: привлекательность мультимодальных больших моделей
События
Свяжитесь мы
Miss. Andy
86-0592-5636807
Wechat +8618020763272
Контакт теперь

Промышленный визуальный контроль: привлекательность мультимодальных больших моделей

2026-06-26
Latest company news about Промышленный визуальный контроль: привлекательность мультимодальных больших моделей
I. Заманчивый вопрос

Вскоре после запуска GPT-4V в начале 2023 года, нам позвонил давний клиент.

Два года назад мы внедрили систему поверхностной инспекции на базе YOLOv5 для их завода,которая с тех пор стабильно работает..

Он задал вызывающий мысль вопрос по телефону:

Я видел, что GPT-4V может интерпретировать все виды изображений и распознавать почти все.Можно ли использовать его непосредственно для проверки качества?

Тогда я не дал прямого ответа.

Честно говоря, мы были одинаково очарованы этой идеей.

Демонстрации многомодальных больших моделей, безусловно, впечатляют.Не требуется обучения или маркировки; он обеспечивает нулевую производительность прямо из коробки.

Если эта способность будет легко применяться на заводах, то вся книга правил промышленной визуальной инспекции будет переписана.

Мы провели почти два года, тестируя разнообразные мультимодальные решения для больших моделей в нескольких проектах.

Наш вывод очевиден: каким бы заманчивым ни казалась технология, ее промышленное применение в реальном мире имеет серьезные ограничения.

Эта статья описывает все ловушки, с которыми мы столкнулись за эти два года.

II. Определить текущий ландшафт: YOLO стал де-факто стандартом

Перед тем, как погрузиться в многомодальные крупные модели, важно определить базовые показатели отрасли:

Доминирующее решение для современной промышленной визуальной инспекции опирается на модели обнаружения объектов и сегментации, представленные серией YOLO.

Начиная с YOLOv3 и заканчивая широко распространенными YOLOv8, YOLOv9 и YOLOv10, семейство YOLO уже много лет применяется на промышленных производственных линиях.обладает полностью зрелым техническим набором.

последние новости компании о Промышленный визуальный контроль: привлекательность мультимодальных больших моделей  0
Почему YOLO стал де-факто стандартом?

Во-первых, сверхбыстрая скорость вывода.

Оснащенный стандартными компьютерными коробками, совмещенными с промышленными камерами, YOLOv8 завершает вывод для одного кадра в течение 10 до 30 миллисекунд, что соответствует тактовому времени большинства производственных линий.

Во-вторых, достаточная точность обнаружения.

При наличии адекватных наборов маркированных данных, серия YOLO достигает исключительной точности для распространенных категорий дефектов, легко достигая MAP более 90%.

В-третьих, зрелая экосистема развертывания.

Готовые цепочки инструментов поддерживают несколько рамок развертывания, включая ONNX, TensorRT и OpenVINO.Полный рабочий процесс от обучения моделей до развертывания на месте был подтвержден бесчисленными промышленными проектами.

В-четвертых, комплексная экосистема с открытым исходным кодом.

Активное сообщество с открытым исходным кодом предоставляет доступные решения для большинства технических препятствий, с большим количеством предварительно подготовленных весов, наборов для увеличения данных и инструментов маркировки, которые легко доступны.

Таким образом, серия YOLO является практически выбором по умолчанию для проектов промышленной визуальной инспекции, запущенных в 2024 году.

Нет необходимости обсуждать вопрос о необходимости внедрения глубокого обучения - этот вопрос был решен десять лет назад.

Теперь возникает новый ключевой вопрос: с появлением мультимодальных больших моделей, остается ли YOLO оптимальным решением?

III. Привлекательность многомодальных больших моделей: многообещающий мираж

В 2023 году произошла взрывная волна выпуска больших моделей.

Модели, включая GPT-4V, Gemini и Claude 3, обеспечивают мощные возможности общего понимания изображений.

последние новости компании о Промышленный визуальный контроль: привлекательность мультимодальных больших моделей  1
Мы провели тесты на этих моделях, и, честно говоря, их демонстрационные показатели действительно впечатляют:
Привлекательность 1: способность стрелять с нуля

Традиционный рабочий процесс: для проверки конкретного типа дефекта сначала необходимо собрать, пометить и обучить изображения этого дефекта.

Многомодальные большие модели: просто опишите свой запрос на естественном языке, например "Проверьте, есть ли царапины на этом изображении", и модель мгновенно вернет результаты.Не требуется обучения или маркировки.

Стоимость холостого запуска падает почти до нуля.

При запуске новых продуктов нет необходимости тратить две недели на сбор данных, маркировку и обучение модели.

Привлечение 2: продвинутое семантическое понимание

Традиционные модели выводят только ограничительные поля и оценки доверия, например, в этом поле существует дефект с доверием 0,87".

Большие мультимодальные модели генерируют описательный естественный язык: в левом верхнем углу изображения появляется царапина размером около 2 см, которая, вероятно, образовалась во время транспортировки.Рекомендуется оптимизировать процесс упаковки.. "

Результаты проверки могут быть непосредственно преобразованы в официальные отчеты о проверке качества.

Привлечение 3: мощная способность к обобщению

Традиционные модели могут распознавать только типы дефектов, обнаруженных во время обучения; они не могут идентифицировать совершенно новые невидимые дефекты.

Теоретически, многомодальные большие модели обрабатывают огромные изображения из Интернета, что позволяет им потенциально распознавать все виды редких и нерегулярных дефектов.

Покрытие дефектов длинного хвоста и аномальных случаев краев резко улучшилось.

Привлечение 4: Интерактивная логика инспекции

Традиционные решения включают в модель фиксированные правила проверки.

Многомодальные большие модели поддерживают динамическую корректировку стандартов с помощью запросов. Например, вы можете установить порог, когда ′′грабежи свыше 1 см считаются NG" в один день и переключить его на ′′0.5 см" следующий без изменения базовой модели.

Это означает, что стандарты наладки станут чрезвычайно гибкими.

Читая все эти преимущества, вы также можете испытывать соблазн, как и мы в то время.только чтобы потом столкнуться с целым рядом дорогостоящих ловушек..

IV. Шесть дорогостоящих ловушек, с которыми приходится сталкиваться при практическом применении
Ловушка 1: чрезмерная задержка вывода не подходит для производственных линий

Наш пилотный проект был сосредоточен на проверке внешнего вида корпусов мобильных телефонов.

Производственная линия обрабатывает одну заготовку каждые 3 секунды, что означает, что общая задержка проверки должна оставаться ниже 2 секунд, чтобы зарезервировать 1 секунду для роботизированной сортировки.

Мы протестировали рабочий процесс API GPT-4V:

  1. Загрузить изображение и ввести запрос
  2. Подождите ответа сервера
  3. Получить результаты проверки

Средняя задержка достигла 4 ‰ 6 секунд и могла превышать 10 секунд на фоне колебаний сети ≈ слишком медленно для сборочной линии.

Вместо этого вы могли бы предложить самостоятельные мультимодальные модели с открытым исходным кодом, такие как LLaVA и Qwen-VL. Мы также их протестировали.Запуск LLaVA-13B на графическом процессоре A100 дает задержку вывода одного изображения примерно 800 мс к 1.2 секунды.

Хотя он быстрее облачных API, он остается в десятки раз медленнее YOLO.

Плохая 2: стремительно растущие затраты на пропускную способность и вычислительные системы

Даже если мы допустим задержку ради аргументов, расчет затрат расскажет грубую историю.

Сколько изображений обрабатывает одна производственная линия в день?

Предполагая, что каждые 3 секунды и 20 часов ежедневной работы производится одна деталь, одна линия генерирует около 24 000 изображений в день.

Для API GPT-4V стоимость единицы варьировалась от $0,01 до $0,03 за изображение в зависимости от разрешения и потребления токенов:

  • Ежедневные расходы на одну строку: 240-720 долларов США
  • Ежемесячная стоимость за строку: $7200$21600
  • Ежегодные расходы на линию: $86,400$259,200

Это всего лишь одна линия, в то время как наш клиент управлял 12 производственными линиями - недоступные затраты для производителей.

А как насчет самостоятельно размещаемых моделей с открытым исходным кодом?

Одинокий графический процессор A100 обеспечивает приблизительно 1 ‰ 2 QPS (запросы в секунду).

Однако, учитывая серверы, пространство IDC и техническое обслуживание, годовая эксплуатационная стоимость развертывания A100 составляет сотни тысяч юаней.

В отличие от этого, для развертывания YOLO требуется только краевая вычислительная коробка стоимостью в несколько тысяч юаней для поддержки одной полной производственной линии.

Разрыв в стоимости охватывает два порядка величины.

Ловушка 3: неустойчивые, вероятностные результаты несовместимые результаты для идентичных изображений

Это оказалось самым разочаровывающим препятствием.

Промышленная инспекция требует абсолютного детерминизма: одинаковые изображения должны каждый раз давать одинаковые результаты инспекции.в противном случае стандартизированный контроль качества и прослеживаемость становятся невозможными.

Большие мультимодальные модели, однако, дают вероятностные результаты.

Мы провели контролируемый тест: подали одно и то же дефектное изображение с идентичным запросом в GPT-4V десять раз.

  • 7 тиражей с маркировкой "дефектный продукт"
  • 2 пробега отмечены он подозревается в дефекте требует ручной проверки
  • 1 экспедиция утверждала, что не было явных дефектов

Все из одного и того же ввода и запроса.

Подобная случайность является фатальной для контроля качества на заводе. Инспекторы не могут действовать на выходной "70% вероятность дефекта"

Некоторые предлагают установить температуру до нуля для консистенции.Большие модели генерируют результаты с помощью механизмов выборки, и незначительные отклонения сохраняются для краевых случаев даже при температуре = 0.

Плохая 4: хрупкая оперативная инженерия. Незначительные изменения в формулировке меняют суждения.

Производительность мультимодальной модели полностью зависит от быстрого проектирования, которое мы потратили на оптимизацию для повышения точности и стабильности.

Вскоре мы обнаружили, что запросы очень чувствительны к изменениям формулировки.

Три запроса с почти одинаковыми основными запросами дали совершенно разные результаты проверки:

Указание А: ′′Проверьте, есть ли на этом изображении поверхностные дефекты".

Процедура B: "Осторожно изучите поверхность изделия и выявьте царапины, ямы, посторонние вещества и другие дефекты".

Просьба C: "Действуйте как профессиональный инспектор качества. Найдите и классифицируйте любые дефекты внешнего вида продукта на этом изображении".

Что еще хуже, запросы, отрегулированные для продукта А, теряют эффективность при применении к продукту В, требуя полной переработки логики запроса для каждого нового варианта продукта.

Чем это отличается от переподготовки моделей YOLO для новых продуктов?

Обучение YOLO опирается на количественные показатели оценки, чтобы четко сигнализировать, когда модель соответствует стандартам; быстрая настройка полностью зависит от субъективных проб и ошибок,без четкого критерия оптимальной производительности.

Пятая ловушка: галлюцинации - с уверенностью придумывать несуществующие дефекты

Галлюцинации - это хорошо задокументированный недостаток больших языковых и мультимодальных моделей: система уверенно придумывает детали, которых не существует.

В промышленной инспекции это проявляется в виде трех типичных сбоев:

  1. Отметка о дефектах на продуктах, не имеющих дефектов
  2. Ошибочное указание местоположения дефекта (например, обнаружение царапин слева, когда они появляются справа)
  3. Ошибочная классификация типов дефектов (например, маркировка ям как царапин)

Один из испытаний иллюстрирует серьезность: совершенно безупречное изображение продукта вызвало очень подробный сфабрикованный анализ:В правом нижнем углу обнаружена мелкая царапина длиной около 3 мм., рекомендуется оценка функционального воздействия".

При тщательном визуальном рассмотрении, никаких следов или царапин не было в этой области вообще.

Если такие галлюцинации проникают в серийное производство, следуют серьезные последствия:либо дефектные товары пропадают незамеченными (пропущенная проверка) или квалифицированные продукты ошибочно отклоняются (ложный отказ).

Ловушка 6: высокие ресурсные барьеры для частного развертывания на месте

Поскольку облачные API страдают от высокой задержки и чрезмерных затрат, самостоятельное размещение кажется альтернативой.

последние новости компании о Промышленный визуальный контроль: привлекательность мультимодальных больших моделей  2
Как насчет YOLO?

YOLOv8-m работает гладко даже на GTX 1080 с 8 ГБ VRAM.

Он может быть даже развернут на краевом вычислительном оборудовании, таком как модули NVIDIA Jetson с энергопотреблением всего в десятки ватт.

Порог вычислительного ресурса отличается целым порядком величины.

Для большинства заводов установка сервера A100 на производственном этаже нецелесообразна как с точки зрения капитальных затрат, так и с точки зрения ежедневной эксплуатации и обслуживания.

V. Возвращение к первым принципам: Что именно требует промышленная визуальная инспекция?

После того, как мы столкнулись со всеми вышеупомянутыми ловушками, мы сделали шаг назад, чтобы задуматься над фундаментальным вопросом:

Какие основные возможности требуются промышленной визуальной инспекции?

  1. Детерминированный результат

    Идентичные изображения должны давать 100%-ные результаты, что является основой стандартизированного контроля качества и полной прослеживаемости; вероятностные результаты неприемлемы.

  2. Ультранизкая задержка

    Миллисекундный уровень реакции. Время на производственной линии является жестким, и инспекция не может стать узким горлом.

    Время вывода 10 мс и время вывода 1000 мс представляют собой совершенно разные операционные реалии.

  3. Высокая производительность

    Сколько кадров можно обрабатывать в секунду? Сколько деталей можно проверять ежедневно?

    Расходы на вычисления должны оставаться контролируемыми, избегая ежегодных расходов в сотни тысяч долларов США на одну производственную линию.

  4. Совместимость развертывания краев

    Сетевые среды на заводах сложны, многие мастерские не имеют стабильных или доступных интернет-соединений.

    Модели должны работать локально на краевых устройствах, а не полагаться на облачные API.

  5. Интерпретируемые результаты инспекции

    Когда обнаруживается дефект, система должна четко информировать инспекторов о его точном местонахождении и категории.

    В идеале, он должен выводить координаты дефектов, площади и показатели доверия для интеграции системы ниже по течению.

  6. Контролируемые расходы на обслуживание

    Продукция обновляется, а стандарты инспекции регулярно пересматриваются.

    Стоимость адаптации для каждой итерации должна быть управляемой, без полной реконструкции каждый раз.

Сопоставление этих шести основных требований с двумя техническими способами показывает явный контраст:

Серия YOLO отлично отвечает всем шести критериям
  • Детерминизм: 100% согласованные результаты при одинаковом входе
  • Низкая задержка: вывод в 10-30 миллисекунд
  • Высокая пропускная способность: от десятков до более чем сотни QPS на один GPU
  • Развертываемость на краю: полностью совместима с аппаратным обеспечением Jetson и промышленными ПК
  • Интерпретируемые результаты: рамки, категории дефектов и значения доверия
  • Низкие накладные расходы на техническое обслуживание: зрелые цепочки инструментов для дополнительного обучения и передачи знаний
Многомодальные большие модели не соответствуют почти всем требованиям
  • Детерминизм: врожденно вероятностный результат
  • Ограничение задержки: вывод второго масштаба
  • Предел пропускной способности: однообразный графический процессор поддерживает только однозначный QPS
  • Барьер развертывания краев: требует высокопроизводительных графических процессоров класса A100
  • Разрыв в интерпретации: сырые описания естественного языка требуют вторичного анализа
  • Непредсказуемое обслуживание: быстрое проектирование не имеет количественно определяемых стандартов оптимизации

Могут ли мультимодальные модели заменить YOLO?

На нынешнем этапе технической зрелости многомодальные большие модели не подходят в качестве основного решения для промышленной визуальной инспекции.

Ее сильные стороны, включая логику с нулевым выстрелом, глубокое семантическое понимание и сильное обобщение, не приносят практической ценности на производственных линиях; в то же время ее критические недостатки - высокая задержка,Невысокие затраты и неустойчивая производительность являются катастрофическими для промышленного контроля качества.

VI. Не замена, а дополнение

Это не означает, что многомодальные большие модели совершенно бесполезны для промышленной визуальной инспекции.

Ключ заключается в определении их подходящей ниши.

После двух лет полевых испытаний мы обобщили четыре сценария, в которых мультимодальные крупные модели создают ощутимую ценность:

Сценарий 1: Автоматизированная аннотация вспомогательных данных

Аннотация представляет собой крупнейший фактор затрат на традиционные инспекционные проекты.

Задача промышленного зрения обычно требует от тысяч до десятков тысяч аннотированных изображений.расходы на маркировку составляют 30%-50% от общего объема инвестиций в проект.

Многомодальные большие модели обеспечивают возможность предварительной маркировки:

Модель сначала генерирует предварительные маски и коробки с аннотацией из необработанных изображений.

Наши полевые тесты показывают, что этот рабочий процесс повышает эффективность аннотации в 3−5 раз, сокращая среднее время маркировки на изображение с 30 секунд до менее 10 секунд.

Сценарий 2: Возобновление покрытия дефектов длинного хвоста

Поверхность производительности моделей YOLO проста: они могут распознавать только типы дефектов, представленные в наборах данных обучения.

Беспрецедентные редкие дефекты вызовут пропущенное обнаружение.

Хотя подобные аномалии с длинным хвостом встречаются редко, они часто сигнализируют о серьезных ненормальных условиях производства, несущих с собой более высокие эксплуатационные риски.

Большие мультимодальные модели выступают в качестве резервного уровня проверки:

Когда YOLO выводит граничный балл доверия (примерно 0,3 ≈ 0,4).7, серая зона неопределенности), соответствующее изображение отправляется в мультимодальную модель для вторичного суждения.

Сила генерализации больших моделей покрывает эти редкие аномалии.

В рамках этого механизма только 5%-10% всех изображений передаются в мультимодальную модель, что позволяет управлять общими затратами и значительно улучшить охват дефектов длинного хвоста.

Сценарий 3: Семантическое преобразование необработанных данных инспекции

YOLO выдает только структурированные данные: граничные поля, категории дефектов и баллы доверия.

Хотя для промышленных систем этого недостаточно, для инспекторов эти показатели не являются интуитивными, поскольку им нужны ответы на практические вопросы: насколько серьезен дефект?Какие корректирующие меры следует предпринять?

Мультимодальные крупные модели выполняют семантическое создание отчетов:

Ввод: координаты дефектов, маркировки классификации, модель продукта и параметры производственного процесса

Выход: отчет о проверке на естественном языке, например, на левом краю изделия обнаружена царапина длиной 5 мм, вероятно, вызванная отталкиванием плесени; рекомендуется обслуживание плесени".

Эта задача не чувствительна к задержке (отчеты могут генерироваться асинхронно) и экономически эффективна (исполняется только на несоответствующих НГ продуктах с ограниченным объемом).

Сценарий 4: Быстрый холодный старт для небольших экстренных проектов

Клиенты иногда сталкиваются с ограниченными сроками: новые продукты, запланированные на серийное производство на следующей неделе, имеют всего десятки дефектных образцов изображений, недостаточных для полного обучения YOLO.

Традиционный рабочий процесс не может запустить проверку с такими ограниченными данными.

Многомодальные крупные модели служат временным переходным решением:

Возможность нулевого выстрела позволяет немедленно развернуть с приемлемой, но несовершенной точностью, значительно превосходящую полную ручную инспекцию.Данные могут постоянно собираться во время пилотных операций для обучения формальной модели YOLO для долгосрочного использования после накопления достаточного количества образцов..

VII. Гибридная архитектура: наша практическая парадигма развертывания

На основе вышеуказанного анализа мы приняли гибридную двухканальную архитектуру для недавних промышленных проектов:

Главный канал проверки: YOLO
  • Обрабатывает более 95% всех рабочих нагрузок инспекции
  • Развернуто локально на краевом оборудовании с задержкой вывода 1020 мс
  • Выводы структурных граничных ящиков, типов дефектов и баллов доверия
Вспомогательный канал: многомодальная большая модель
  • Обрабатывает только граничные изображения низкой достоверности в серой зоне
  • Вызван асинхронно без нарушения пропускной способности основной линии
  • Функции для обратной проверки дефектов длинного хвоста, создания семантических отчетов и вспомогательной маркировки

Основные принципы проектирования этой гибридной структуры:

  1. YOLO выступает в качестве основной первичной системы; мультимодальные модели служат вспомогательными инструментами
  2. Переход данных вместо серийной обработки: мультимодальные модели остаются вне критического производственного пути и не оказывают влияния на задержку или пропускную способность магистральной линии
  3. Разделение трафика на основе доверия: результаты с высокой степенью доверия передаются непосредственно, в то время как неоднозначные образцы передаются для вторичной мультимодальной проверки.
  4. Предсказуемый контроль затрат: только небольшая часть изображений потребляет ресурсы вычислительной модели мультимодальной модели
VIII. Рамочная система принятия решений по техническому отбору

Ниже приведено краткое дерево решений для команд, выбирающих алгоритмы промышленной визуальной инспекции:

  1. Требование к задержке
    • Необходимый вывод <100 мс → Выберите YOLO
    • Второстепенная задержка приемлема → Многомодальные крупные модели жизнеспособны
  2. Требования к пропускной способности
    • Более 1 кадра в секунду → Выберите YOLO
    • Только сотни изображений обрабатываются ежедневно → Мультимодальные большие модели жизнеспособны
  3. Окружающая среда развертывания
    • Необходимо развертывание в автономном режиме → Выберите YOLO
    • Стабильные выделенные облачные ресурсы → Многомодальные крупные модели жизнеспособны
  4. Доступность данных
    • Тысячи примеров под рукой → Выберите YOLO
    • Только десятки образцов с срочным сроком запуска → Принять мультимодальные модели в качестве временного перехода
  5. Бюджетные ограничения
    • Ежегодный операционный бюджет одной линии ниже 100 000 юаней → Выберите YOLO
    • Обширный финансовый бюджет → Рекомендуется гибридная архитектура

Для подавляющего большинства промышленных сценариев YOLO останется оптимальным выбором.

Многомодальные большие модели подходят только в качестве первичных решений при определенных условиях: терпимость к задержке, низкий спрос на пропускную способность, стабильная поддержка облачных вычислений и крайняя нехватка данных.

Наиболее прагматичным решением в отрасли является гибридная архитектура:

  • YOLO выполняет основные задачи по проверке в режиме реального времени
  • Многомодальные большие модели обеспечивают вспомогательную ценность в аннотации, резервной проверке и автоматизированном написании отчетов
  • Использование сильных сторон обеих технологий при сохранении контроля над затратами
IX. Заключительные замечания

Возвращаясь к первоначальному вопросу: могут ли мультимодальные большие модели заменить YOLO?

После двух лет практических попыток и ошибок, наш вывод ясен:

Это неправильная формулировка вопроса.

Это не соревнование с нулевой суммой "А заменяет В", а вопрос о том, чтобы каждая технология занимала свою уникальную экологическую нишу.

Большие мультимодальные модели обладают внушительными возможностями, но их основные сильные стороны - рассуждения с нулевым выстрелом,глубокое семантическое понимание и широкое обобщение предоставлять ограниченную ценность для основных производственных рабочих процессов инспекции.

Между тем, их неотъемлемые недостатки: высокая задержка, чрезмерные эксплуатационные издержки и нестабильная производительность - это именно те недопустимые проблемы, с которыми промышленное производство не может мириться.

Суть технического отбора заключается не в погоне за новейшими технологиями, а в том, чтобы соответствовать требованиям реального сценария.

Серия YOLO широко используется в промышленной визуальной инспекции в течение многих лет, и ее статус де-факто стандарта хорошо оправдан.

Большие многомодальные модели являются мощными дополнительными инструментами, но они не являются полноценной заменой при текущей технической зрелости.

Возможно, через три или пять лет, ландшафт изменится: скорость выводов резко улучшится, затраты на развертывание резко снизятся, и вопрос детерминизма будет полностью решен.

Только тогда мы сможем вернуться к обсуждению полномасштабной замены.

продукты
новостная информация
Промышленный визуальный контроль: привлекательность мультимодальных больших моделей
2026-06-26
Latest company news about Промышленный визуальный контроль: привлекательность мультимодальных больших моделей
I. Заманчивый вопрос

Вскоре после запуска GPT-4V в начале 2023 года, нам позвонил давний клиент.

Два года назад мы внедрили систему поверхностной инспекции на базе YOLOv5 для их завода,которая с тех пор стабильно работает..

Он задал вызывающий мысль вопрос по телефону:

Я видел, что GPT-4V может интерпретировать все виды изображений и распознавать почти все.Можно ли использовать его непосредственно для проверки качества?

Тогда я не дал прямого ответа.

Честно говоря, мы были одинаково очарованы этой идеей.

Демонстрации многомодальных больших моделей, безусловно, впечатляют.Не требуется обучения или маркировки; он обеспечивает нулевую производительность прямо из коробки.

Если эта способность будет легко применяться на заводах, то вся книга правил промышленной визуальной инспекции будет переписана.

Мы провели почти два года, тестируя разнообразные мультимодальные решения для больших моделей в нескольких проектах.

Наш вывод очевиден: каким бы заманчивым ни казалась технология, ее промышленное применение в реальном мире имеет серьезные ограничения.

Эта статья описывает все ловушки, с которыми мы столкнулись за эти два года.

II. Определить текущий ландшафт: YOLO стал де-факто стандартом

Перед тем, как погрузиться в многомодальные крупные модели, важно определить базовые показатели отрасли:

Доминирующее решение для современной промышленной визуальной инспекции опирается на модели обнаружения объектов и сегментации, представленные серией YOLO.

Начиная с YOLOv3 и заканчивая широко распространенными YOLOv8, YOLOv9 и YOLOv10, семейство YOLO уже много лет применяется на промышленных производственных линиях.обладает полностью зрелым техническим набором.

последние новости компании о Промышленный визуальный контроль: привлекательность мультимодальных больших моделей  0
Почему YOLO стал де-факто стандартом?

Во-первых, сверхбыстрая скорость вывода.

Оснащенный стандартными компьютерными коробками, совмещенными с промышленными камерами, YOLOv8 завершает вывод для одного кадра в течение 10 до 30 миллисекунд, что соответствует тактовому времени большинства производственных линий.

Во-вторых, достаточная точность обнаружения.

При наличии адекватных наборов маркированных данных, серия YOLO достигает исключительной точности для распространенных категорий дефектов, легко достигая MAP более 90%.

В-третьих, зрелая экосистема развертывания.

Готовые цепочки инструментов поддерживают несколько рамок развертывания, включая ONNX, TensorRT и OpenVINO.Полный рабочий процесс от обучения моделей до развертывания на месте был подтвержден бесчисленными промышленными проектами.

В-четвертых, комплексная экосистема с открытым исходным кодом.

Активное сообщество с открытым исходным кодом предоставляет доступные решения для большинства технических препятствий, с большим количеством предварительно подготовленных весов, наборов для увеличения данных и инструментов маркировки, которые легко доступны.

Таким образом, серия YOLO является практически выбором по умолчанию для проектов промышленной визуальной инспекции, запущенных в 2024 году.

Нет необходимости обсуждать вопрос о необходимости внедрения глубокого обучения - этот вопрос был решен десять лет назад.

Теперь возникает новый ключевой вопрос: с появлением мультимодальных больших моделей, остается ли YOLO оптимальным решением?

III. Привлекательность многомодальных больших моделей: многообещающий мираж

В 2023 году произошла взрывная волна выпуска больших моделей.

Модели, включая GPT-4V, Gemini и Claude 3, обеспечивают мощные возможности общего понимания изображений.

последние новости компании о Промышленный визуальный контроль: привлекательность мультимодальных больших моделей  1
Мы провели тесты на этих моделях, и, честно говоря, их демонстрационные показатели действительно впечатляют:
Привлекательность 1: способность стрелять с нуля

Традиционный рабочий процесс: для проверки конкретного типа дефекта сначала необходимо собрать, пометить и обучить изображения этого дефекта.

Многомодальные большие модели: просто опишите свой запрос на естественном языке, например "Проверьте, есть ли царапины на этом изображении", и модель мгновенно вернет результаты.Не требуется обучения или маркировки.

Стоимость холостого запуска падает почти до нуля.

При запуске новых продуктов нет необходимости тратить две недели на сбор данных, маркировку и обучение модели.

Привлечение 2: продвинутое семантическое понимание

Традиционные модели выводят только ограничительные поля и оценки доверия, например, в этом поле существует дефект с доверием 0,87".

Большие мультимодальные модели генерируют описательный естественный язык: в левом верхнем углу изображения появляется царапина размером около 2 см, которая, вероятно, образовалась во время транспортировки.Рекомендуется оптимизировать процесс упаковки.. "

Результаты проверки могут быть непосредственно преобразованы в официальные отчеты о проверке качества.

Привлечение 3: мощная способность к обобщению

Традиционные модели могут распознавать только типы дефектов, обнаруженных во время обучения; они не могут идентифицировать совершенно новые невидимые дефекты.

Теоретически, многомодальные большие модели обрабатывают огромные изображения из Интернета, что позволяет им потенциально распознавать все виды редких и нерегулярных дефектов.

Покрытие дефектов длинного хвоста и аномальных случаев краев резко улучшилось.

Привлечение 4: Интерактивная логика инспекции

Традиционные решения включают в модель фиксированные правила проверки.

Многомодальные большие модели поддерживают динамическую корректировку стандартов с помощью запросов. Например, вы можете установить порог, когда ′′грабежи свыше 1 см считаются NG" в один день и переключить его на ′′0.5 см" следующий без изменения базовой модели.

Это означает, что стандарты наладки станут чрезвычайно гибкими.

Читая все эти преимущества, вы также можете испытывать соблазн, как и мы в то время.только чтобы потом столкнуться с целым рядом дорогостоящих ловушек..

IV. Шесть дорогостоящих ловушек, с которыми приходится сталкиваться при практическом применении
Ловушка 1: чрезмерная задержка вывода не подходит для производственных линий

Наш пилотный проект был сосредоточен на проверке внешнего вида корпусов мобильных телефонов.

Производственная линия обрабатывает одну заготовку каждые 3 секунды, что означает, что общая задержка проверки должна оставаться ниже 2 секунд, чтобы зарезервировать 1 секунду для роботизированной сортировки.

Мы протестировали рабочий процесс API GPT-4V:

  1. Загрузить изображение и ввести запрос
  2. Подождите ответа сервера
  3. Получить результаты проверки

Средняя задержка достигла 4 ‰ 6 секунд и могла превышать 10 секунд на фоне колебаний сети ≈ слишком медленно для сборочной линии.

Вместо этого вы могли бы предложить самостоятельные мультимодальные модели с открытым исходным кодом, такие как LLaVA и Qwen-VL. Мы также их протестировали.Запуск LLaVA-13B на графическом процессоре A100 дает задержку вывода одного изображения примерно 800 мс к 1.2 секунды.

Хотя он быстрее облачных API, он остается в десятки раз медленнее YOLO.

Плохая 2: стремительно растущие затраты на пропускную способность и вычислительные системы

Даже если мы допустим задержку ради аргументов, расчет затрат расскажет грубую историю.

Сколько изображений обрабатывает одна производственная линия в день?

Предполагая, что каждые 3 секунды и 20 часов ежедневной работы производится одна деталь, одна линия генерирует около 24 000 изображений в день.

Для API GPT-4V стоимость единицы варьировалась от $0,01 до $0,03 за изображение в зависимости от разрешения и потребления токенов:

  • Ежедневные расходы на одну строку: 240-720 долларов США
  • Ежемесячная стоимость за строку: $7200$21600
  • Ежегодные расходы на линию: $86,400$259,200

Это всего лишь одна линия, в то время как наш клиент управлял 12 производственными линиями - недоступные затраты для производителей.

А как насчет самостоятельно размещаемых моделей с открытым исходным кодом?

Одинокий графический процессор A100 обеспечивает приблизительно 1 ‰ 2 QPS (запросы в секунду).

Однако, учитывая серверы, пространство IDC и техническое обслуживание, годовая эксплуатационная стоимость развертывания A100 составляет сотни тысяч юаней.

В отличие от этого, для развертывания YOLO требуется только краевая вычислительная коробка стоимостью в несколько тысяч юаней для поддержки одной полной производственной линии.

Разрыв в стоимости охватывает два порядка величины.

Ловушка 3: неустойчивые, вероятностные результаты несовместимые результаты для идентичных изображений

Это оказалось самым разочаровывающим препятствием.

Промышленная инспекция требует абсолютного детерминизма: одинаковые изображения должны каждый раз давать одинаковые результаты инспекции.в противном случае стандартизированный контроль качества и прослеживаемость становятся невозможными.

Большие мультимодальные модели, однако, дают вероятностные результаты.

Мы провели контролируемый тест: подали одно и то же дефектное изображение с идентичным запросом в GPT-4V десять раз.

  • 7 тиражей с маркировкой "дефектный продукт"
  • 2 пробега отмечены он подозревается в дефекте требует ручной проверки
  • 1 экспедиция утверждала, что не было явных дефектов

Все из одного и того же ввода и запроса.

Подобная случайность является фатальной для контроля качества на заводе. Инспекторы не могут действовать на выходной "70% вероятность дефекта"

Некоторые предлагают установить температуру до нуля для консистенции.Большие модели генерируют результаты с помощью механизмов выборки, и незначительные отклонения сохраняются для краевых случаев даже при температуре = 0.

Плохая 4: хрупкая оперативная инженерия. Незначительные изменения в формулировке меняют суждения.

Производительность мультимодальной модели полностью зависит от быстрого проектирования, которое мы потратили на оптимизацию для повышения точности и стабильности.

Вскоре мы обнаружили, что запросы очень чувствительны к изменениям формулировки.

Три запроса с почти одинаковыми основными запросами дали совершенно разные результаты проверки:

Указание А: ′′Проверьте, есть ли на этом изображении поверхностные дефекты".

Процедура B: "Осторожно изучите поверхность изделия и выявьте царапины, ямы, посторонние вещества и другие дефекты".

Просьба C: "Действуйте как профессиональный инспектор качества. Найдите и классифицируйте любые дефекты внешнего вида продукта на этом изображении".

Что еще хуже, запросы, отрегулированные для продукта А, теряют эффективность при применении к продукту В, требуя полной переработки логики запроса для каждого нового варианта продукта.

Чем это отличается от переподготовки моделей YOLO для новых продуктов?

Обучение YOLO опирается на количественные показатели оценки, чтобы четко сигнализировать, когда модель соответствует стандартам; быстрая настройка полностью зависит от субъективных проб и ошибок,без четкого критерия оптимальной производительности.

Пятая ловушка: галлюцинации - с уверенностью придумывать несуществующие дефекты

Галлюцинации - это хорошо задокументированный недостаток больших языковых и мультимодальных моделей: система уверенно придумывает детали, которых не существует.

В промышленной инспекции это проявляется в виде трех типичных сбоев:

  1. Отметка о дефектах на продуктах, не имеющих дефектов
  2. Ошибочное указание местоположения дефекта (например, обнаружение царапин слева, когда они появляются справа)
  3. Ошибочная классификация типов дефектов (например, маркировка ям как царапин)

Один из испытаний иллюстрирует серьезность: совершенно безупречное изображение продукта вызвало очень подробный сфабрикованный анализ:В правом нижнем углу обнаружена мелкая царапина длиной около 3 мм., рекомендуется оценка функционального воздействия".

При тщательном визуальном рассмотрении, никаких следов или царапин не было в этой области вообще.

Если такие галлюцинации проникают в серийное производство, следуют серьезные последствия:либо дефектные товары пропадают незамеченными (пропущенная проверка) или квалифицированные продукты ошибочно отклоняются (ложный отказ).

Ловушка 6: высокие ресурсные барьеры для частного развертывания на месте

Поскольку облачные API страдают от высокой задержки и чрезмерных затрат, самостоятельное размещение кажется альтернативой.

последние новости компании о Промышленный визуальный контроль: привлекательность мультимодальных больших моделей  2
Как насчет YOLO?

YOLOv8-m работает гладко даже на GTX 1080 с 8 ГБ VRAM.

Он может быть даже развернут на краевом вычислительном оборудовании, таком как модули NVIDIA Jetson с энергопотреблением всего в десятки ватт.

Порог вычислительного ресурса отличается целым порядком величины.

Для большинства заводов установка сервера A100 на производственном этаже нецелесообразна как с точки зрения капитальных затрат, так и с точки зрения ежедневной эксплуатации и обслуживания.

V. Возвращение к первым принципам: Что именно требует промышленная визуальная инспекция?

После того, как мы столкнулись со всеми вышеупомянутыми ловушками, мы сделали шаг назад, чтобы задуматься над фундаментальным вопросом:

Какие основные возможности требуются промышленной визуальной инспекции?

  1. Детерминированный результат

    Идентичные изображения должны давать 100%-ные результаты, что является основой стандартизированного контроля качества и полной прослеживаемости; вероятностные результаты неприемлемы.

  2. Ультранизкая задержка

    Миллисекундный уровень реакции. Время на производственной линии является жестким, и инспекция не может стать узким горлом.

    Время вывода 10 мс и время вывода 1000 мс представляют собой совершенно разные операционные реалии.

  3. Высокая производительность

    Сколько кадров можно обрабатывать в секунду? Сколько деталей можно проверять ежедневно?

    Расходы на вычисления должны оставаться контролируемыми, избегая ежегодных расходов в сотни тысяч долларов США на одну производственную линию.

  4. Совместимость развертывания краев

    Сетевые среды на заводах сложны, многие мастерские не имеют стабильных или доступных интернет-соединений.

    Модели должны работать локально на краевых устройствах, а не полагаться на облачные API.

  5. Интерпретируемые результаты инспекции

    Когда обнаруживается дефект, система должна четко информировать инспекторов о его точном местонахождении и категории.

    В идеале, он должен выводить координаты дефектов, площади и показатели доверия для интеграции системы ниже по течению.

  6. Контролируемые расходы на обслуживание

    Продукция обновляется, а стандарты инспекции регулярно пересматриваются.

    Стоимость адаптации для каждой итерации должна быть управляемой, без полной реконструкции каждый раз.

Сопоставление этих шести основных требований с двумя техническими способами показывает явный контраст:

Серия YOLO отлично отвечает всем шести критериям
  • Детерминизм: 100% согласованные результаты при одинаковом входе
  • Низкая задержка: вывод в 10-30 миллисекунд
  • Высокая пропускная способность: от десятков до более чем сотни QPS на один GPU
  • Развертываемость на краю: полностью совместима с аппаратным обеспечением Jetson и промышленными ПК
  • Интерпретируемые результаты: рамки, категории дефектов и значения доверия
  • Низкие накладные расходы на техническое обслуживание: зрелые цепочки инструментов для дополнительного обучения и передачи знаний
Многомодальные большие модели не соответствуют почти всем требованиям
  • Детерминизм: врожденно вероятностный результат
  • Ограничение задержки: вывод второго масштаба
  • Предел пропускной способности: однообразный графический процессор поддерживает только однозначный QPS
  • Барьер развертывания краев: требует высокопроизводительных графических процессоров класса A100
  • Разрыв в интерпретации: сырые описания естественного языка требуют вторичного анализа
  • Непредсказуемое обслуживание: быстрое проектирование не имеет количественно определяемых стандартов оптимизации

Могут ли мультимодальные модели заменить YOLO?

На нынешнем этапе технической зрелости многомодальные большие модели не подходят в качестве основного решения для промышленной визуальной инспекции.

Ее сильные стороны, включая логику с нулевым выстрелом, глубокое семантическое понимание и сильное обобщение, не приносят практической ценности на производственных линиях; в то же время ее критические недостатки - высокая задержка,Невысокие затраты и неустойчивая производительность являются катастрофическими для промышленного контроля качества.

VI. Не замена, а дополнение

Это не означает, что многомодальные большие модели совершенно бесполезны для промышленной визуальной инспекции.

Ключ заключается в определении их подходящей ниши.

После двух лет полевых испытаний мы обобщили четыре сценария, в которых мультимодальные крупные модели создают ощутимую ценность:

Сценарий 1: Автоматизированная аннотация вспомогательных данных

Аннотация представляет собой крупнейший фактор затрат на традиционные инспекционные проекты.

Задача промышленного зрения обычно требует от тысяч до десятков тысяч аннотированных изображений.расходы на маркировку составляют 30%-50% от общего объема инвестиций в проект.

Многомодальные большие модели обеспечивают возможность предварительной маркировки:

Модель сначала генерирует предварительные маски и коробки с аннотацией из необработанных изображений.

Наши полевые тесты показывают, что этот рабочий процесс повышает эффективность аннотации в 3−5 раз, сокращая среднее время маркировки на изображение с 30 секунд до менее 10 секунд.

Сценарий 2: Возобновление покрытия дефектов длинного хвоста

Поверхность производительности моделей YOLO проста: они могут распознавать только типы дефектов, представленные в наборах данных обучения.

Беспрецедентные редкие дефекты вызовут пропущенное обнаружение.

Хотя подобные аномалии с длинным хвостом встречаются редко, они часто сигнализируют о серьезных ненормальных условиях производства, несущих с собой более высокие эксплуатационные риски.

Большие мультимодальные модели выступают в качестве резервного уровня проверки:

Когда YOLO выводит граничный балл доверия (примерно 0,3 ≈ 0,4).7, серая зона неопределенности), соответствующее изображение отправляется в мультимодальную модель для вторичного суждения.

Сила генерализации больших моделей покрывает эти редкие аномалии.

В рамках этого механизма только 5%-10% всех изображений передаются в мультимодальную модель, что позволяет управлять общими затратами и значительно улучшить охват дефектов длинного хвоста.

Сценарий 3: Семантическое преобразование необработанных данных инспекции

YOLO выдает только структурированные данные: граничные поля, категории дефектов и баллы доверия.

Хотя для промышленных систем этого недостаточно, для инспекторов эти показатели не являются интуитивными, поскольку им нужны ответы на практические вопросы: насколько серьезен дефект?Какие корректирующие меры следует предпринять?

Мультимодальные крупные модели выполняют семантическое создание отчетов:

Ввод: координаты дефектов, маркировки классификации, модель продукта и параметры производственного процесса

Выход: отчет о проверке на естественном языке, например, на левом краю изделия обнаружена царапина длиной 5 мм, вероятно, вызванная отталкиванием плесени; рекомендуется обслуживание плесени".

Эта задача не чувствительна к задержке (отчеты могут генерироваться асинхронно) и экономически эффективна (исполняется только на несоответствующих НГ продуктах с ограниченным объемом).

Сценарий 4: Быстрый холодный старт для небольших экстренных проектов

Клиенты иногда сталкиваются с ограниченными сроками: новые продукты, запланированные на серийное производство на следующей неделе, имеют всего десятки дефектных образцов изображений, недостаточных для полного обучения YOLO.

Традиционный рабочий процесс не может запустить проверку с такими ограниченными данными.

Многомодальные крупные модели служат временным переходным решением:

Возможность нулевого выстрела позволяет немедленно развернуть с приемлемой, но несовершенной точностью, значительно превосходящую полную ручную инспекцию.Данные могут постоянно собираться во время пилотных операций для обучения формальной модели YOLO для долгосрочного использования после накопления достаточного количества образцов..

VII. Гибридная архитектура: наша практическая парадигма развертывания

На основе вышеуказанного анализа мы приняли гибридную двухканальную архитектуру для недавних промышленных проектов:

Главный канал проверки: YOLO
  • Обрабатывает более 95% всех рабочих нагрузок инспекции
  • Развернуто локально на краевом оборудовании с задержкой вывода 1020 мс
  • Выводы структурных граничных ящиков, типов дефектов и баллов доверия
Вспомогательный канал: многомодальная большая модель
  • Обрабатывает только граничные изображения низкой достоверности в серой зоне
  • Вызван асинхронно без нарушения пропускной способности основной линии
  • Функции для обратной проверки дефектов длинного хвоста, создания семантических отчетов и вспомогательной маркировки

Основные принципы проектирования этой гибридной структуры:

  1. YOLO выступает в качестве основной первичной системы; мультимодальные модели служат вспомогательными инструментами
  2. Переход данных вместо серийной обработки: мультимодальные модели остаются вне критического производственного пути и не оказывают влияния на задержку или пропускную способность магистральной линии
  3. Разделение трафика на основе доверия: результаты с высокой степенью доверия передаются непосредственно, в то время как неоднозначные образцы передаются для вторичной мультимодальной проверки.
  4. Предсказуемый контроль затрат: только небольшая часть изображений потребляет ресурсы вычислительной модели мультимодальной модели
VIII. Рамочная система принятия решений по техническому отбору

Ниже приведено краткое дерево решений для команд, выбирающих алгоритмы промышленной визуальной инспекции:

  1. Требование к задержке
    • Необходимый вывод <100 мс → Выберите YOLO
    • Второстепенная задержка приемлема → Многомодальные крупные модели жизнеспособны
  2. Требования к пропускной способности
    • Более 1 кадра в секунду → Выберите YOLO
    • Только сотни изображений обрабатываются ежедневно → Мультимодальные большие модели жизнеспособны
  3. Окружающая среда развертывания
    • Необходимо развертывание в автономном режиме → Выберите YOLO
    • Стабильные выделенные облачные ресурсы → Многомодальные крупные модели жизнеспособны
  4. Доступность данных
    • Тысячи примеров под рукой → Выберите YOLO
    • Только десятки образцов с срочным сроком запуска → Принять мультимодальные модели в качестве временного перехода
  5. Бюджетные ограничения
    • Ежегодный операционный бюджет одной линии ниже 100 000 юаней → Выберите YOLO
    • Обширный финансовый бюджет → Рекомендуется гибридная архитектура

Для подавляющего большинства промышленных сценариев YOLO останется оптимальным выбором.

Многомодальные большие модели подходят только в качестве первичных решений при определенных условиях: терпимость к задержке, низкий спрос на пропускную способность, стабильная поддержка облачных вычислений и крайняя нехватка данных.

Наиболее прагматичным решением в отрасли является гибридная архитектура:

  • YOLO выполняет основные задачи по проверке в режиме реального времени
  • Многомодальные большие модели обеспечивают вспомогательную ценность в аннотации, резервной проверке и автоматизированном написании отчетов
  • Использование сильных сторон обеих технологий при сохранении контроля над затратами
IX. Заключительные замечания

Возвращаясь к первоначальному вопросу: могут ли мультимодальные большие модели заменить YOLO?

После двух лет практических попыток и ошибок, наш вывод ясен:

Это неправильная формулировка вопроса.

Это не соревнование с нулевой суммой "А заменяет В", а вопрос о том, чтобы каждая технология занимала свою уникальную экологическую нишу.

Большие мультимодальные модели обладают внушительными возможностями, но их основные сильные стороны - рассуждения с нулевым выстрелом,глубокое семантическое понимание и широкое обобщение предоставлять ограниченную ценность для основных производственных рабочих процессов инспекции.

Между тем, их неотъемлемые недостатки: высокая задержка, чрезмерные эксплуатационные издержки и нестабильная производительность - это именно те недопустимые проблемы, с которыми промышленное производство не может мириться.

Суть технического отбора заключается не в погоне за новейшими технологиями, а в том, чтобы соответствовать требованиям реального сценария.

Серия YOLO широко используется в промышленной визуальной инспекции в течение многих лет, и ее статус де-факто стандарта хорошо оправдан.

Большие многомодальные модели являются мощными дополнительными инструментами, но они не являются полноценной заменой при текущей технической зрелости.

Возможно, через три или пять лет, ландшафт изменится: скорость выводов резко улучшится, затраты на развертывание резко снизятся, и вопрос детерминизма будет полностью решен.

Только тогда мы сможем вернуться к обсуждению полномасштабной замены.

Карта сайта |  Политика уединения | Качество Китая хорошее Сенсор лазера больного Поставщик. © авторского права 2025-2026 Xiamen ZhiCheng Automation Technology Co., Ltd . Все права защищены.