Вскоре после запуска GPT-4V в начале 2023 года, нам позвонил давний клиент.
Два года назад мы внедрили систему поверхностной инспекции на базе YOLOv5 для их завода,которая с тех пор стабильно работает..
Он задал вызывающий мысль вопрос по телефону:
Я видел, что GPT-4V может интерпретировать все виды изображений и распознавать почти все.Можно ли использовать его непосредственно для проверки качества?
Тогда я не дал прямого ответа.
Честно говоря, мы были одинаково очарованы этой идеей.
Демонстрации многомодальных больших моделей, безусловно, впечатляют.Не требуется обучения или маркировки; он обеспечивает нулевую производительность прямо из коробки.
Если эта способность будет легко применяться на заводах, то вся книга правил промышленной визуальной инспекции будет переписана.
Мы провели почти два года, тестируя разнообразные мультимодальные решения для больших моделей в нескольких проектах.
Наш вывод очевиден: каким бы заманчивым ни казалась технология, ее промышленное применение в реальном мире имеет серьезные ограничения.
Эта статья описывает все ловушки, с которыми мы столкнулись за эти два года.
Перед тем, как погрузиться в многомодальные крупные модели, важно определить базовые показатели отрасли:
Доминирующее решение для современной промышленной визуальной инспекции опирается на модели обнаружения объектов и сегментации, представленные серией YOLO.
Начиная с YOLOv3 и заканчивая широко распространенными YOLOv8, YOLOv9 и YOLOv10, семейство YOLO уже много лет применяется на промышленных производственных линиях.обладает полностью зрелым техническим набором.
Во-первых, сверхбыстрая скорость вывода.
Оснащенный стандартными компьютерными коробками, совмещенными с промышленными камерами, YOLOv8 завершает вывод для одного кадра в течение 10 до 30 миллисекунд, что соответствует тактовому времени большинства производственных линий.
Во-вторых, достаточная точность обнаружения.
При наличии адекватных наборов маркированных данных, серия YOLO достигает исключительной точности для распространенных категорий дефектов, легко достигая MAP более 90%.
В-третьих, зрелая экосистема развертывания.
Готовые цепочки инструментов поддерживают несколько рамок развертывания, включая ONNX, TensorRT и OpenVINO.Полный рабочий процесс от обучения моделей до развертывания на месте был подтвержден бесчисленными промышленными проектами.
В-четвертых, комплексная экосистема с открытым исходным кодом.
Активное сообщество с открытым исходным кодом предоставляет доступные решения для большинства технических препятствий, с большим количеством предварительно подготовленных весов, наборов для увеличения данных и инструментов маркировки, которые легко доступны.
Таким образом, серия YOLO является практически выбором по умолчанию для проектов промышленной визуальной инспекции, запущенных в 2024 году.
Нет необходимости обсуждать вопрос о необходимости внедрения глубокого обучения - этот вопрос был решен десять лет назад.
Теперь возникает новый ключевой вопрос: с появлением мультимодальных больших моделей, остается ли YOLO оптимальным решением?
В 2023 году произошла взрывная волна выпуска больших моделей.
Модели, включая GPT-4V, Gemini и Claude 3, обеспечивают мощные возможности общего понимания изображений.
Традиционный рабочий процесс: для проверки конкретного типа дефекта сначала необходимо собрать, пометить и обучить изображения этого дефекта.
Многомодальные большие модели: просто опишите свой запрос на естественном языке, например "Проверьте, есть ли царапины на этом изображении", и модель мгновенно вернет результаты.Не требуется обучения или маркировки.
Стоимость холостого запуска падает почти до нуля.
При запуске новых продуктов нет необходимости тратить две недели на сбор данных, маркировку и обучение модели.
Традиционные модели выводят только ограничительные поля и оценки доверия, например, в этом поле существует дефект с доверием 0,87".
Большие мультимодальные модели генерируют описательный естественный язык: в левом верхнем углу изображения появляется царапина размером около 2 см, которая, вероятно, образовалась во время транспортировки.Рекомендуется оптимизировать процесс упаковки.. "
Результаты проверки могут быть непосредственно преобразованы в официальные отчеты о проверке качества.
Традиционные модели могут распознавать только типы дефектов, обнаруженных во время обучения; они не могут идентифицировать совершенно новые невидимые дефекты.
Теоретически, многомодальные большие модели обрабатывают огромные изображения из Интернета, что позволяет им потенциально распознавать все виды редких и нерегулярных дефектов.
Покрытие дефектов длинного хвоста и аномальных случаев краев резко улучшилось.
Традиционные решения включают в модель фиксированные правила проверки.
Многомодальные большие модели поддерживают динамическую корректировку стандартов с помощью запросов. Например, вы можете установить порог, когда ′′грабежи свыше 1 см считаются NG" в один день и переключить его на ′′0.5 см" следующий без изменения базовой модели.
Это означает, что стандарты наладки станут чрезвычайно гибкими.
Читая все эти преимущества, вы также можете испытывать соблазн, как и мы в то время.только чтобы потом столкнуться с целым рядом дорогостоящих ловушек..
Наш пилотный проект был сосредоточен на проверке внешнего вида корпусов мобильных телефонов.
Производственная линия обрабатывает одну заготовку каждые 3 секунды, что означает, что общая задержка проверки должна оставаться ниже 2 секунд, чтобы зарезервировать 1 секунду для роботизированной сортировки.
Мы протестировали рабочий процесс API GPT-4V:
Средняя задержка достигла 4 ‰ 6 секунд и могла превышать 10 секунд на фоне колебаний сети ≈ слишком медленно для сборочной линии.
Вместо этого вы могли бы предложить самостоятельные мультимодальные модели с открытым исходным кодом, такие как LLaVA и Qwen-VL. Мы также их протестировали.Запуск LLaVA-13B на графическом процессоре A100 дает задержку вывода одного изображения примерно 800 мс к 1.2 секунды.
Хотя он быстрее облачных API, он остается в десятки раз медленнее YOLO.
Даже если мы допустим задержку ради аргументов, расчет затрат расскажет грубую историю.
Сколько изображений обрабатывает одна производственная линия в день?
Предполагая, что каждые 3 секунды и 20 часов ежедневной работы производится одна деталь, одна линия генерирует около 24 000 изображений в день.
Для API GPT-4V стоимость единицы варьировалась от $0,01 до $0,03 за изображение в зависимости от разрешения и потребления токенов:
Это всего лишь одна линия, в то время как наш клиент управлял 12 производственными линиями - недоступные затраты для производителей.
А как насчет самостоятельно размещаемых моделей с открытым исходным кодом?
Одинокий графический процессор A100 обеспечивает приблизительно 1 ‰ 2 QPS (запросы в секунду).
Однако, учитывая серверы, пространство IDC и техническое обслуживание, годовая эксплуатационная стоимость развертывания A100 составляет сотни тысяч юаней.
В отличие от этого, для развертывания YOLO требуется только краевая вычислительная коробка стоимостью в несколько тысяч юаней для поддержки одной полной производственной линии.
Разрыв в стоимости охватывает два порядка величины.
Это оказалось самым разочаровывающим препятствием.
Промышленная инспекция требует абсолютного детерминизма: одинаковые изображения должны каждый раз давать одинаковые результаты инспекции.в противном случае стандартизированный контроль качества и прослеживаемость становятся невозможными.
Большие мультимодальные модели, однако, дают вероятностные результаты.
Мы провели контролируемый тест: подали одно и то же дефектное изображение с идентичным запросом в GPT-4V десять раз.
Все из одного и того же ввода и запроса.
Подобная случайность является фатальной для контроля качества на заводе. Инспекторы не могут действовать на выходной "70% вероятность дефекта"
Некоторые предлагают установить температуру до нуля для консистенции.Большие модели генерируют результаты с помощью механизмов выборки, и незначительные отклонения сохраняются для краевых случаев даже при температуре = 0.
Производительность мультимодальной модели полностью зависит от быстрого проектирования, которое мы потратили на оптимизацию для повышения точности и стабильности.
Вскоре мы обнаружили, что запросы очень чувствительны к изменениям формулировки.
Три запроса с почти одинаковыми основными запросами дали совершенно разные результаты проверки:
Указание А: ′′Проверьте, есть ли на этом изображении поверхностные дефекты".
Процедура B: "Осторожно изучите поверхность изделия и выявьте царапины, ямы, посторонние вещества и другие дефекты".
Просьба C: "Действуйте как профессиональный инспектор качества. Найдите и классифицируйте любые дефекты внешнего вида продукта на этом изображении".
Что еще хуже, запросы, отрегулированные для продукта А, теряют эффективность при применении к продукту В, требуя полной переработки логики запроса для каждого нового варианта продукта.
Чем это отличается от переподготовки моделей YOLO для новых продуктов?
Обучение YOLO опирается на количественные показатели оценки, чтобы четко сигнализировать, когда модель соответствует стандартам; быстрая настройка полностью зависит от субъективных проб и ошибок,без четкого критерия оптимальной производительности.
Галлюцинации - это хорошо задокументированный недостаток больших языковых и мультимодальных моделей: система уверенно придумывает детали, которых не существует.
В промышленной инспекции это проявляется в виде трех типичных сбоев:
Один из испытаний иллюстрирует серьезность: совершенно безупречное изображение продукта вызвало очень подробный сфабрикованный анализ:В правом нижнем углу обнаружена мелкая царапина длиной около 3 мм., рекомендуется оценка функционального воздействия".
При тщательном визуальном рассмотрении, никаких следов или царапин не было в этой области вообще.
Если такие галлюцинации проникают в серийное производство, следуют серьезные последствия:либо дефектные товары пропадают незамеченными (пропущенная проверка) или квалифицированные продукты ошибочно отклоняются (ложный отказ).
Поскольку облачные API страдают от высокой задержки и чрезмерных затрат, самостоятельное размещение кажется альтернативой.
YOLOv8-m работает гладко даже на GTX 1080 с 8 ГБ VRAM.
Он может быть даже развернут на краевом вычислительном оборудовании, таком как модули NVIDIA Jetson с энергопотреблением всего в десятки ватт.
Порог вычислительного ресурса отличается целым порядком величины.
Для большинства заводов установка сервера A100 на производственном этаже нецелесообразна как с точки зрения капитальных затрат, так и с точки зрения ежедневной эксплуатации и обслуживания.
После того, как мы столкнулись со всеми вышеупомянутыми ловушками, мы сделали шаг назад, чтобы задуматься над фундаментальным вопросом:
Какие основные возможности требуются промышленной визуальной инспекции?
Идентичные изображения должны давать 100%-ные результаты, что является основой стандартизированного контроля качества и полной прослеживаемости; вероятностные результаты неприемлемы.
Миллисекундный уровень реакции. Время на производственной линии является жестким, и инспекция не может стать узким горлом.
Время вывода 10 мс и время вывода 1000 мс представляют собой совершенно разные операционные реалии.
Сколько кадров можно обрабатывать в секунду? Сколько деталей можно проверять ежедневно?
Расходы на вычисления должны оставаться контролируемыми, избегая ежегодных расходов в сотни тысяч долларов США на одну производственную линию.
Сетевые среды на заводах сложны, многие мастерские не имеют стабильных или доступных интернет-соединений.
Модели должны работать локально на краевых устройствах, а не полагаться на облачные API.
Когда обнаруживается дефект, система должна четко информировать инспекторов о его точном местонахождении и категории.
В идеале, он должен выводить координаты дефектов, площади и показатели доверия для интеграции системы ниже по течению.
Продукция обновляется, а стандарты инспекции регулярно пересматриваются.
Стоимость адаптации для каждой итерации должна быть управляемой, без полной реконструкции каждый раз.
Сопоставление этих шести основных требований с двумя техническими способами показывает явный контраст:
Могут ли мультимодальные модели заменить YOLO?
На нынешнем этапе технической зрелости многомодальные большие модели не подходят в качестве основного решения для промышленной визуальной инспекции.
Ее сильные стороны, включая логику с нулевым выстрелом, глубокое семантическое понимание и сильное обобщение, не приносят практической ценности на производственных линиях; в то же время ее критические недостатки - высокая задержка,Невысокие затраты и неустойчивая производительность являются катастрофическими для промышленного контроля качества.
Это не означает, что многомодальные большие модели совершенно бесполезны для промышленной визуальной инспекции.
Ключ заключается в определении их подходящей ниши.
После двух лет полевых испытаний мы обобщили четыре сценария, в которых мультимодальные крупные модели создают ощутимую ценность:
Аннотация представляет собой крупнейший фактор затрат на традиционные инспекционные проекты.
Задача промышленного зрения обычно требует от тысяч до десятков тысяч аннотированных изображений.расходы на маркировку составляют 30%-50% от общего объема инвестиций в проект.
Многомодальные большие модели обеспечивают возможность предварительной маркировки:
Модель сначала генерирует предварительные маски и коробки с аннотацией из необработанных изображений.
Наши полевые тесты показывают, что этот рабочий процесс повышает эффективность аннотации в 3−5 раз, сокращая среднее время маркировки на изображение с 30 секунд до менее 10 секунд.
Поверхность производительности моделей YOLO проста: они могут распознавать только типы дефектов, представленные в наборах данных обучения.
Беспрецедентные редкие дефекты вызовут пропущенное обнаружение.
Хотя подобные аномалии с длинным хвостом встречаются редко, они часто сигнализируют о серьезных ненормальных условиях производства, несущих с собой более высокие эксплуатационные риски.
Большие мультимодальные модели выступают в качестве резервного уровня проверки:
Когда YOLO выводит граничный балл доверия (примерно 0,3 ≈ 0,4).7, серая зона неопределенности), соответствующее изображение отправляется в мультимодальную модель для вторичного суждения.
Сила генерализации больших моделей покрывает эти редкие аномалии.
В рамках этого механизма только 5%-10% всех изображений передаются в мультимодальную модель, что позволяет управлять общими затратами и значительно улучшить охват дефектов длинного хвоста.
YOLO выдает только структурированные данные: граничные поля, категории дефектов и баллы доверия.
Хотя для промышленных систем этого недостаточно, для инспекторов эти показатели не являются интуитивными, поскольку им нужны ответы на практические вопросы: насколько серьезен дефект?Какие корректирующие меры следует предпринять?
Мультимодальные крупные модели выполняют семантическое создание отчетов:
Ввод: координаты дефектов, маркировки классификации, модель продукта и параметры производственного процесса
Выход: отчет о проверке на естественном языке, например, на левом краю изделия обнаружена царапина длиной 5 мм, вероятно, вызванная отталкиванием плесени; рекомендуется обслуживание плесени".
Эта задача не чувствительна к задержке (отчеты могут генерироваться асинхронно) и экономически эффективна (исполняется только на несоответствующих НГ продуктах с ограниченным объемом).
Клиенты иногда сталкиваются с ограниченными сроками: новые продукты, запланированные на серийное производство на следующей неделе, имеют всего десятки дефектных образцов изображений, недостаточных для полного обучения YOLO.
Традиционный рабочий процесс не может запустить проверку с такими ограниченными данными.
Многомодальные крупные модели служат временным переходным решением:
Возможность нулевого выстрела позволяет немедленно развернуть с приемлемой, но несовершенной точностью, значительно превосходящую полную ручную инспекцию.Данные могут постоянно собираться во время пилотных операций для обучения формальной модели YOLO для долгосрочного использования после накопления достаточного количества образцов..
На основе вышеуказанного анализа мы приняли гибридную двухканальную архитектуру для недавних промышленных проектов:
Основные принципы проектирования этой гибридной структуры:
Ниже приведено краткое дерево решений для команд, выбирающих алгоритмы промышленной визуальной инспекции:
Для подавляющего большинства промышленных сценариев YOLO останется оптимальным выбором.
Многомодальные большие модели подходят только в качестве первичных решений при определенных условиях: терпимость к задержке, низкий спрос на пропускную способность, стабильная поддержка облачных вычислений и крайняя нехватка данных.
Наиболее прагматичным решением в отрасли является гибридная архитектура:
Возвращаясь к первоначальному вопросу: могут ли мультимодальные большие модели заменить YOLO?
После двух лет практических попыток и ошибок, наш вывод ясен:
Это неправильная формулировка вопроса.
Это не соревнование с нулевой суммой "А заменяет В", а вопрос о том, чтобы каждая технология занимала свою уникальную экологическую нишу.
Большие мультимодальные модели обладают внушительными возможностями, но их основные сильные стороны - рассуждения с нулевым выстрелом,глубокое семантическое понимание и широкое обобщение предоставлять ограниченную ценность для основных производственных рабочих процессов инспекции.
Между тем, их неотъемлемые недостатки: высокая задержка, чрезмерные эксплуатационные издержки и нестабильная производительность - это именно те недопустимые проблемы, с которыми промышленное производство не может мириться.
Суть технического отбора заключается не в погоне за новейшими технологиями, а в том, чтобы соответствовать требованиям реального сценария.
Серия YOLO широко используется в промышленной визуальной инспекции в течение многих лет, и ее статус де-факто стандарта хорошо оправдан.
Большие многомодальные модели являются мощными дополнительными инструментами, но они не являются полноценной заменой при текущей технической зрелости.
Возможно, через три или пять лет, ландшафт изменится: скорость выводов резко улучшится, затраты на развертывание резко снизятся, и вопрос детерминизма будет полностью решен.
Только тогда мы сможем вернуться к обсуждению полномасштабной замены.
Вскоре после запуска GPT-4V в начале 2023 года, нам позвонил давний клиент.
Два года назад мы внедрили систему поверхностной инспекции на базе YOLOv5 для их завода,которая с тех пор стабильно работает..
Он задал вызывающий мысль вопрос по телефону:
Я видел, что GPT-4V может интерпретировать все виды изображений и распознавать почти все.Можно ли использовать его непосредственно для проверки качества?
Тогда я не дал прямого ответа.
Честно говоря, мы были одинаково очарованы этой идеей.
Демонстрации многомодальных больших моделей, безусловно, впечатляют.Не требуется обучения или маркировки; он обеспечивает нулевую производительность прямо из коробки.
Если эта способность будет легко применяться на заводах, то вся книга правил промышленной визуальной инспекции будет переписана.
Мы провели почти два года, тестируя разнообразные мультимодальные решения для больших моделей в нескольких проектах.
Наш вывод очевиден: каким бы заманчивым ни казалась технология, ее промышленное применение в реальном мире имеет серьезные ограничения.
Эта статья описывает все ловушки, с которыми мы столкнулись за эти два года.
Перед тем, как погрузиться в многомодальные крупные модели, важно определить базовые показатели отрасли:
Доминирующее решение для современной промышленной визуальной инспекции опирается на модели обнаружения объектов и сегментации, представленные серией YOLO.
Начиная с YOLOv3 и заканчивая широко распространенными YOLOv8, YOLOv9 и YOLOv10, семейство YOLO уже много лет применяется на промышленных производственных линиях.обладает полностью зрелым техническим набором.
Во-первых, сверхбыстрая скорость вывода.
Оснащенный стандартными компьютерными коробками, совмещенными с промышленными камерами, YOLOv8 завершает вывод для одного кадра в течение 10 до 30 миллисекунд, что соответствует тактовому времени большинства производственных линий.
Во-вторых, достаточная точность обнаружения.
При наличии адекватных наборов маркированных данных, серия YOLO достигает исключительной точности для распространенных категорий дефектов, легко достигая MAP более 90%.
В-третьих, зрелая экосистема развертывания.
Готовые цепочки инструментов поддерживают несколько рамок развертывания, включая ONNX, TensorRT и OpenVINO.Полный рабочий процесс от обучения моделей до развертывания на месте был подтвержден бесчисленными промышленными проектами.
В-четвертых, комплексная экосистема с открытым исходным кодом.
Активное сообщество с открытым исходным кодом предоставляет доступные решения для большинства технических препятствий, с большим количеством предварительно подготовленных весов, наборов для увеличения данных и инструментов маркировки, которые легко доступны.
Таким образом, серия YOLO является практически выбором по умолчанию для проектов промышленной визуальной инспекции, запущенных в 2024 году.
Нет необходимости обсуждать вопрос о необходимости внедрения глубокого обучения - этот вопрос был решен десять лет назад.
Теперь возникает новый ключевой вопрос: с появлением мультимодальных больших моделей, остается ли YOLO оптимальным решением?
В 2023 году произошла взрывная волна выпуска больших моделей.
Модели, включая GPT-4V, Gemini и Claude 3, обеспечивают мощные возможности общего понимания изображений.
Традиционный рабочий процесс: для проверки конкретного типа дефекта сначала необходимо собрать, пометить и обучить изображения этого дефекта.
Многомодальные большие модели: просто опишите свой запрос на естественном языке, например "Проверьте, есть ли царапины на этом изображении", и модель мгновенно вернет результаты.Не требуется обучения или маркировки.
Стоимость холостого запуска падает почти до нуля.
При запуске новых продуктов нет необходимости тратить две недели на сбор данных, маркировку и обучение модели.
Традиционные модели выводят только ограничительные поля и оценки доверия, например, в этом поле существует дефект с доверием 0,87".
Большие мультимодальные модели генерируют описательный естественный язык: в левом верхнем углу изображения появляется царапина размером около 2 см, которая, вероятно, образовалась во время транспортировки.Рекомендуется оптимизировать процесс упаковки.. "
Результаты проверки могут быть непосредственно преобразованы в официальные отчеты о проверке качества.
Традиционные модели могут распознавать только типы дефектов, обнаруженных во время обучения; они не могут идентифицировать совершенно новые невидимые дефекты.
Теоретически, многомодальные большие модели обрабатывают огромные изображения из Интернета, что позволяет им потенциально распознавать все виды редких и нерегулярных дефектов.
Покрытие дефектов длинного хвоста и аномальных случаев краев резко улучшилось.
Традиционные решения включают в модель фиксированные правила проверки.
Многомодальные большие модели поддерживают динамическую корректировку стандартов с помощью запросов. Например, вы можете установить порог, когда ′′грабежи свыше 1 см считаются NG" в один день и переключить его на ′′0.5 см" следующий без изменения базовой модели.
Это означает, что стандарты наладки станут чрезвычайно гибкими.
Читая все эти преимущества, вы также можете испытывать соблазн, как и мы в то время.только чтобы потом столкнуться с целым рядом дорогостоящих ловушек..
Наш пилотный проект был сосредоточен на проверке внешнего вида корпусов мобильных телефонов.
Производственная линия обрабатывает одну заготовку каждые 3 секунды, что означает, что общая задержка проверки должна оставаться ниже 2 секунд, чтобы зарезервировать 1 секунду для роботизированной сортировки.
Мы протестировали рабочий процесс API GPT-4V:
Средняя задержка достигла 4 ‰ 6 секунд и могла превышать 10 секунд на фоне колебаний сети ≈ слишком медленно для сборочной линии.
Вместо этого вы могли бы предложить самостоятельные мультимодальные модели с открытым исходным кодом, такие как LLaVA и Qwen-VL. Мы также их протестировали.Запуск LLaVA-13B на графическом процессоре A100 дает задержку вывода одного изображения примерно 800 мс к 1.2 секунды.
Хотя он быстрее облачных API, он остается в десятки раз медленнее YOLO.
Даже если мы допустим задержку ради аргументов, расчет затрат расскажет грубую историю.
Сколько изображений обрабатывает одна производственная линия в день?
Предполагая, что каждые 3 секунды и 20 часов ежедневной работы производится одна деталь, одна линия генерирует около 24 000 изображений в день.
Для API GPT-4V стоимость единицы варьировалась от $0,01 до $0,03 за изображение в зависимости от разрешения и потребления токенов:
Это всего лишь одна линия, в то время как наш клиент управлял 12 производственными линиями - недоступные затраты для производителей.
А как насчет самостоятельно размещаемых моделей с открытым исходным кодом?
Одинокий графический процессор A100 обеспечивает приблизительно 1 ‰ 2 QPS (запросы в секунду).
Однако, учитывая серверы, пространство IDC и техническое обслуживание, годовая эксплуатационная стоимость развертывания A100 составляет сотни тысяч юаней.
В отличие от этого, для развертывания YOLO требуется только краевая вычислительная коробка стоимостью в несколько тысяч юаней для поддержки одной полной производственной линии.
Разрыв в стоимости охватывает два порядка величины.
Это оказалось самым разочаровывающим препятствием.
Промышленная инспекция требует абсолютного детерминизма: одинаковые изображения должны каждый раз давать одинаковые результаты инспекции.в противном случае стандартизированный контроль качества и прослеживаемость становятся невозможными.
Большие мультимодальные модели, однако, дают вероятностные результаты.
Мы провели контролируемый тест: подали одно и то же дефектное изображение с идентичным запросом в GPT-4V десять раз.
Все из одного и того же ввода и запроса.
Подобная случайность является фатальной для контроля качества на заводе. Инспекторы не могут действовать на выходной "70% вероятность дефекта"
Некоторые предлагают установить температуру до нуля для консистенции.Большие модели генерируют результаты с помощью механизмов выборки, и незначительные отклонения сохраняются для краевых случаев даже при температуре = 0.
Производительность мультимодальной модели полностью зависит от быстрого проектирования, которое мы потратили на оптимизацию для повышения точности и стабильности.
Вскоре мы обнаружили, что запросы очень чувствительны к изменениям формулировки.
Три запроса с почти одинаковыми основными запросами дали совершенно разные результаты проверки:
Указание А: ′′Проверьте, есть ли на этом изображении поверхностные дефекты".
Процедура B: "Осторожно изучите поверхность изделия и выявьте царапины, ямы, посторонние вещества и другие дефекты".
Просьба C: "Действуйте как профессиональный инспектор качества. Найдите и классифицируйте любые дефекты внешнего вида продукта на этом изображении".
Что еще хуже, запросы, отрегулированные для продукта А, теряют эффективность при применении к продукту В, требуя полной переработки логики запроса для каждого нового варианта продукта.
Чем это отличается от переподготовки моделей YOLO для новых продуктов?
Обучение YOLO опирается на количественные показатели оценки, чтобы четко сигнализировать, когда модель соответствует стандартам; быстрая настройка полностью зависит от субъективных проб и ошибок,без четкого критерия оптимальной производительности.
Галлюцинации - это хорошо задокументированный недостаток больших языковых и мультимодальных моделей: система уверенно придумывает детали, которых не существует.
В промышленной инспекции это проявляется в виде трех типичных сбоев:
Один из испытаний иллюстрирует серьезность: совершенно безупречное изображение продукта вызвало очень подробный сфабрикованный анализ:В правом нижнем углу обнаружена мелкая царапина длиной около 3 мм., рекомендуется оценка функционального воздействия".
При тщательном визуальном рассмотрении, никаких следов или царапин не было в этой области вообще.
Если такие галлюцинации проникают в серийное производство, следуют серьезные последствия:либо дефектные товары пропадают незамеченными (пропущенная проверка) или квалифицированные продукты ошибочно отклоняются (ложный отказ).
Поскольку облачные API страдают от высокой задержки и чрезмерных затрат, самостоятельное размещение кажется альтернативой.
YOLOv8-m работает гладко даже на GTX 1080 с 8 ГБ VRAM.
Он может быть даже развернут на краевом вычислительном оборудовании, таком как модули NVIDIA Jetson с энергопотреблением всего в десятки ватт.
Порог вычислительного ресурса отличается целым порядком величины.
Для большинства заводов установка сервера A100 на производственном этаже нецелесообразна как с точки зрения капитальных затрат, так и с точки зрения ежедневной эксплуатации и обслуживания.
После того, как мы столкнулись со всеми вышеупомянутыми ловушками, мы сделали шаг назад, чтобы задуматься над фундаментальным вопросом:
Какие основные возможности требуются промышленной визуальной инспекции?
Идентичные изображения должны давать 100%-ные результаты, что является основой стандартизированного контроля качества и полной прослеживаемости; вероятностные результаты неприемлемы.
Миллисекундный уровень реакции. Время на производственной линии является жестким, и инспекция не может стать узким горлом.
Время вывода 10 мс и время вывода 1000 мс представляют собой совершенно разные операционные реалии.
Сколько кадров можно обрабатывать в секунду? Сколько деталей можно проверять ежедневно?
Расходы на вычисления должны оставаться контролируемыми, избегая ежегодных расходов в сотни тысяч долларов США на одну производственную линию.
Сетевые среды на заводах сложны, многие мастерские не имеют стабильных или доступных интернет-соединений.
Модели должны работать локально на краевых устройствах, а не полагаться на облачные API.
Когда обнаруживается дефект, система должна четко информировать инспекторов о его точном местонахождении и категории.
В идеале, он должен выводить координаты дефектов, площади и показатели доверия для интеграции системы ниже по течению.
Продукция обновляется, а стандарты инспекции регулярно пересматриваются.
Стоимость адаптации для каждой итерации должна быть управляемой, без полной реконструкции каждый раз.
Сопоставление этих шести основных требований с двумя техническими способами показывает явный контраст:
Могут ли мультимодальные модели заменить YOLO?
На нынешнем этапе технической зрелости многомодальные большие модели не подходят в качестве основного решения для промышленной визуальной инспекции.
Ее сильные стороны, включая логику с нулевым выстрелом, глубокое семантическое понимание и сильное обобщение, не приносят практической ценности на производственных линиях; в то же время ее критические недостатки - высокая задержка,Невысокие затраты и неустойчивая производительность являются катастрофическими для промышленного контроля качества.
Это не означает, что многомодальные большие модели совершенно бесполезны для промышленной визуальной инспекции.
Ключ заключается в определении их подходящей ниши.
После двух лет полевых испытаний мы обобщили четыре сценария, в которых мультимодальные крупные модели создают ощутимую ценность:
Аннотация представляет собой крупнейший фактор затрат на традиционные инспекционные проекты.
Задача промышленного зрения обычно требует от тысяч до десятков тысяч аннотированных изображений.расходы на маркировку составляют 30%-50% от общего объема инвестиций в проект.
Многомодальные большие модели обеспечивают возможность предварительной маркировки:
Модель сначала генерирует предварительные маски и коробки с аннотацией из необработанных изображений.
Наши полевые тесты показывают, что этот рабочий процесс повышает эффективность аннотации в 3−5 раз, сокращая среднее время маркировки на изображение с 30 секунд до менее 10 секунд.
Поверхность производительности моделей YOLO проста: они могут распознавать только типы дефектов, представленные в наборах данных обучения.
Беспрецедентные редкие дефекты вызовут пропущенное обнаружение.
Хотя подобные аномалии с длинным хвостом встречаются редко, они часто сигнализируют о серьезных ненормальных условиях производства, несущих с собой более высокие эксплуатационные риски.
Большие мультимодальные модели выступают в качестве резервного уровня проверки:
Когда YOLO выводит граничный балл доверия (примерно 0,3 ≈ 0,4).7, серая зона неопределенности), соответствующее изображение отправляется в мультимодальную модель для вторичного суждения.
Сила генерализации больших моделей покрывает эти редкие аномалии.
В рамках этого механизма только 5%-10% всех изображений передаются в мультимодальную модель, что позволяет управлять общими затратами и значительно улучшить охват дефектов длинного хвоста.
YOLO выдает только структурированные данные: граничные поля, категории дефектов и баллы доверия.
Хотя для промышленных систем этого недостаточно, для инспекторов эти показатели не являются интуитивными, поскольку им нужны ответы на практические вопросы: насколько серьезен дефект?Какие корректирующие меры следует предпринять?
Мультимодальные крупные модели выполняют семантическое создание отчетов:
Ввод: координаты дефектов, маркировки классификации, модель продукта и параметры производственного процесса
Выход: отчет о проверке на естественном языке, например, на левом краю изделия обнаружена царапина длиной 5 мм, вероятно, вызванная отталкиванием плесени; рекомендуется обслуживание плесени".
Эта задача не чувствительна к задержке (отчеты могут генерироваться асинхронно) и экономически эффективна (исполняется только на несоответствующих НГ продуктах с ограниченным объемом).
Клиенты иногда сталкиваются с ограниченными сроками: новые продукты, запланированные на серийное производство на следующей неделе, имеют всего десятки дефектных образцов изображений, недостаточных для полного обучения YOLO.
Традиционный рабочий процесс не может запустить проверку с такими ограниченными данными.
Многомодальные крупные модели служат временным переходным решением:
Возможность нулевого выстрела позволяет немедленно развернуть с приемлемой, но несовершенной точностью, значительно превосходящую полную ручную инспекцию.Данные могут постоянно собираться во время пилотных операций для обучения формальной модели YOLO для долгосрочного использования после накопления достаточного количества образцов..
На основе вышеуказанного анализа мы приняли гибридную двухканальную архитектуру для недавних промышленных проектов:
Основные принципы проектирования этой гибридной структуры:
Ниже приведено краткое дерево решений для команд, выбирающих алгоритмы промышленной визуальной инспекции:
Для подавляющего большинства промышленных сценариев YOLO останется оптимальным выбором.
Многомодальные большие модели подходят только в качестве первичных решений при определенных условиях: терпимость к задержке, низкий спрос на пропускную способность, стабильная поддержка облачных вычислений и крайняя нехватка данных.
Наиболее прагматичным решением в отрасли является гибридная архитектура:
Возвращаясь к первоначальному вопросу: могут ли мультимодальные большие модели заменить YOLO?
После двух лет практических попыток и ошибок, наш вывод ясен:
Это неправильная формулировка вопроса.
Это не соревнование с нулевой суммой "А заменяет В", а вопрос о том, чтобы каждая технология занимала свою уникальную экологическую нишу.
Большие мультимодальные модели обладают внушительными возможностями, но их основные сильные стороны - рассуждения с нулевым выстрелом,глубокое семантическое понимание и широкое обобщение предоставлять ограниченную ценность для основных производственных рабочих процессов инспекции.
Между тем, их неотъемлемые недостатки: высокая задержка, чрезмерные эксплуатационные издержки и нестабильная производительность - это именно те недопустимые проблемы, с которыми промышленное производство не может мириться.
Суть технического отбора заключается не в погоне за новейшими технологиями, а в том, чтобы соответствовать требованиям реального сценария.
Серия YOLO широко используется в промышленной визуальной инспекции в течение многих лет, и ее статус де-факто стандарта хорошо оправдан.
Большие многомодальные модели являются мощными дополнительными инструментами, но они не являются полноценной заменой при текущей технической зрелости.
Возможно, через три или пять лет, ландшафт изменится: скорость выводов резко улучшится, затраты на развертывание резко снизятся, и вопрос детерминизма будет полностью решен.
Только тогда мы сможем вернуться к обсуждению полномасштабной замены.