logo
상품
뉴스 세부 정보
> 뉴스 >
산업용 시각 검사: 다모형 대형 모델 의 매력
이벤트
문의하기
Miss. Andy
86-0592-5636807
위챗 +8618020763272
지금 접촉하세요

산업용 시각 검사: 다모형 대형 모델 의 매력

2026-06-26
Latest company news about 산업용 시각 검사: 다모형 대형 모델 의 매력
I. 유혹적 인 질문

GPT-4V가 2023년 초에 출시된 직후, 우리는 오랜 고객으로부터 전화를 받았습니다.

그는 가전제품 제조사의 기술 책임자로 일했습니다. 2년 전에 우리는 YOLOv5 기반의 표면 검사 시스템을그 이후로 안정적으로 작동하고 있었습니다..

그는 전화로 생각나게 하는 질문을 던졌습니다.

"나는 GPT-4V가 모든 종류의 이미지를 해석하고 거의 모든 것을 인식 할 수 있음을 보았습니다. 우리는 품질 검사를 위해 직접 채택 할 수 있습니까? 그것은 데이터 라벨의 필요성을 완전히 제거 할 수 있습니까?"

그 때 저는 직설적인 대답을 하지 않았습니다.

솔직히 말해서, 우리는 그 아이디어에 똑같이 매료되었습니다.

다중 모형 대형 모델의 데모는 의심 할 여지 없이 인상적입니다. 모델에 임의의 무작위 이미지를 입력하면 내용, 결함을 정확히 파악하고 결함 유형을 분류 할 수 있습니다.교육이나 표시가 필요하지 않습니다.; 그것은 상자 밖으로 제로 샷 성능을 제공합니다.

만약 이 기능이 공장으로도 완벽하게 적용된다면 산업 시각 검사의 전체 규칙책이 다시 쓰일 것입니다.

우리는 거의 2년 동안 다양한 다중모형 대형 모델 솔루션을 여러 프로젝트에서 테스트했습니다.

우리의 결론은 분명합니다. 기술이 유혹적으로 보일 수도 있지만 실제 산업용 응용은 엄격한 한계를 가지고 있습니다.

이 기사에서는 이 2년 동안 우리가 직면한 모든 함정을 기록합니다.

II. 현재의 풍경을 확립하라: YOLO는 사실상의 표준이 되었다

멀티모달 대형 모델에 뛰어들기 전에 산업의 기본 라인을 설정하는 것이 중요합니다.

오늘날 산업 시각 검사에 대한 지배적 솔루션은 YOLO 시리즈로 대표되는 객체 탐지 및 세분화 모델에 의존합니다.

이것은 새로운 경향은 아닙니다. YOLOv3에서 시작하여 널리 배포된 YOLOv8, YOLOv9 및 YOLOv10에 이르기까지 YOLO 가족은 수년 동안 산업 생산 라인에서 구현되었습니다.완전히 성숙한 기술 스택을 자랑.

에 대한 최신 회사 뉴스 산업용 시각 검사: 다모형 대형 모델 의 매력  0
왜 YOLO 가 사실상 표준 이 되었습니까?

첫째, 초고속 추론 속도

산업용 카메라와 결합된 표준 엣지 컴퓨팅 박스에 장착된 YOLOv8는 대부분의 생산 라인의 takt 시간과 일치하는 10 ~ 30 밀리 초 이내에 하나의 프레임에 대한 추론을 완료합니다.

둘째, 충분한 탐지 정확성.

적당한 표기된 데이터 세트를 사용하면 YOLO 시리즈는 일반적인 결함 범주에서 뛰어난 정확도를 달성하며 90% 이상의 mAP를 쉽게 달성합니다.

셋째, 성숙한 배포 생태계입니다.

준비된 툴 체인은 ONNX, TensorRT 및 OpenVINO를 포함한 여러 배포 프레임워크를 지원합니다.모델 훈련에서 현장 배치까지의 전체 작업 흐름은 수많은 산업 프로젝트에서 검증되었습니다..

넷째, 포괄적인 오픈소스 생태계입니다.

활발한 오픈소스 커뮤니티는 대부분의 기술적 장애물에 대한 접근 가능한 해결 방법을 제공하고 있으며, 풍부한 사전 훈련 된 무게, 데이터 증강 키트 및 라벨링 도구가 쉽게 제공됩니다.

따라서 YOLO 시리즈는 2024년에 시작되는 산업 시각 검사 프로젝트에 기본적으로 선택됩니다.

딥러닝을 채택해야 하는지에 대해 논쟁할 필요가 없습니다.

이제 새로운 핵심 질문이 제기됩니다. 멀티모델 대형 모델의 등장으로 YOLO는 여전히 최적의 솔루션으로 남아 있습니까?

III. 다모형 대형 모델 의 매력: 유망 한 환상

2023년에는 다모형 대형 모델 출시가 폭발적으로 증가했습니다.

GPT-4V, Gemini 및 Claude 3를 포함한 모델은 강력한 일반적인 이미지 이해 기능을 제공합니다.

에 대한 최신 회사 뉴스 산업용 시각 검사: 다모형 대형 모델 의 매력  1
우리는 이 모델들을 테스트했습니다. 솔직히 말해서, 그들의 데모 성능은 정말 인상적입니다.
매력 1: 무사격 능력

전통적인 작업 흐름: 특정 유형의 결함을 검사하려면 먼저 그 결함의 이미지를 수집하고 표시하고 훈련해야합니다. 데이터가 없다는 것은 사용할 수있는 모델이 없다는 것을 의미합니다.

멀티모델 대형 모델: 단순히 자연 언어로 요구사항을 설명해 주세요. 예를 들어 "이 이미지에 스크래치가 있는지 확인하세요".교육 또는 표시가 필요하지 않습니다..

이것은 무엇을 의미합니까? 냉동 시작 비용은 거의 0으로 떨어집니다.

새로운 제품을 출시할 때, 데이터 수집, 라벨링, 모델 훈련에 2주 동안의 시간을 할애할 필요가 없습니다. 몇 줄의 명령으로 모델을 사용할 수 있습니다.

매력 2: 고급 의미 이해

전통적인 모델은 경계 상자와 신뢰도 점수를 출력합니다. 예를 들어, 0.87의 신뢰도를 가진 이 상자 안에 결함이 있습니다.

다중 모형 대형 모델은 설명적인 자연 언어를 생성합니다: 사진의 왼쪽 상단 구석에 2cm 정도의 긁힘이 나타나고, 운송 중에 형성되었을 가능성이 있습니다.포장 과정을 최적화하는 것이 좋습니다.."

이것은 무엇을 의미합니까? 검사 결과는 공식 품질 검사 보고서로 직접 변환 될 수 있습니다.

매력 3: 강력 한 일반화 능력

전통적인 모델은 훈련 중에 보이는 결함 유형만을 인식할 수 있습니다. 완전히 새로운 보이지 않는 결함을 식별하는 데 실패합니다.

이론적으로, 멀티모델 대형 모델은 인터넷에서 얻은 거대한 이미지를 처리하여 모든 종류의 희귀하고 불규칙한 결함을 인식할 수 있습니다.

이것은 무엇을 의미합니까? 긴 꼬리 결함과 비정상적인 가장자리 경우의 커버링이 크게 향상되었습니다.

매력 4: 상호 작용 검사 논리

전통적인 해결책은 모델에 고정된 검사 규칙을 포함합니다. 검사 기준을 수정하려면 완전한 재교육이 필요합니다.

멀티모델 대형 모델은 명령어를 통해 표준의 동적 조정을 지원합니다. 예를 들어 1cm 이상의 스크래치가 NG로 계산되는 한 날로 문턱을 설정하고 0으로 전환할 수 있습니다.5cm" 다음 기본 모델을 수정하지 않고.

이것은 무엇을 의미합니까? 조정 검사 표준은 매우 유연합니다.

이 모든 장점을 읽고, 당신은 또한 유혹 될 수 있습니다. 바로 그 때 우리가 그랬던 것처럼. 그래서 우리는 여러 실제 프로젝트에 다중 모형 대형 모델을 배치하기로 결정했습니다.하지만 그 후에도 많은 걸로 걸려.

IV. 실용적 으로 배치 하는 데 에 직면 한 값비싼 여섯 가지 함정
함정 1: 생산 라인에 적합하지 않은 과도한 추론 지연

우리의 파일럿 프로젝트는 휴대전화 하우스의 외모 검사에 초점을 맞추었습니다.

생산 라인은 3초마다 하나의 작업 조각을 처리합니다. 즉, 로봇 분류에 1초를 할애하기 위해 전체 검사 지연시간이 2초 이하로 유지되어야 합니다.

우리는 GPT-4V API 워크플로우를 테스트했습니다.

  1. 이미지를 업로드하고 프롬프트를 입력
  2. 서버 응답을 기다립니다.
  3. 검사 결과

평균 지연시간은 4~6초에 달했고, 네트워크 변동 속에서는 10초를 초과할 수 있었습니다.

대신 LLaVA와 Qwen-VL 같은 자율적으로 호스팅된 오픈소스 멀티모델 모델을 제안할 수도 있습니다.A100 GPU에서 LLaVA-13B를 실행하면 대략 800ms에서 1의 단일 이미지 추론 지연이 발생합니다.0.2초

클라우드 API보다 빠르지만, YOLO보다 수십 배 더 느립니다.

함정 2: 급증 하는 처리량 및 컴퓨팅 비용

비록 논쟁을 위해 지연을 용인하더라도 비용 계산은 혹독한 이야기를 말해줍니다.

한 생산 라인은 하루에 몇 장의 이미지를 처리합니까?

3초마다 1개의 작업 부품을 20시간 동안 매일 작동한다고 가정하면, 하나의 라인은 하루에 약 24,000개의 검사 이미지를 생성합니다.

GPT-4V API의 경우, 단위 가격은 해상도와 토큰 소비에 따라 이미지당 0.01달러에서 0.03달러 사이였다:

  • 한 줄 당 일일 비용: $240~$720
  • 한 라인 월간 비용은 7,200달러 21달러600
  • 연간 비용: $86,400$259,200

이것은 단지 하나의 라인을 차지하고, 우리의 고객은 12개의 생산 라인을 운영했습니다. 제조업체가 감당할 수 없는 비용이었습니다.

자율적으로 호스팅된 오픈소스 모델은 어떨까요?

단일 A100 GPU는 대략 1 ∼ 2 QPS (초당 질의) 를 제공합니다. 단일 라인은 약 0.3 QPS로 최고치로, 여러 라인을 위해 하나의 카드로 관리 할 수 있습니다.

하지만 서버, IDC 공간, 유지보수 등을 고려하면 A100 배포에 대한 연간 운영 비용은 수십만 원에 달한다.

이와는 달리, YOLO 배포는 하나의 전체 생산 라인을 지원하기 위해 몇 천 RMB에 달하는 엣지 컴퓨팅 박스만 필요합니다.

비용 격차는 두 개의 규모를 차지합니다.

함정 3: 불안정하고 확률적인 출력

이것은 우리의 가장 좌절스러운 장벽이 되었습니다.

산업 검사는 절대적인 결정론을 요구합니다. 동일한 이미지는 항상 동일한 검사 결과를 가져야 합니다.그렇지 않으면 표준화 된 품질 관리 및 추적 가능성은 불가능합니다..

그러나 다모형 대형 모델은 확률적인 결과물을 생산합니다.

우리는 GPT-4V에 10번씩 동일한 결함된 이미지를 동일한 명령으로 전달했습니다. 결과는 크게 달라졌습니다.

  • 7회 출품된 제품 고장
  • 2 회로 표시 그것은 수동 검토를 필요로 결함이 의심
  • 1차례는 명백한 결함이 없다고 주장했다.

모두 같은 입력과 명령에서 온 것입니다.

이러한 무작위성은 공장 품질 통제에 치명적입니다. 검사자는 결함의 70%의 확률에 따라 행동 할 수 없습니다. 모든 작업 조각은 최종적인 OK 또는 NG 판결이 필요합니다.

어떤 사람들은 일관성을 위해 온도를 0으로 설정하는 것을 제안합니다. 우리는 이 방법을 시도했지만 안정성을 향상시켰지만 100%의 동일한 출력을 보장하지 못했습니다.큰 모델은 샘플링 메커니즘을 통해 결과를 생성합니다., 그리고 작은 오차는 온도 = 0에서도 가장자리 경우에 유지됩니다.

함정 4: 취약 한 신속 한 공학 ∼ 소소한 표현 변화 가 판단 을 변화 시킨다

다중모델 성능은 신속한 설계에 전적으로 의존합니다. 우리는 정확성과 안정성을 높이기 위해 광범위한 인력 최적화를 했습니다.

우리는 곧 문장 변경에 매우 민감하다는 것을 발견했습니다.

거의 동일한 핵심 요청을 가진 세 개의 요청은 매우 다른 검사 결과를 제공했습니다.

명령 A: 이 이미지에 표면 결함이 있는지 확인합니다. "

안내서 B: 제품 표면을 주의 깊게 검사하고 긁힘, 구멍, 외질 및 기타 결함을 확인하십시오. "

명령 C: "전문적 인 품질 검사자 처럼 행동 하십시오. 이 사진 에 있는 제품 의 외모 결함 을 찾아 분류 하십시오".

더 나쁜 것은 제품 A에 맞춰진 프롬프트가 제품 B에 적용되면 효능을 잃게 되고, 모든 새로운 제품 변종에 대한 프롬프트 논리를 완전히 재개해야 한다는 것입니다.

이것은 새로운 제품에 대한 YOLO 모델의 재교육과 어떻게 다릅니다?

YOLO 훈련은 모델이 표준을 충족할 때 명확하게 표시하기 위해 수치화 가능한 평가 메트릭에 의존합니다. 신속한 조정은 전적으로 주관적인 시행착오에 달려 있습니다.최적의 성능에 대한 명확한 기준이 없습니다..

함정 5: 환각 자신감 있게 존재하지 않는 결함을 만들어 내는 것

환각은 큰 언어와 다중 모형 모델의 잘 기록된 결함입니다. 시스템이 자신있게 존재하지 않는 세부 사항을 발명합니다.

산업 검사에서 이것은 세 가지 전형적인 실패로 나타납니다.

  1. 결함 없는 제품을 결함 있는 것으로 표시
  2. 결함 위치를 잘못 표시 (예: 오른쪽에 표시되는 경우 왼쪽에 스크래치를 찾습니다)
  3. 결함 유형을 잘못 분류 (예: 구멍을 긁힌 채로 표시)

한 실험 사례는 심각성을 예로 들 수 있습니다. 완전히 결함이 없는 제품 이미지는 매우 상세한 가공 분석을 유발합니다.아래 오른쪽 구석에서 약 3mm 길이의 얇은 긁힘이 감지됩니다., 기능적 영향 평가 권장됩니다".

자세히 살펴보면 그 지역에서 흔적이나 긁힘이 전혀 없었습니다.

이런 환각이 대량생산 라인에 침투하면 심각한 결과를 초래합니다.결함이 있는 상품이 검출되지 않은 채로 빠져나오거나 (검찰을 놓쳤거나) 자격을 갖춘 상품이 잘못 거부되었거나 (거짓 거절).

함정 6: 사설 현장 배치에 대한 높은 자원 장벽

클라우드 API가 높은 지연시간과 과도한 비용을 겪기 때문에 자체 호스팅 배포는 대안으로 보입니다. 우리는 주류 오픈 소스 멀티모달 모델에 대한 하드웨어 및 소프트웨어 요구 사항을 평가했습니다.

에 대한 최신 회사 뉴스 산업용 시각 검사: 다모형 대형 모델 의 매력  2
YOLO는 어때요?

YOLOv8-m는 8GB VRAM의 GTX 1080에서도 원활하게 실행됩니다.

그것은 단지 수십 와트의 전력 소비로 NVIDIA Jetson 모듈과 같은 엣지 컴퓨팅 하드웨어에 배치 될 수 있습니다.

계산 자원의 문턱은 전체 규모의 순서로 다릅니다.

대부분의 공장에서는 생산 층에 A100 서버를 설치하는 것이 자본 지출과 일상 운영 및 유지 보수 측면에서 실용적이지 않습니다.

V. 첫 번째 원칙으로 돌아가: 산업 시각 검사 는 정확히 무엇 을 요구 합니까?

위의 모든 함정에 걸려서 우리는 한 걸음 물러서서 근본적인 질문을 생각해 보았습니다.

산업 시각 검사에서 필수적으로 요구되는 핵심 기능은 무엇입니까?

  1. 결정적 결과물

    동일한 이미지는 100%의 일관성 결과를 가져야 합니다. 이것은 표준화 된 품질 관리와 완전한 추적성의 기초를 형성합니다. 확률적 출력은 허용되지 않습니다.

  2. 초저연속성

    밀리초 수준 반응. 생산 라인 takt 시간은 딱딱하고, 검사는 병목이 될 수 없습니다.

    10ms 추론 시간과 1,000ms 추론 시간은 완전히 다른 운영 현실을 나타냅니다.

  3. 높은 처리량

    초당 얼마나 많은 프레임을 처리 할 수 있습니까? 매일 얼마나 많은 작업 조각을 검사 할 수 있습니까?

    계산 비용은 통제 할 수 있어야 하며, 단일 생산 라인에 대한 수십만 달러의 연간 지출을 피해야합니다.

  4. 엣지 배포 호환성

    공장 네트워크 환경은 복잡합니다. 많은 작업실에는 안정적이거나 접근 가능한 인터넷 연결이 없습니다.

    모델은 클라우드 API에 의존하기보다는 엣지 디바이스에서 로컬로 작동해야 합니다.

  5. 해석 가능한 검사 결과

    결함이 발견되면 시스템에서 검사자에게 정확한 위치와 범위를 명확히 알려야 합니다.

    이상적으로, 그것은 하류 시스템 통합을 위해 결함 좌표, 지역 및 신뢰도 점수를 출력해야합니다.

  6. 통제 할 수 있는 유지보수 비용

    제품들은 업그레이드되고 검사 기준은 정기적으로 수정됩니다.

    각 반복에 대한 적응 비용은 매번 완전한 재구성 없이 관리되어야 합니다.

이 여섯 가지 핵심 요구사항을 두 가지 기술 경로와 비교하면 명확한 대조를 나타냅니다.

YOLO 시리즈는 여섯 가지 기준을 완벽하게 충족합니다.
  • 결정론: 동일한 입력값에 따라 100% 일관성 있는 출력
  • 낮은 지연시간: 10~30 밀리초 추론
  • 높은 처리량: 단일 GPU 당 수십 개에서 백 개 이상의 QPS
  • 엣지 배포 가능: 제트슨 하드웨어 및 산업용 PC와 완전히 호환됩니다.
  • 해석 가능한 출력: 경계 박스, 결함 범주 및 신뢰도 값
  • 낮은 유지보수 비용: 단계적 교육 및 전송 학습을 위한 성숙한 도구 체인
다모형 대형 모델은 거의 모든 요구 사항을 충족하지 못합니다.
  • 결정론: 본질적으로 확률적인 결과물
  • 지연 제한: 두 번째 규모 추론
  • 처리량 제한: 단일 GPU는 단자리 QPS만을 지원합니다.
  • 엣지 배포 장벽: A100 클래스 고급 GPU를 요구합니다
  • 해석성 격차: 원시 자연어 설명은 2차 분석이 필요합니다.
  • 예측할 수 없는 유지보수: 신속한 엔지니어링은 정량화 가능한 최적화 표준이 부족합니다.

그래서 다중 모형 대형 모델이 YOLO를 대체할 수 있을까요? 결론은 분명합니다.

현재 기술 성숙 단계에서는 다중 모형 대형 모델이 산업 시각 검사의 주요 솔루션으로 적합하지 않습니다.

제로샷 추론, 깊은 의미 이해 및 강한 일반화와 같은 강점은 생산 라인에서 실용적인 가치를 거의 제공하지 않습니다. 한편으로 중요한 결함막대한 비용과 불안정한 생산량은 산업 품질 통제에 치명적입니다..

VI. 대체 가 아니라 보완

이것은 다중 모형 대형 모델이 산업 시각 검사에 완전히 쓸모가 없다는 것을 의미하지는 않습니다.

핵심은 그들의 적절한 틈새를 파악하는 것입니다.

2년간의 현장실험 끝에 우리는 멀티모델 대형 모델이 실질적인 가치를 창출하는 네 가지 시나리오를 요약했습니다.

시나리오 1: 보조 자동 데이터 주석

설명은 전통적인 검사 프로젝트의 가장 큰 비용 운전자입니다.

산업 비전 작업은 일반적으로 수천에서 수만 개의 주석 이미지가 필요합니다. 주석 서비스를 아웃소싱하는 데에는 프레임 당 10분의 10에서 몇 달러가 소요됩니다.라벨링 비용은 전체 프로젝트 투자의 30%~50%를 차지합니다..

멀티모델 대형 모델은 사전 표시 기능을 제공합니다.

모델은 원료 이미지에서 먼저 사전 주석 마스크와 상자를 생성합니다. 인간 직원은 처음부터 라벨링 대신 결과를 검토하고 수정해야합니다.

우리의 현장 테스트는 이 작업 흐름이 주석의 효율성을 3~5배로 높이고, 이미지별 평균 표기 시간을 30초에서 10초 이하로 줄인다는 것을 증명했습니다.

시나리오 2: 긴 꼬리 결함에 대한 재복보장

YOLO 모델의 성능 최고값은 간단합니다. 그들은 훈련 데이터 세트에 등장하는 결함 유형만을 인식할 수 있습니다.

유례없는 희귀 결함이 YOLO에 의해 발견을 놓칠 것입니다.

이러한 긴 꼬리 이상 현상은 드물게 발생하지만 종종 심각한 비정상적인 제조 조건을 나타내고 더 높은 운영 위험을 초래합니다.

멀티모델 대형 모델은 재발 검증 계층으로 작용합니다.

YOLO가 경계 신뢰도 점수를 출력하면 (약 0.3~0.7, 불확실성의 회색 구역), 해당 이미지는 2차 판단을 위해 다중 모형 모델로 전송됩니다.

큰 모델의 제로 샷 일반화 강도는 눈에 보이지 않는 희귀한 이상 현상을 덮습니다.

이 메커니즘에 따라 모든 이미지의 5%~10%만이 멀티모달 모델로 전송되며 전체 비용을 관리 할 수 있으며 긴 꼬리 결함의 커버리지를 획기적으로 향상시킵니다.

시나리오 3: 원시 검사 데이터의 의미 변환

YOLO는 구조화된 데이터만 출력합니다. 경계 박스, 결함 범주, 신뢰도 점수.

백엔드 산업 시스템에는 이러한 원시 측정값이 충분하지만, 실제적인 질문에 대한 답을 필요로 하는 인간 검사자들에게는 직관적이지 않습니다.어떤 시정 조치 를 취해야 합니까??

멀티모델 대형 모델은 의미적인 보고서 생성 작업을 수행합니다.

입력: 결함 좌표, 분류 라벨, 제품 모델 및 제조 공정 매개 변수

출력: 자연어 검사 보고서, 예를 들어 제품 왼쪽 가장자리에 5mm의 스크래치가 감지되며, 곰팡이 가열로 인해 발생할 가능성이 있습니다. 곰팡이 유지 관리가 권장됩니다. "

이 작업은 대기시간에 민감하지 않습니다 (보고는 비동기적으로 생성 될 수 있습니다) 그리고 비용 효율적입니다 (한정된 볼륨의 NG 비상응 제품에서만 실행됩니다).

시나리오 4: 소규모 긴급 프로젝트의 빠른 냉동 시작

고객들은 때때로 긴 시한에 직면합니다. 다음 주에 대량 생산 예정된 새로운 제품들은 단지 수십 개의 결함된 샘플 이미지로, 완전한 YOLO 교육을 위해 충분하지 않습니다.

전통적인 작업 흐름은 이렇게 제한된 데이터로 검사를 시작할 수 없습니다.

멀티모델 대형 모델은 일시적인 과도한 해결책입니다.

제로 샷 능력은 수용 가능하지만 불완전한 정확도로 즉각적인 배포를 가능하게 하며, 완전한 수동 검사를 훨씬 능가합니다.충분한 샘플이 축적되면 장기 사용을위한 공식적인 YOLO 모델을 훈련하기 위해 파일럿 운영 중에 데이터를 지속적으로 수집 할 수 있습니다..

VII. 하이브리드 아키텍처: 우리의 실용적 배포 패러다임

위의 분석을 바탕으로 우리는 최근 산업 프로젝트에서 하이브리드 듀얼 채널 아키텍처를 채택했습니다.

주요 검사 채널: YOLO
  • 모든 검사 작업량의 95% 이상을 처리합니다.
  • 엣지 하드웨어에 로컬로 배포되어 10~20ms 추론 지연
  • 출력 구조적 경계 상자, 결함 유형 및 신뢰도 점수
보조 채널: 멀티모델 대형 모델
  • 회색 영역 내에서 낮은 신뢰도의 경계 이미지를 처리합니다.
  • 주선 처리량을 방해하지 않고 비동기적으로 호출
  • 롱테일 결함 재발 검증, 시맨틱 보고서 생성 및 보조 라벨링 기능

이 하이브리드 프레임워크의 기본 설계 원칙:

  1. YOLO는 핵심 기본 시스템으로 작용합니다. 다중 모형 모델은 보조 도구로 사용됩니다.
  2. 일련 처리 대신 데이터 셔팅: 다중 모형 모델은 중요한 생산 경로에서 벗어나 주요 라인 지연이나 처리량에 영향을 미치지 않습니다.
  3. 신뢰성 기반의 트래픽 분할: 높은 신뢰성 결과가 직접 전달되며 모호한 샘플은 2차 다중 모달 검증을 위해 전송됩니다.
  4. 예측 가능한 비용 통제: 이미지의 작은 부분만이 다중 모형 컴퓨팅 자원을 소비합니다.
VIII. 기술 선택 결정 틀

아래는 산업 시각 검사 알고리즘을 선택하는 팀의 요약된 결정 나무입니다.

  1. 지연 시간 요구 사항
    • 필요한 추론 <100ms → YOLO를 선택
    • 두 번째 규모의 지연은 허용됩니다 → 다중 모형 대형 모델은 실행 가능합니다.
  2. 처리량 요구 사항
    • 초당 1 프레임 이상 → YOLO를 선택하세요
    • 매일 수백 장의 이미지가 처리됩니다 → 다중 모형 대형 모델은 실행 가능
  3. 배포 환경
    • 엣지 오프라인 배포가 필요합니다 → YOLO를 선택하세요
    • 안정적인 전용 클라우드 컴퓨팅 리소스가 사용 가능
  4. 데이터 가용성
    • 수 천 개의 주석 샘플이 준비되어 있습니다 → YOLO를 선택하세요
    • 긴급한 발사 일정에 수십 개의 샘플만 → 임시 전환으로 다중 모형 모델을 채택하십시오
  5. 예산 제약
    • 연간 단일 라인 운영 예산 100,000 RMB 이하 → YOLO를 선택
    • 풍부한 재정 예산 → 하이브리드 아키텍처가 권장됩니다

대부분의 산업 시나리오에서 YOLO는 최적의 선택으로 남아 있습니다.

멀티모델 대형 모델은 특정 조건에서만 기본 솔루션으로 적합합니다: 대기 허용, 낮은 처리량 수요, 안정적인 클라우드 컴퓨팅 지원 및 극심한 데이터 부족.

가장 실용적인 산업 솔루션은 하이브리드 아키텍처입니다.

  • YOLO는 핵심 실시간 검사 업무를 수행합니다.
  • 멀티모델 대형 모델은 주석, 재발 확인 및 자동 보고서 작성에 보조 가치를 제공합니다.
  • 비용 통제를 유지하면서 두 기술의 각각의 강점을 활용
결말 언급

처음 질문으로 돌아가면, 멀티모델 대형 모델이 YOLO를 대체할 수 있을까요?

2년간의 시행착오 끝에 결론은 분명합니다.

이건 잘못된 질문입니다.

이것은 'A가 B를 대체한다'라는 제로섬 경쟁이 아니라 각 기술이 고유한 생태적 틈새를 차지하는 문제입니다.

다모형 대형 모델은 엄청난 능력을 가지고 있지만, 그들의 핵심 강점은깊은 의미 이해와 광범위한 일반화 ∼ 핵심 생산 검사 작업 흐름에 제한된 가치를 제공합니다.

한편, 높은 대기시간, 과도한 운영 비용과 불안정한 생산량은 산업 제조업이 용납할 수 없는 협상 불가능한 문제점입니다.

기술 선택의 본질은 최신 트렌드 기술을 추구하고 있는 것이 아니라, 실제 세계 시나리오 요구에 맞는 솔루션을 찾는 것입니다.

YOLO 시리즈는 수년 동안 산업 시각 검사를 통해 광범위하게 배포되어 왔으며 사실상의 표준으로서의 지위는 충분히 정당화됩니다.

다모형 대형 모델은 강력한 보조 도구이지만 현재 기술 성숙도에 따라 완전히 대체 할 수 없습니다.

아마도 3년 또는 5년 후에, 경관이 바뀔 것입니다. 추론 속도가 급격히 향상되고, 배포 비용이 급격히 감소하고, 결정론 문제는 완전히 해결될 것입니다.

그런 다음만 우리는 완전한 대체에 대한 토론을 다시 시작할 수 있습니다.

상품
뉴스 세부 정보
산업용 시각 검사: 다모형 대형 모델 의 매력
2026-06-26
Latest company news about 산업용 시각 검사: 다모형 대형 모델 의 매력
I. 유혹적 인 질문

GPT-4V가 2023년 초에 출시된 직후, 우리는 오랜 고객으로부터 전화를 받았습니다.

그는 가전제품 제조사의 기술 책임자로 일했습니다. 2년 전에 우리는 YOLOv5 기반의 표면 검사 시스템을그 이후로 안정적으로 작동하고 있었습니다..

그는 전화로 생각나게 하는 질문을 던졌습니다.

"나는 GPT-4V가 모든 종류의 이미지를 해석하고 거의 모든 것을 인식 할 수 있음을 보았습니다. 우리는 품질 검사를 위해 직접 채택 할 수 있습니까? 그것은 데이터 라벨의 필요성을 완전히 제거 할 수 있습니까?"

그 때 저는 직설적인 대답을 하지 않았습니다.

솔직히 말해서, 우리는 그 아이디어에 똑같이 매료되었습니다.

다중 모형 대형 모델의 데모는 의심 할 여지 없이 인상적입니다. 모델에 임의의 무작위 이미지를 입력하면 내용, 결함을 정확히 파악하고 결함 유형을 분류 할 수 있습니다.교육이나 표시가 필요하지 않습니다.; 그것은 상자 밖으로 제로 샷 성능을 제공합니다.

만약 이 기능이 공장으로도 완벽하게 적용된다면 산업 시각 검사의 전체 규칙책이 다시 쓰일 것입니다.

우리는 거의 2년 동안 다양한 다중모형 대형 모델 솔루션을 여러 프로젝트에서 테스트했습니다.

우리의 결론은 분명합니다. 기술이 유혹적으로 보일 수도 있지만 실제 산업용 응용은 엄격한 한계를 가지고 있습니다.

이 기사에서는 이 2년 동안 우리가 직면한 모든 함정을 기록합니다.

II. 현재의 풍경을 확립하라: YOLO는 사실상의 표준이 되었다

멀티모달 대형 모델에 뛰어들기 전에 산업의 기본 라인을 설정하는 것이 중요합니다.

오늘날 산업 시각 검사에 대한 지배적 솔루션은 YOLO 시리즈로 대표되는 객체 탐지 및 세분화 모델에 의존합니다.

이것은 새로운 경향은 아닙니다. YOLOv3에서 시작하여 널리 배포된 YOLOv8, YOLOv9 및 YOLOv10에 이르기까지 YOLO 가족은 수년 동안 산업 생산 라인에서 구현되었습니다.완전히 성숙한 기술 스택을 자랑.

에 대한 최신 회사 뉴스 산업용 시각 검사: 다모형 대형 모델 의 매력  0
왜 YOLO 가 사실상 표준 이 되었습니까?

첫째, 초고속 추론 속도

산업용 카메라와 결합된 표준 엣지 컴퓨팅 박스에 장착된 YOLOv8는 대부분의 생산 라인의 takt 시간과 일치하는 10 ~ 30 밀리 초 이내에 하나의 프레임에 대한 추론을 완료합니다.

둘째, 충분한 탐지 정확성.

적당한 표기된 데이터 세트를 사용하면 YOLO 시리즈는 일반적인 결함 범주에서 뛰어난 정확도를 달성하며 90% 이상의 mAP를 쉽게 달성합니다.

셋째, 성숙한 배포 생태계입니다.

준비된 툴 체인은 ONNX, TensorRT 및 OpenVINO를 포함한 여러 배포 프레임워크를 지원합니다.모델 훈련에서 현장 배치까지의 전체 작업 흐름은 수많은 산업 프로젝트에서 검증되었습니다..

넷째, 포괄적인 오픈소스 생태계입니다.

활발한 오픈소스 커뮤니티는 대부분의 기술적 장애물에 대한 접근 가능한 해결 방법을 제공하고 있으며, 풍부한 사전 훈련 된 무게, 데이터 증강 키트 및 라벨링 도구가 쉽게 제공됩니다.

따라서 YOLO 시리즈는 2024년에 시작되는 산업 시각 검사 프로젝트에 기본적으로 선택됩니다.

딥러닝을 채택해야 하는지에 대해 논쟁할 필요가 없습니다.

이제 새로운 핵심 질문이 제기됩니다. 멀티모델 대형 모델의 등장으로 YOLO는 여전히 최적의 솔루션으로 남아 있습니까?

III. 다모형 대형 모델 의 매력: 유망 한 환상

2023년에는 다모형 대형 모델 출시가 폭발적으로 증가했습니다.

GPT-4V, Gemini 및 Claude 3를 포함한 모델은 강력한 일반적인 이미지 이해 기능을 제공합니다.

에 대한 최신 회사 뉴스 산업용 시각 검사: 다모형 대형 모델 의 매력  1
우리는 이 모델들을 테스트했습니다. 솔직히 말해서, 그들의 데모 성능은 정말 인상적입니다.
매력 1: 무사격 능력

전통적인 작업 흐름: 특정 유형의 결함을 검사하려면 먼저 그 결함의 이미지를 수집하고 표시하고 훈련해야합니다. 데이터가 없다는 것은 사용할 수있는 모델이 없다는 것을 의미합니다.

멀티모델 대형 모델: 단순히 자연 언어로 요구사항을 설명해 주세요. 예를 들어 "이 이미지에 스크래치가 있는지 확인하세요".교육 또는 표시가 필요하지 않습니다..

이것은 무엇을 의미합니까? 냉동 시작 비용은 거의 0으로 떨어집니다.

새로운 제품을 출시할 때, 데이터 수집, 라벨링, 모델 훈련에 2주 동안의 시간을 할애할 필요가 없습니다. 몇 줄의 명령으로 모델을 사용할 수 있습니다.

매력 2: 고급 의미 이해

전통적인 모델은 경계 상자와 신뢰도 점수를 출력합니다. 예를 들어, 0.87의 신뢰도를 가진 이 상자 안에 결함이 있습니다.

다중 모형 대형 모델은 설명적인 자연 언어를 생성합니다: 사진의 왼쪽 상단 구석에 2cm 정도의 긁힘이 나타나고, 운송 중에 형성되었을 가능성이 있습니다.포장 과정을 최적화하는 것이 좋습니다.."

이것은 무엇을 의미합니까? 검사 결과는 공식 품질 검사 보고서로 직접 변환 될 수 있습니다.

매력 3: 강력 한 일반화 능력

전통적인 모델은 훈련 중에 보이는 결함 유형만을 인식할 수 있습니다. 완전히 새로운 보이지 않는 결함을 식별하는 데 실패합니다.

이론적으로, 멀티모델 대형 모델은 인터넷에서 얻은 거대한 이미지를 처리하여 모든 종류의 희귀하고 불규칙한 결함을 인식할 수 있습니다.

이것은 무엇을 의미합니까? 긴 꼬리 결함과 비정상적인 가장자리 경우의 커버링이 크게 향상되었습니다.

매력 4: 상호 작용 검사 논리

전통적인 해결책은 모델에 고정된 검사 규칙을 포함합니다. 검사 기준을 수정하려면 완전한 재교육이 필요합니다.

멀티모델 대형 모델은 명령어를 통해 표준의 동적 조정을 지원합니다. 예를 들어 1cm 이상의 스크래치가 NG로 계산되는 한 날로 문턱을 설정하고 0으로 전환할 수 있습니다.5cm" 다음 기본 모델을 수정하지 않고.

이것은 무엇을 의미합니까? 조정 검사 표준은 매우 유연합니다.

이 모든 장점을 읽고, 당신은 또한 유혹 될 수 있습니다. 바로 그 때 우리가 그랬던 것처럼. 그래서 우리는 여러 실제 프로젝트에 다중 모형 대형 모델을 배치하기로 결정했습니다.하지만 그 후에도 많은 걸로 걸려.

IV. 실용적 으로 배치 하는 데 에 직면 한 값비싼 여섯 가지 함정
함정 1: 생산 라인에 적합하지 않은 과도한 추론 지연

우리의 파일럿 프로젝트는 휴대전화 하우스의 외모 검사에 초점을 맞추었습니다.

생산 라인은 3초마다 하나의 작업 조각을 처리합니다. 즉, 로봇 분류에 1초를 할애하기 위해 전체 검사 지연시간이 2초 이하로 유지되어야 합니다.

우리는 GPT-4V API 워크플로우를 테스트했습니다.

  1. 이미지를 업로드하고 프롬프트를 입력
  2. 서버 응답을 기다립니다.
  3. 검사 결과

평균 지연시간은 4~6초에 달했고, 네트워크 변동 속에서는 10초를 초과할 수 있었습니다.

대신 LLaVA와 Qwen-VL 같은 자율적으로 호스팅된 오픈소스 멀티모델 모델을 제안할 수도 있습니다.A100 GPU에서 LLaVA-13B를 실행하면 대략 800ms에서 1의 단일 이미지 추론 지연이 발생합니다.0.2초

클라우드 API보다 빠르지만, YOLO보다 수십 배 더 느립니다.

함정 2: 급증 하는 처리량 및 컴퓨팅 비용

비록 논쟁을 위해 지연을 용인하더라도 비용 계산은 혹독한 이야기를 말해줍니다.

한 생산 라인은 하루에 몇 장의 이미지를 처리합니까?

3초마다 1개의 작업 부품을 20시간 동안 매일 작동한다고 가정하면, 하나의 라인은 하루에 약 24,000개의 검사 이미지를 생성합니다.

GPT-4V API의 경우, 단위 가격은 해상도와 토큰 소비에 따라 이미지당 0.01달러에서 0.03달러 사이였다:

  • 한 줄 당 일일 비용: $240~$720
  • 한 라인 월간 비용은 7,200달러 21달러600
  • 연간 비용: $86,400$259,200

이것은 단지 하나의 라인을 차지하고, 우리의 고객은 12개의 생산 라인을 운영했습니다. 제조업체가 감당할 수 없는 비용이었습니다.

자율적으로 호스팅된 오픈소스 모델은 어떨까요?

단일 A100 GPU는 대략 1 ∼ 2 QPS (초당 질의) 를 제공합니다. 단일 라인은 약 0.3 QPS로 최고치로, 여러 라인을 위해 하나의 카드로 관리 할 수 있습니다.

하지만 서버, IDC 공간, 유지보수 등을 고려하면 A100 배포에 대한 연간 운영 비용은 수십만 원에 달한다.

이와는 달리, YOLO 배포는 하나의 전체 생산 라인을 지원하기 위해 몇 천 RMB에 달하는 엣지 컴퓨팅 박스만 필요합니다.

비용 격차는 두 개의 규모를 차지합니다.

함정 3: 불안정하고 확률적인 출력

이것은 우리의 가장 좌절스러운 장벽이 되었습니다.

산업 검사는 절대적인 결정론을 요구합니다. 동일한 이미지는 항상 동일한 검사 결과를 가져야 합니다.그렇지 않으면 표준화 된 품질 관리 및 추적 가능성은 불가능합니다..

그러나 다모형 대형 모델은 확률적인 결과물을 생산합니다.

우리는 GPT-4V에 10번씩 동일한 결함된 이미지를 동일한 명령으로 전달했습니다. 결과는 크게 달라졌습니다.

  • 7회 출품된 제품 고장
  • 2 회로 표시 그것은 수동 검토를 필요로 결함이 의심
  • 1차례는 명백한 결함이 없다고 주장했다.

모두 같은 입력과 명령에서 온 것입니다.

이러한 무작위성은 공장 품질 통제에 치명적입니다. 검사자는 결함의 70%의 확률에 따라 행동 할 수 없습니다. 모든 작업 조각은 최종적인 OK 또는 NG 판결이 필요합니다.

어떤 사람들은 일관성을 위해 온도를 0으로 설정하는 것을 제안합니다. 우리는 이 방법을 시도했지만 안정성을 향상시켰지만 100%의 동일한 출력을 보장하지 못했습니다.큰 모델은 샘플링 메커니즘을 통해 결과를 생성합니다., 그리고 작은 오차는 온도 = 0에서도 가장자리 경우에 유지됩니다.

함정 4: 취약 한 신속 한 공학 ∼ 소소한 표현 변화 가 판단 을 변화 시킨다

다중모델 성능은 신속한 설계에 전적으로 의존합니다. 우리는 정확성과 안정성을 높이기 위해 광범위한 인력 최적화를 했습니다.

우리는 곧 문장 변경에 매우 민감하다는 것을 발견했습니다.

거의 동일한 핵심 요청을 가진 세 개의 요청은 매우 다른 검사 결과를 제공했습니다.

명령 A: 이 이미지에 표면 결함이 있는지 확인합니다. "

안내서 B: 제품 표면을 주의 깊게 검사하고 긁힘, 구멍, 외질 및 기타 결함을 확인하십시오. "

명령 C: "전문적 인 품질 검사자 처럼 행동 하십시오. 이 사진 에 있는 제품 의 외모 결함 을 찾아 분류 하십시오".

더 나쁜 것은 제품 A에 맞춰진 프롬프트가 제품 B에 적용되면 효능을 잃게 되고, 모든 새로운 제품 변종에 대한 프롬프트 논리를 완전히 재개해야 한다는 것입니다.

이것은 새로운 제품에 대한 YOLO 모델의 재교육과 어떻게 다릅니다?

YOLO 훈련은 모델이 표준을 충족할 때 명확하게 표시하기 위해 수치화 가능한 평가 메트릭에 의존합니다. 신속한 조정은 전적으로 주관적인 시행착오에 달려 있습니다.최적의 성능에 대한 명확한 기준이 없습니다..

함정 5: 환각 자신감 있게 존재하지 않는 결함을 만들어 내는 것

환각은 큰 언어와 다중 모형 모델의 잘 기록된 결함입니다. 시스템이 자신있게 존재하지 않는 세부 사항을 발명합니다.

산업 검사에서 이것은 세 가지 전형적인 실패로 나타납니다.

  1. 결함 없는 제품을 결함 있는 것으로 표시
  2. 결함 위치를 잘못 표시 (예: 오른쪽에 표시되는 경우 왼쪽에 스크래치를 찾습니다)
  3. 결함 유형을 잘못 분류 (예: 구멍을 긁힌 채로 표시)

한 실험 사례는 심각성을 예로 들 수 있습니다. 완전히 결함이 없는 제품 이미지는 매우 상세한 가공 분석을 유발합니다.아래 오른쪽 구석에서 약 3mm 길이의 얇은 긁힘이 감지됩니다., 기능적 영향 평가 권장됩니다".

자세히 살펴보면 그 지역에서 흔적이나 긁힘이 전혀 없었습니다.

이런 환각이 대량생산 라인에 침투하면 심각한 결과를 초래합니다.결함이 있는 상품이 검출되지 않은 채로 빠져나오거나 (검찰을 놓쳤거나) 자격을 갖춘 상품이 잘못 거부되었거나 (거짓 거절).

함정 6: 사설 현장 배치에 대한 높은 자원 장벽

클라우드 API가 높은 지연시간과 과도한 비용을 겪기 때문에 자체 호스팅 배포는 대안으로 보입니다. 우리는 주류 오픈 소스 멀티모달 모델에 대한 하드웨어 및 소프트웨어 요구 사항을 평가했습니다.

에 대한 최신 회사 뉴스 산업용 시각 검사: 다모형 대형 모델 의 매력  2
YOLO는 어때요?

YOLOv8-m는 8GB VRAM의 GTX 1080에서도 원활하게 실행됩니다.

그것은 단지 수십 와트의 전력 소비로 NVIDIA Jetson 모듈과 같은 엣지 컴퓨팅 하드웨어에 배치 될 수 있습니다.

계산 자원의 문턱은 전체 규모의 순서로 다릅니다.

대부분의 공장에서는 생산 층에 A100 서버를 설치하는 것이 자본 지출과 일상 운영 및 유지 보수 측면에서 실용적이지 않습니다.

V. 첫 번째 원칙으로 돌아가: 산업 시각 검사 는 정확히 무엇 을 요구 합니까?

위의 모든 함정에 걸려서 우리는 한 걸음 물러서서 근본적인 질문을 생각해 보았습니다.

산업 시각 검사에서 필수적으로 요구되는 핵심 기능은 무엇입니까?

  1. 결정적 결과물

    동일한 이미지는 100%의 일관성 결과를 가져야 합니다. 이것은 표준화 된 품질 관리와 완전한 추적성의 기초를 형성합니다. 확률적 출력은 허용되지 않습니다.

  2. 초저연속성

    밀리초 수준 반응. 생산 라인 takt 시간은 딱딱하고, 검사는 병목이 될 수 없습니다.

    10ms 추론 시간과 1,000ms 추론 시간은 완전히 다른 운영 현실을 나타냅니다.

  3. 높은 처리량

    초당 얼마나 많은 프레임을 처리 할 수 있습니까? 매일 얼마나 많은 작업 조각을 검사 할 수 있습니까?

    계산 비용은 통제 할 수 있어야 하며, 단일 생산 라인에 대한 수십만 달러의 연간 지출을 피해야합니다.

  4. 엣지 배포 호환성

    공장 네트워크 환경은 복잡합니다. 많은 작업실에는 안정적이거나 접근 가능한 인터넷 연결이 없습니다.

    모델은 클라우드 API에 의존하기보다는 엣지 디바이스에서 로컬로 작동해야 합니다.

  5. 해석 가능한 검사 결과

    결함이 발견되면 시스템에서 검사자에게 정확한 위치와 범위를 명확히 알려야 합니다.

    이상적으로, 그것은 하류 시스템 통합을 위해 결함 좌표, 지역 및 신뢰도 점수를 출력해야합니다.

  6. 통제 할 수 있는 유지보수 비용

    제품들은 업그레이드되고 검사 기준은 정기적으로 수정됩니다.

    각 반복에 대한 적응 비용은 매번 완전한 재구성 없이 관리되어야 합니다.

이 여섯 가지 핵심 요구사항을 두 가지 기술 경로와 비교하면 명확한 대조를 나타냅니다.

YOLO 시리즈는 여섯 가지 기준을 완벽하게 충족합니다.
  • 결정론: 동일한 입력값에 따라 100% 일관성 있는 출력
  • 낮은 지연시간: 10~30 밀리초 추론
  • 높은 처리량: 단일 GPU 당 수십 개에서 백 개 이상의 QPS
  • 엣지 배포 가능: 제트슨 하드웨어 및 산업용 PC와 완전히 호환됩니다.
  • 해석 가능한 출력: 경계 박스, 결함 범주 및 신뢰도 값
  • 낮은 유지보수 비용: 단계적 교육 및 전송 학습을 위한 성숙한 도구 체인
다모형 대형 모델은 거의 모든 요구 사항을 충족하지 못합니다.
  • 결정론: 본질적으로 확률적인 결과물
  • 지연 제한: 두 번째 규모 추론
  • 처리량 제한: 단일 GPU는 단자리 QPS만을 지원합니다.
  • 엣지 배포 장벽: A100 클래스 고급 GPU를 요구합니다
  • 해석성 격차: 원시 자연어 설명은 2차 분석이 필요합니다.
  • 예측할 수 없는 유지보수: 신속한 엔지니어링은 정량화 가능한 최적화 표준이 부족합니다.

그래서 다중 모형 대형 모델이 YOLO를 대체할 수 있을까요? 결론은 분명합니다.

현재 기술 성숙 단계에서는 다중 모형 대형 모델이 산업 시각 검사의 주요 솔루션으로 적합하지 않습니다.

제로샷 추론, 깊은 의미 이해 및 강한 일반화와 같은 강점은 생산 라인에서 실용적인 가치를 거의 제공하지 않습니다. 한편으로 중요한 결함막대한 비용과 불안정한 생산량은 산업 품질 통제에 치명적입니다..

VI. 대체 가 아니라 보완

이것은 다중 모형 대형 모델이 산업 시각 검사에 완전히 쓸모가 없다는 것을 의미하지는 않습니다.

핵심은 그들의 적절한 틈새를 파악하는 것입니다.

2년간의 현장실험 끝에 우리는 멀티모델 대형 모델이 실질적인 가치를 창출하는 네 가지 시나리오를 요약했습니다.

시나리오 1: 보조 자동 데이터 주석

설명은 전통적인 검사 프로젝트의 가장 큰 비용 운전자입니다.

산업 비전 작업은 일반적으로 수천에서 수만 개의 주석 이미지가 필요합니다. 주석 서비스를 아웃소싱하는 데에는 프레임 당 10분의 10에서 몇 달러가 소요됩니다.라벨링 비용은 전체 프로젝트 투자의 30%~50%를 차지합니다..

멀티모델 대형 모델은 사전 표시 기능을 제공합니다.

모델은 원료 이미지에서 먼저 사전 주석 마스크와 상자를 생성합니다. 인간 직원은 처음부터 라벨링 대신 결과를 검토하고 수정해야합니다.

우리의 현장 테스트는 이 작업 흐름이 주석의 효율성을 3~5배로 높이고, 이미지별 평균 표기 시간을 30초에서 10초 이하로 줄인다는 것을 증명했습니다.

시나리오 2: 긴 꼬리 결함에 대한 재복보장

YOLO 모델의 성능 최고값은 간단합니다. 그들은 훈련 데이터 세트에 등장하는 결함 유형만을 인식할 수 있습니다.

유례없는 희귀 결함이 YOLO에 의해 발견을 놓칠 것입니다.

이러한 긴 꼬리 이상 현상은 드물게 발생하지만 종종 심각한 비정상적인 제조 조건을 나타내고 더 높은 운영 위험을 초래합니다.

멀티모델 대형 모델은 재발 검증 계층으로 작용합니다.

YOLO가 경계 신뢰도 점수를 출력하면 (약 0.3~0.7, 불확실성의 회색 구역), 해당 이미지는 2차 판단을 위해 다중 모형 모델로 전송됩니다.

큰 모델의 제로 샷 일반화 강도는 눈에 보이지 않는 희귀한 이상 현상을 덮습니다.

이 메커니즘에 따라 모든 이미지의 5%~10%만이 멀티모달 모델로 전송되며 전체 비용을 관리 할 수 있으며 긴 꼬리 결함의 커버리지를 획기적으로 향상시킵니다.

시나리오 3: 원시 검사 데이터의 의미 변환

YOLO는 구조화된 데이터만 출력합니다. 경계 박스, 결함 범주, 신뢰도 점수.

백엔드 산업 시스템에는 이러한 원시 측정값이 충분하지만, 실제적인 질문에 대한 답을 필요로 하는 인간 검사자들에게는 직관적이지 않습니다.어떤 시정 조치 를 취해야 합니까??

멀티모델 대형 모델은 의미적인 보고서 생성 작업을 수행합니다.

입력: 결함 좌표, 분류 라벨, 제품 모델 및 제조 공정 매개 변수

출력: 자연어 검사 보고서, 예를 들어 제품 왼쪽 가장자리에 5mm의 스크래치가 감지되며, 곰팡이 가열로 인해 발생할 가능성이 있습니다. 곰팡이 유지 관리가 권장됩니다. "

이 작업은 대기시간에 민감하지 않습니다 (보고는 비동기적으로 생성 될 수 있습니다) 그리고 비용 효율적입니다 (한정된 볼륨의 NG 비상응 제품에서만 실행됩니다).

시나리오 4: 소규모 긴급 프로젝트의 빠른 냉동 시작

고객들은 때때로 긴 시한에 직면합니다. 다음 주에 대량 생산 예정된 새로운 제품들은 단지 수십 개의 결함된 샘플 이미지로, 완전한 YOLO 교육을 위해 충분하지 않습니다.

전통적인 작업 흐름은 이렇게 제한된 데이터로 검사를 시작할 수 없습니다.

멀티모델 대형 모델은 일시적인 과도한 해결책입니다.

제로 샷 능력은 수용 가능하지만 불완전한 정확도로 즉각적인 배포를 가능하게 하며, 완전한 수동 검사를 훨씬 능가합니다.충분한 샘플이 축적되면 장기 사용을위한 공식적인 YOLO 모델을 훈련하기 위해 파일럿 운영 중에 데이터를 지속적으로 수집 할 수 있습니다..

VII. 하이브리드 아키텍처: 우리의 실용적 배포 패러다임

위의 분석을 바탕으로 우리는 최근 산업 프로젝트에서 하이브리드 듀얼 채널 아키텍처를 채택했습니다.

주요 검사 채널: YOLO
  • 모든 검사 작업량의 95% 이상을 처리합니다.
  • 엣지 하드웨어에 로컬로 배포되어 10~20ms 추론 지연
  • 출력 구조적 경계 상자, 결함 유형 및 신뢰도 점수
보조 채널: 멀티모델 대형 모델
  • 회색 영역 내에서 낮은 신뢰도의 경계 이미지를 처리합니다.
  • 주선 처리량을 방해하지 않고 비동기적으로 호출
  • 롱테일 결함 재발 검증, 시맨틱 보고서 생성 및 보조 라벨링 기능

이 하이브리드 프레임워크의 기본 설계 원칙:

  1. YOLO는 핵심 기본 시스템으로 작용합니다. 다중 모형 모델은 보조 도구로 사용됩니다.
  2. 일련 처리 대신 데이터 셔팅: 다중 모형 모델은 중요한 생산 경로에서 벗어나 주요 라인 지연이나 처리량에 영향을 미치지 않습니다.
  3. 신뢰성 기반의 트래픽 분할: 높은 신뢰성 결과가 직접 전달되며 모호한 샘플은 2차 다중 모달 검증을 위해 전송됩니다.
  4. 예측 가능한 비용 통제: 이미지의 작은 부분만이 다중 모형 컴퓨팅 자원을 소비합니다.
VIII. 기술 선택 결정 틀

아래는 산업 시각 검사 알고리즘을 선택하는 팀의 요약된 결정 나무입니다.

  1. 지연 시간 요구 사항
    • 필요한 추론 <100ms → YOLO를 선택
    • 두 번째 규모의 지연은 허용됩니다 → 다중 모형 대형 모델은 실행 가능합니다.
  2. 처리량 요구 사항
    • 초당 1 프레임 이상 → YOLO를 선택하세요
    • 매일 수백 장의 이미지가 처리됩니다 → 다중 모형 대형 모델은 실행 가능
  3. 배포 환경
    • 엣지 오프라인 배포가 필요합니다 → YOLO를 선택하세요
    • 안정적인 전용 클라우드 컴퓨팅 리소스가 사용 가능
  4. 데이터 가용성
    • 수 천 개의 주석 샘플이 준비되어 있습니다 → YOLO를 선택하세요
    • 긴급한 발사 일정에 수십 개의 샘플만 → 임시 전환으로 다중 모형 모델을 채택하십시오
  5. 예산 제약
    • 연간 단일 라인 운영 예산 100,000 RMB 이하 → YOLO를 선택
    • 풍부한 재정 예산 → 하이브리드 아키텍처가 권장됩니다

대부분의 산업 시나리오에서 YOLO는 최적의 선택으로 남아 있습니다.

멀티모델 대형 모델은 특정 조건에서만 기본 솔루션으로 적합합니다: 대기 허용, 낮은 처리량 수요, 안정적인 클라우드 컴퓨팅 지원 및 극심한 데이터 부족.

가장 실용적인 산업 솔루션은 하이브리드 아키텍처입니다.

  • YOLO는 핵심 실시간 검사 업무를 수행합니다.
  • 멀티모델 대형 모델은 주석, 재발 확인 및 자동 보고서 작성에 보조 가치를 제공합니다.
  • 비용 통제를 유지하면서 두 기술의 각각의 강점을 활용
결말 언급

처음 질문으로 돌아가면, 멀티모델 대형 모델이 YOLO를 대체할 수 있을까요?

2년간의 시행착오 끝에 결론은 분명합니다.

이건 잘못된 질문입니다.

이것은 'A가 B를 대체한다'라는 제로섬 경쟁이 아니라 각 기술이 고유한 생태적 틈새를 차지하는 문제입니다.

다모형 대형 모델은 엄청난 능력을 가지고 있지만, 그들의 핵심 강점은깊은 의미 이해와 광범위한 일반화 ∼ 핵심 생산 검사 작업 흐름에 제한된 가치를 제공합니다.

한편, 높은 대기시간, 과도한 운영 비용과 불안정한 생산량은 산업 제조업이 용납할 수 없는 협상 불가능한 문제점입니다.

기술 선택의 본질은 최신 트렌드 기술을 추구하고 있는 것이 아니라, 실제 세계 시나리오 요구에 맞는 솔루션을 찾는 것입니다.

YOLO 시리즈는 수년 동안 산업 시각 검사를 통해 광범위하게 배포되어 왔으며 사실상의 표준으로서의 지위는 충분히 정당화됩니다.

다모형 대형 모델은 강력한 보조 도구이지만 현재 기술 성숙도에 따라 완전히 대체 할 수 없습니다.

아마도 3년 또는 5년 후에, 경관이 바뀔 것입니다. 추론 속도가 급격히 향상되고, 배포 비용이 급격히 감소하고, 결정론 문제는 완전히 해결될 것입니다.

그런 다음만 우리는 완전한 대체에 대한 토론을 다시 시작할 수 있습니다.

사이트맵 |  개인 정보 정책 | 중국 좋은 품질 병든 레이저 센서 공급업체. 저작권 © 2025-2026 Xiamen ZhiCheng Automation Technology Co., Ltd . 판권 소유.