El foso más duro de la visión automática se encuentra en dígitos más allá del punto decimal
Hace poco vi un video sobre visión artificial, con un titular que me hizo pensar:"Los principios son un conocimiento común, sin embargo, la precisión sigue siendo difícil de igualar en todo el país".
Para ser honesto, al principio pensé que era solo otro cliché que afirmaba que "China no puede alcanzar". Después de mirar a través, me di cuenta de que la historia es mucho más matizada.
Cuando se trata de la visión artificial, todo el mundo entiende el principio básico de simplemente usar una cámara para capturar imágenes y ejecutar algoritmos para el reconocimiento.y los tutoriales sobre aprendizaje profundo están en todas partesParece que cualquiera puede construir una solución de visión automática.
Pero una vez que pisas las fábricas y las líneas de producción, ves una enorme brecha entre construir un sistema funcional y construir uno excelente.
Se reduce a los dígitos después del punto decimal.
Primero establezcamos un marco de referencia intuitivo:
Un cabello humano mide aproximadamente 0,1 milímetros, lo que equivale a 100 micrómetros.Eso ya suena impresionante..
Sin embargo, la fabricación de gama alta exige tolerancias mucho más estrictas, no sólo de 10 μm, ni siquiera de 1 μm:
Si cortamos un solo cabello humano horizontalmente en 1.000 segmentos, cada segmento mide 0,1 μm.
En este nivel de precisión, los detalles rutinariamente pasados por alto en condiciones normales se convierten en fuentes fatales de error:
La línea divisoria entre los ingenieros experimentados de visión artificial y los aficionados no es si los defectos pueden ser identificados,Pero si la precisión puede ser fijada constantemente en esos valores decimales a través de decenas de miles de ciclos de inspección.
Una cámara industrial no es nada como una cámara de smartphone.
Muchas personas creen erróneamente que los algoritmos forman el núcleo de la visión artificial.
El límite superior de cualquier algoritmo se define por el rendimiento del hardware. Ningún algoritmo, por más sofisticado que sea, puede lograr una precisión submicrona con una cámara de consumo que cueste unos cientos de yuanes.Es comparable a intentar fotografiar células bajo un microscopio usando una cámara de un teléfono móvil. Las imágenes borrosas no se pueden recuperar..
Una pila completa de hardware de visión industrial consta de al menos cuatro capas: fuentes de luz, lentes, cámaras y grabadores de fotogramas, cada una de las cuales requiere una optimización rigurosa.
El parámetro más crítico para las cámaras industriales no es el número de píxeles, sinotamaño de píxel.
Las cámaras de los teléfonos inteligentes de consumo persiguen cifras de megapixeles altas. Un sensor de 100 megapixeles suena convincente, sin embargo, los píxeles individuales pueden ser sólo 0,8 μm o más pequeños.ruido elevado y rango dinámico limitadoAunque son adecuados para el embellecimiento de retratos, son inadecuados para la inspección industrial.
Las cámaras industriales siguen la lógica de diseño opuesta. Los sensores industriales de gama alta suelen tener tamaños de píxeles superiores a 2,5 μm, y a veces de 5 μm o 10 μm. Los píxeles más grandes capturan más fotones, y los más grandes capturan más fotones.proporcionando imágenes más limpias y mediciones más estables.
Otra especificación crítica esprofundidad de los píxelesLas fotografías de consumo ordinarias adoptan una codificación de 8 bits con 256 niveles de escala de grises..La diferencia puede parecer marginal a primera vista, sin embargo, los cálculos de precisión de subpíxeles se basan enteramente en esta rica información de escala de grises.
Si la cámara define la precisión mínima alcanzable, la lente determina la máxima precisión potencial.
Las imágenes captadas con lentes ordinarias muestran distorsiones de borde: las líneas rectas parecen curvas.Sin embargo, se vuelve catastrófico para la medición de visión de máquina a nivel de micrones.
Para la inspección industrial de gama alta,Lentes telecéntricasEn un rango de funcionamiento definido, el sistema de control de velocidad de la luz se utiliza en lugar de la óptica convencional.Las lentes telecéntricas mantienen un aumento constante independientemente de la distancia del objeto y alcanzan tasas de distorsión de hasta varias decenas de milésimas o menosEn cuanto al precio, una lente telecéntrica de primera calidad suele costar más que la cámara industrial asociada con ella.
En la actualidad, las marcas internacionales todavía dominan el mercado nacional de lentes industriales de alta precisión.
Una conocida máxima de la industria dice: "En la visión automática, la iluminación representa el 70% del éxito, los algoritmos sólo el 30%".
Muchos desafíos de inspección no provienen de algoritmos defectuosos, sino de la falta de iluminación adecuada de los defectos para obtener imágenes claras.
El ángulo de luz, la longitud de onda, la uniformidad y la estabilidad determinan la calidad final de la imagen.
Los fabricantes nacionales capaces de producir en masa de forma estable fuentes de luz especiales de gama alta, como las de iluminación UV profunda, siguen siendo escasos; la mayoría de los suministros siguen dependiendo de las importaciones.
El hardware establece el rendimiento de referencia, mientras que los algoritmos desbloquean todo el potencial del hardware.Precisión de los subpixeles.
¿Qué es exactamente la precisión de subpixel?
La unidad fundamental de una imagen digital es un píxel, cuando el borde de un componente cruza un límite de píxel, los algoritmos tradicionales sólo pueden confirmar que el borde está en algún lugar dentro de ese píxel,limitada a una resolución de píxeles enteros.
Los algoritmos de subpíxeles aprovechan las variaciones graduales de escala de grises y el modelado matemático para deducir la posición exacta del borde dentro de un solo píxel.
La precisión alcanzada varía según el algoritmo:
¿Qué significa 0.01 píxeles en la práctica? Supongamos que un píxel corresponde a una dimensión física de 10 μm. Una precisión de 0.01 píxeles se traduce en un error de medición de 0,1 μm, o 100 nanómetros.Sin actualizar el hardware, los algoritmos por sí solos aumentan la precisión por un factor de 100.
Por impresionante que parezca, esta tecnología no es un secreto, pues la teoría subyacente surgió hace décadas, con abundantes trabajos académicos y código de código abierto disponibles al público.
La precisión citada en los trabajos de investigación se mide en condiciones de laboratorio ideales.
Mantener una precisión estable hasta dos decimales bajo condiciones tan caóticas representa un auténtico dominio de la ingeniería.
Esta capa forma el verdadero foso competitivo.
Muchos forasteros simplifican la visión artificial como "instalar una cámara y escribir algunos algoritmos".Las soluciones de visión de máquina construidas para diferentes industrias son esencialmente tecnologías distintas.
Los sectores de aplicación adicionales incluyen la energía fotovoltaica, la fabricación de automóviles, los productos farmacéuticos y el procesamiento de alimentos.
Los esquemas ópticos, las arquitecturas de algoritmos, las estructuras de equipos mecánicos y los estándares de validación difieren drásticamente entre las verticales.La experiencia adquirida en electrónica 3C ofrece pocas ventajas al entrar en la fabricación de semiconductoresLa maestría en estos dominios requiere al menos ocho a diez años de acumulación industrial.
Por lo tanto, la principal barrera en la visión artificial no es una tecnología aislada, sino capacidades integradas que abarcan la óptica, la maquinaria, la electrónica, los algoritmos y el conocimiento de procesos verticales.Ningún eslabón puede ser descuidado.
Los mercados de gama media a baja están en gran medida conquistados; los segmentos de gama alta siguen en activo desarrollo.
Para resumir: los proveedores nacionales se han asegurado un terreno sólido en los mercados de nivel medio que abarcan la electrónica 3C, la energía fotovoltaica y el embalaje de alimentos.I-TEK OptoElectronics y TZTEK ofrecen cámaras industriales y sistemas de visión competitivos a aproximadamente un tercio a la mitad del precio de las alternativas importadas, que cumple plenamente las exigencias de inspección estándar.
Fundado por el Dr. Dong Ning de la Universidad de Ciencia y Tecnología de China,I-TEK OptoelectrónicaChina desarrolló la primera cámara industrial de escaneo de línea 8K producida en el país en 2012, llenando un vacío doméstico crítico.Desde entonces, la empresa ha lanzado cámaras de escaneo de línea de 16K y cámaras enfriadas termoeléctricamente de 150 megapíxeles., ganándose un asiento en la mesa mundial para el hardware de imagen industrial de alta gama.
TZTEKalcanza una precisión de inspección de 0,3 μm para productos electrónicos de consumo, igualando las ofertas de primer nivel de Hexagon y Keyence.la eliminación del monopolio de larga data del ELK.
Sin embargo, persisten importantes lagunas en los campos de gama alta, en particular en la inspección de semiconductores front-end.
Estas limitaciones superpuestas crean el patrón actual del mercado: dificultad para penetrar en los sectores de gama alta, mientras que la feroz competencia de precios domina los mercados de nivel medio.
Volviendo al título del video:"Los principios son un conocimiento común, sin embargo, la precisión sigue siendo difícil de igualar en todo el país".
Las teorías de los algoritmos de subpíxeles, la óptica telecéntrica, el control de movimiento de precisión están documentadas en los libros de texto.El verdadero reto radica en traducir la teoría en productos industriales estables, fijando la precisión confiablemente a esos valores decimales, y reduciendo los costos a niveles asequibles para los fabricantes.
La industria de la visión automática no tiene espacio para descubrimientos revolucionarios de la noche a la mañana o para tecnologías de "bala de plata" que conquisten todo.
Sus barreras competitivas están incrustadas en miles de detalles sutiles:
Dichas ideas rara vez se publican en artículos académicos o se revelan completamente en patentes.
La industria de la visión artificial de China se ha desarrollado en más de dos décadas: desde la completa dependencia de las importaciones, hasta la completa sustitución interna en los segmentos de gama media a baja,y ahora avances incrementales en el extremo superiorEl progreso ha sido arduo, pero la dirección es clara.
Después de todo, esas pequeñas brechas después del punto decimal sólo pueden cerrarse a través de avances constantes e incrementales.
El foso más duro de la visión automática se encuentra en dígitos más allá del punto decimal
Hace poco vi un video sobre visión artificial, con un titular que me hizo pensar:"Los principios son un conocimiento común, sin embargo, la precisión sigue siendo difícil de igualar en todo el país".
Para ser honesto, al principio pensé que era solo otro cliché que afirmaba que "China no puede alcanzar". Después de mirar a través, me di cuenta de que la historia es mucho más matizada.
Cuando se trata de la visión artificial, todo el mundo entiende el principio básico de simplemente usar una cámara para capturar imágenes y ejecutar algoritmos para el reconocimiento.y los tutoriales sobre aprendizaje profundo están en todas partesParece que cualquiera puede construir una solución de visión automática.
Pero una vez que pisas las fábricas y las líneas de producción, ves una enorme brecha entre construir un sistema funcional y construir uno excelente.
Se reduce a los dígitos después del punto decimal.
Primero establezcamos un marco de referencia intuitivo:
Un cabello humano mide aproximadamente 0,1 milímetros, lo que equivale a 100 micrómetros.Eso ya suena impresionante..
Sin embargo, la fabricación de gama alta exige tolerancias mucho más estrictas, no sólo de 10 μm, ni siquiera de 1 μm:
Si cortamos un solo cabello humano horizontalmente en 1.000 segmentos, cada segmento mide 0,1 μm.
En este nivel de precisión, los detalles rutinariamente pasados por alto en condiciones normales se convierten en fuentes fatales de error:
La línea divisoria entre los ingenieros experimentados de visión artificial y los aficionados no es si los defectos pueden ser identificados,Pero si la precisión puede ser fijada constantemente en esos valores decimales a través de decenas de miles de ciclos de inspección.
Una cámara industrial no es nada como una cámara de smartphone.
Muchas personas creen erróneamente que los algoritmos forman el núcleo de la visión artificial.
El límite superior de cualquier algoritmo se define por el rendimiento del hardware. Ningún algoritmo, por más sofisticado que sea, puede lograr una precisión submicrona con una cámara de consumo que cueste unos cientos de yuanes.Es comparable a intentar fotografiar células bajo un microscopio usando una cámara de un teléfono móvil. Las imágenes borrosas no se pueden recuperar..
Una pila completa de hardware de visión industrial consta de al menos cuatro capas: fuentes de luz, lentes, cámaras y grabadores de fotogramas, cada una de las cuales requiere una optimización rigurosa.
El parámetro más crítico para las cámaras industriales no es el número de píxeles, sinotamaño de píxel.
Las cámaras de los teléfonos inteligentes de consumo persiguen cifras de megapixeles altas. Un sensor de 100 megapixeles suena convincente, sin embargo, los píxeles individuales pueden ser sólo 0,8 μm o más pequeños.ruido elevado y rango dinámico limitadoAunque son adecuados para el embellecimiento de retratos, son inadecuados para la inspección industrial.
Las cámaras industriales siguen la lógica de diseño opuesta. Los sensores industriales de gama alta suelen tener tamaños de píxeles superiores a 2,5 μm, y a veces de 5 μm o 10 μm. Los píxeles más grandes capturan más fotones, y los más grandes capturan más fotones.proporcionando imágenes más limpias y mediciones más estables.
Otra especificación crítica esprofundidad de los píxelesLas fotografías de consumo ordinarias adoptan una codificación de 8 bits con 256 niveles de escala de grises..La diferencia puede parecer marginal a primera vista, sin embargo, los cálculos de precisión de subpíxeles se basan enteramente en esta rica información de escala de grises.
Si la cámara define la precisión mínima alcanzable, la lente determina la máxima precisión potencial.
Las imágenes captadas con lentes ordinarias muestran distorsiones de borde: las líneas rectas parecen curvas.Sin embargo, se vuelve catastrófico para la medición de visión de máquina a nivel de micrones.
Para la inspección industrial de gama alta,Lentes telecéntricasEn un rango de funcionamiento definido, el sistema de control de velocidad de la luz se utiliza en lugar de la óptica convencional.Las lentes telecéntricas mantienen un aumento constante independientemente de la distancia del objeto y alcanzan tasas de distorsión de hasta varias decenas de milésimas o menosEn cuanto al precio, una lente telecéntrica de primera calidad suele costar más que la cámara industrial asociada con ella.
En la actualidad, las marcas internacionales todavía dominan el mercado nacional de lentes industriales de alta precisión.
Una conocida máxima de la industria dice: "En la visión automática, la iluminación representa el 70% del éxito, los algoritmos sólo el 30%".
Muchos desafíos de inspección no provienen de algoritmos defectuosos, sino de la falta de iluminación adecuada de los defectos para obtener imágenes claras.
El ángulo de luz, la longitud de onda, la uniformidad y la estabilidad determinan la calidad final de la imagen.
Los fabricantes nacionales capaces de producir en masa de forma estable fuentes de luz especiales de gama alta, como las de iluminación UV profunda, siguen siendo escasos; la mayoría de los suministros siguen dependiendo de las importaciones.
El hardware establece el rendimiento de referencia, mientras que los algoritmos desbloquean todo el potencial del hardware.Precisión de los subpixeles.
¿Qué es exactamente la precisión de subpixel?
La unidad fundamental de una imagen digital es un píxel, cuando el borde de un componente cruza un límite de píxel, los algoritmos tradicionales sólo pueden confirmar que el borde está en algún lugar dentro de ese píxel,limitada a una resolución de píxeles enteros.
Los algoritmos de subpíxeles aprovechan las variaciones graduales de escala de grises y el modelado matemático para deducir la posición exacta del borde dentro de un solo píxel.
La precisión alcanzada varía según el algoritmo:
¿Qué significa 0.01 píxeles en la práctica? Supongamos que un píxel corresponde a una dimensión física de 10 μm. Una precisión de 0.01 píxeles se traduce en un error de medición de 0,1 μm, o 100 nanómetros.Sin actualizar el hardware, los algoritmos por sí solos aumentan la precisión por un factor de 100.
Por impresionante que parezca, esta tecnología no es un secreto, pues la teoría subyacente surgió hace décadas, con abundantes trabajos académicos y código de código abierto disponibles al público.
La precisión citada en los trabajos de investigación se mide en condiciones de laboratorio ideales.
Mantener una precisión estable hasta dos decimales bajo condiciones tan caóticas representa un auténtico dominio de la ingeniería.
Esta capa forma el verdadero foso competitivo.
Muchos forasteros simplifican la visión artificial como "instalar una cámara y escribir algunos algoritmos".Las soluciones de visión de máquina construidas para diferentes industrias son esencialmente tecnologías distintas.
Los sectores de aplicación adicionales incluyen la energía fotovoltaica, la fabricación de automóviles, los productos farmacéuticos y el procesamiento de alimentos.
Los esquemas ópticos, las arquitecturas de algoritmos, las estructuras de equipos mecánicos y los estándares de validación difieren drásticamente entre las verticales.La experiencia adquirida en electrónica 3C ofrece pocas ventajas al entrar en la fabricación de semiconductoresLa maestría en estos dominios requiere al menos ocho a diez años de acumulación industrial.
Por lo tanto, la principal barrera en la visión artificial no es una tecnología aislada, sino capacidades integradas que abarcan la óptica, la maquinaria, la electrónica, los algoritmos y el conocimiento de procesos verticales.Ningún eslabón puede ser descuidado.
Los mercados de gama media a baja están en gran medida conquistados; los segmentos de gama alta siguen en activo desarrollo.
Para resumir: los proveedores nacionales se han asegurado un terreno sólido en los mercados de nivel medio que abarcan la electrónica 3C, la energía fotovoltaica y el embalaje de alimentos.I-TEK OptoElectronics y TZTEK ofrecen cámaras industriales y sistemas de visión competitivos a aproximadamente un tercio a la mitad del precio de las alternativas importadas, que cumple plenamente las exigencias de inspección estándar.
Fundado por el Dr. Dong Ning de la Universidad de Ciencia y Tecnología de China,I-TEK OptoelectrónicaChina desarrolló la primera cámara industrial de escaneo de línea 8K producida en el país en 2012, llenando un vacío doméstico crítico.Desde entonces, la empresa ha lanzado cámaras de escaneo de línea de 16K y cámaras enfriadas termoeléctricamente de 150 megapíxeles., ganándose un asiento en la mesa mundial para el hardware de imagen industrial de alta gama.
TZTEKalcanza una precisión de inspección de 0,3 μm para productos electrónicos de consumo, igualando las ofertas de primer nivel de Hexagon y Keyence.la eliminación del monopolio de larga data del ELK.
Sin embargo, persisten importantes lagunas en los campos de gama alta, en particular en la inspección de semiconductores front-end.
Estas limitaciones superpuestas crean el patrón actual del mercado: dificultad para penetrar en los sectores de gama alta, mientras que la feroz competencia de precios domina los mercados de nivel medio.
Volviendo al título del video:"Los principios son un conocimiento común, sin embargo, la precisión sigue siendo difícil de igualar en todo el país".
Las teorías de los algoritmos de subpíxeles, la óptica telecéntrica, el control de movimiento de precisión están documentadas en los libros de texto.El verdadero reto radica en traducir la teoría en productos industriales estables, fijando la precisión confiablemente a esos valores decimales, y reduciendo los costos a niveles asequibles para los fabricantes.
La industria de la visión automática no tiene espacio para descubrimientos revolucionarios de la noche a la mañana o para tecnologías de "bala de plata" que conquisten todo.
Sus barreras competitivas están incrustadas en miles de detalles sutiles:
Dichas ideas rara vez se publican en artículos académicos o se revelan completamente en patentes.
La industria de la visión artificial de China se ha desarrollado en más de dos décadas: desde la completa dependencia de las importaciones, hasta la completa sustitución interna en los segmentos de gama media a baja,y ahora avances incrementales en el extremo superiorEl progreso ha sido arduo, pero la dirección es clara.
Después de todo, esas pequeñas brechas después del punto decimal sólo pueden cerrarse a través de avances constantes e incrementales.