Il fosso crudele della visione artificiale si trova nelle cifre oltre il punto decimale
Recentemente ho visto un video sulla visione artificiale, con un titolo stimolante:"I principi sono di comune conoscenza, ma la precisione rimane difficile da raggiungere in tutto il paese".
Ad essere onesti, all'inizio ho pensato fosse solo un altro cliché che affermava "La Cina non può raggiungere". Dopo aver guardato attraverso, ho capito che la storia è molto più sfumata.
Quando si tratta di visione artificiale, tutti capiscono il principio di base: basta usare una fotocamera per catturare immagini e eseguire algoritmi per il riconoscimento.E i tutorial sul deep learning sono ovunque.Sembra che chiunque possa costruire una soluzione di visione artificiale.
Ma una volta che si entra nelle fabbriche e nelle linee di produzione, si vede un enorme divario tra costruire un sistema funzionale e costruire uno eccellente.
Si riduce alle cifre dopo il punto decimale.
Per prima cosa, stabiliamo un quadro di riferimento intuitivo:
Un capello umano è di circa 0,1 millimetri, equivalente a 100 micrometri.Sembra già impressionante..
Tuttavia, la fabbricazione di alta gamma richiede tolleranze molto più strette, non soltanto di 10 μm, né nemmeno di 1 μm:
Se tagliate un singolo capello umano orizzontalmente in 1000 segmenti, ogni segmento misura 0,1 μm.
A questo livello di precisione, i dettagli di routine trascurati in condizioni normali diventano fonti di errore fatali:
La linea di demarcazione tra ingegneri esperti di visione artificiale e dilettanti non è se i difetti possono essere identificati,ma se la precisione può essere costantemente bloccata su quei valori decimali attraverso decine di migliaia di cicli di ispezione.
Una telecamera industriale non e' affatto come una telecamera per smartphone.
Molte persone credono erroneamente che gli algoritmi costituiscano il nucleo della visione artificiale.
Il limite superiore di qualsiasi algoritmo è definito dalle prestazioni dell'hardware. Nessun algoritmo, per quanto sofisticato, può raggiungere una precisione sotto-microna con una fotocamera di consumo che costa poche centinaia di yuan.È paragonabile a cercare di fotografare le cellule sotto un microscopio usando una fotocamera di un telefono cellulare.
Un hardware completo di visione industriale è costituito da almeno quattro strati: sorgenti luminose, lenti, fotocamere e grabbatori di fotogrammi, ognuno dei quali richiede un'ottimizzazione rigorosa.
Il parametro più critico per le fotocamere industriali non è il numero di pixel, madimensione dei pixel.
Le fotocamere degli smartphone di consumo perseguono cifre di megapixel elevate. Un sensore da 100 megapixel suona convincente, ma i singoli pixel possono essere solo 0,8 μm o più piccoli.rumore elevato e gamma dinamica limitataSebbene siano adatti per l'abbellimento dei ritratti, non sono adatti per l'ispezione industriale.
Le fotocamere industriali seguono la logica di progettazione opposta. I sensori industriali di fascia alta presentano in genere dimensioni di pixel superiori a 2,5 μm e talvolta 5 μm o 10 μm. I pixel più grandi catturano più fotoni, mentre i pixel più grandi catturano più fotoni.fornire immagini più pulite e misurazioni più stabili.
Un'altra specifica critica èprofondità dei pixelLe foto di consumo ordinarie adottano una codifica a 8 bit con 256 livelli di scala di grigi..La differenza può sembrare marginale a prima vista, ma i calcoli di precisione dei subpixel si basano interamente su queste ricche informazioni sulla scala dei grigi.
Se la fotocamera definisce la precisione minima raggiungibile, l'obiettivo determina la massima precisione potenziale.
Le immagini catturate con lenti ordinarie presentano una distorsione dei bordi: le linee rette appaiono curve.Eppure diventa catastrofico per la misurazione della visione artificiale a livello di micron.
Per ispezioni industriali di alta gamma,lenti telecentrichesono utilizzati al posto dell'ottica convenzionale.le lenti telecentriche mantengono un ingrandimento costante indipendentemente dalla distanza dell'oggetto e raggiungono tassi di distorsione fino a diversi decimilaesimi o inferioriPer quanto riguarda il prezzo, un obiettivo telecentrico premium costa spesso più della fotocamera industriale associata.
Attualmente, i marchi internazionali dominano ancora il mercato nazionale delle lenti industriali ad alta precisione.
Una nota massima del settore dice: "Nella visione artificiale, l'illuminazione rappresenta il 70% del successo, gli algoritmi solo il 30%".
Molte sfide di ispezione non derivano da algoritmi difettosi, ma dal fallimento di illuminare correttamente i difetti per ottenere immagini chiare.
L'angolazione della luce, la lunghezza d'onda, l'uniformità e la stabilità determinano la qualità finale dell'immagine.
I produttori nazionali in grado di produrre in serie in modo stabile fonti luminose specializzate di fascia alta, come le luci UV profonde, rimangono scarsi; la maggior parte delle forniture dipende ancora dalle importazioni.
L'hardware stabilisce le prestazioni di base, mentre gli algoritmi sbloccano il pieno potenziale dell'hardware.precisione in sottopixel.
Cos'e' esattamente la precisione dei subpixel?
L'unità fondamentale di un'immagine digitale è un pixel.limitata alla risoluzione di pixel interi.
Gli algoritmi subpixel sfruttano le variazioni graduali della scala dei grigi e la modellazione matematica per dedurre la posizione esatta del bordo all'interno di un singolo pixel.
La precisione raggiungibile varia a seconda dell'algoritmo:
Qual è il significato pratico di 0,01 pixel? Supponiamo che un pixel corrisponda a una dimensione fisica di 10 μm. Una precisione di 0,01 pixel si traduce in un errore di misura di 0,1 μm, o 100 nanometri.Senza aggiornamento hardware, gli algoritmi da soli aumentano la precisione di un fattore 100.
Per quanto possa sembrare impressionante, questa tecnologia non è certo un segreto: la teoria alla base è emersa decenni fa, con abbondanti articoli accademici e codice open source accessibili al pubblico.
La precisione citata in articoli di ricerca è misurata in condizioni di laboratorio ideali.
Il mantenimento di una precisione stabile fino a due decimali in condizioni così caotiche rappresenta una vera maestria ingegneristica.
Questo strato costituisce il vero fossato competitivo.
Molti estranei semplificano la visione artificiale come "installare una telecamera e scrivere degli algoritmi".Le soluzioni di visione artificiale create per diversi settori sono tecnologie essenzialmente distinte.
Altri settori di applicazione includono il fotovoltaico, la produzione automobilistica, i prodotti farmaceutici e la trasformazione alimentare.
Gli schemi ottici, le architetture degli algoritmi, le strutture delle apparecchiature meccaniche e gli standard di convalida differiscono drasticamente tra i settori verticali.L'esperienza acquisita nell'elettronica 3C offre pochi vantaggi quando si entra nella produzione di semiconduttoriLa padronanza di questi domini richiede almeno otto o dieci anni di accumulazione industriale.
Pertanto, l'ostacolo principale nella visione artificiale non è una singola tecnologia isolata, ma capacità integrate che coprono l'ottica, i macchinari, l'elettronica, gli algoritmi e il know-how dei processi verticali.Nessun anello può essere trascurato.
I mercati di fascia media-bassa sono ampiamente conquistati; i segmenti di fascia alta continuano a svilupparsi attivamente.
Per riassumere: i fornitori nazionali si sono assicurati un terreno solido nei mercati di fascia media che coprono elettronica 3C, fotovoltaica e imballaggi alimentari.I-TEK OptoElectronics e TZTEK forniscono macchine fotografiche industriali e sistemi di visione competitivi a circa un terzo o la metà del prezzo delle alternative importate, che soddisfano pienamente le esigenze di ispezione standard.
Fondata dal dottor Dong Ning dell'Università di Scienza e Tecnologia della Cina,I-TEK Optoelectronicsha sviluppato la prima fotocamera industriale a scansione lineare 8K prodotta in Cina nel 2012, riempiendo un vuoto critico interno.Da allora l'azienda ha lanciato telecamere a scansione lineare da 16K e telecamere raffreddate termoelettricamente da 150 megapixel., guadagnandosi un posto al tavolo globale per l'hardware di imaging industriale di fascia alta.
TZTEKraggiunge una precisione di ispezione di 0,3 μm per l'elettronica di consumo, pari alle migliori offerte di Hexagon e Keyence.riducendo il monopolio di lunga data dell'UCK.
Tuttavia, persistono notevoli lacune nei settori di fascia alta, in particolare nell'ispezione dei semiconduttori front-end.
Questi vincoli che si sovrappongono creano l'attuale modello di mercato: difficoltà a penetrare nei settori di fascia alta, mentre una feroce concorrenza dei prezzi domina i mercati di fascia media.
Tornando al titolo del video:"I principi sono di comune conoscenza, ma la precisione rimane difficile da raggiungere in tutto il paese".
Questa affermazione contiene solo la metà della verità. Le teorie degli algoritmi subpixel, dell'ottica telecentrica, del controllo del movimento di precisione sono tutte documentate nei libri di testo.La vera sfida sta nel tradurre la teoria in prodotti industriali stabiliIn questo modo, la precisione viene garantita in modo affidabile a valori decimali e i costi vengono ridotti a livelli accessibili ai produttori.
L'industria della visione artificiale non ha spazio per rivoluzionarie scoperte improvvise o tecnologie "proiettile d'argento".
I suoi ostacoli competitivi sono incorporati in migliaia di dettagli sottili:
Tali intuizioni sono raramente pubblicate in articoli accademici o completamente divulgate all'interno di brevetti.
L'industria della visione artificiale cinese si è sviluppata in due decenni: da una completa dipendenza dalle importazioni a una completa sostituzione interna nei segmenti medio-basso,e ora progressi incrementali alla fine altaI progressi sono stati difficili, ma la direzione è chiara.
Dopotutto, quelle minuscole lacune dopo il punto decimale possono essere chiuse solo attraverso progressi progressivi e persistenti.
Il fosso crudele della visione artificiale si trova nelle cifre oltre il punto decimale
Recentemente ho visto un video sulla visione artificiale, con un titolo stimolante:"I principi sono di comune conoscenza, ma la precisione rimane difficile da raggiungere in tutto il paese".
Ad essere onesti, all'inizio ho pensato fosse solo un altro cliché che affermava "La Cina non può raggiungere". Dopo aver guardato attraverso, ho capito che la storia è molto più sfumata.
Quando si tratta di visione artificiale, tutti capiscono il principio di base: basta usare una fotocamera per catturare immagini e eseguire algoritmi per il riconoscimento.E i tutorial sul deep learning sono ovunque.Sembra che chiunque possa costruire una soluzione di visione artificiale.
Ma una volta che si entra nelle fabbriche e nelle linee di produzione, si vede un enorme divario tra costruire un sistema funzionale e costruire uno eccellente.
Si riduce alle cifre dopo il punto decimale.
Per prima cosa, stabiliamo un quadro di riferimento intuitivo:
Un capello umano è di circa 0,1 millimetri, equivalente a 100 micrometri.Sembra già impressionante..
Tuttavia, la fabbricazione di alta gamma richiede tolleranze molto più strette, non soltanto di 10 μm, né nemmeno di 1 μm:
Se tagliate un singolo capello umano orizzontalmente in 1000 segmenti, ogni segmento misura 0,1 μm.
A questo livello di precisione, i dettagli di routine trascurati in condizioni normali diventano fonti di errore fatali:
La linea di demarcazione tra ingegneri esperti di visione artificiale e dilettanti non è se i difetti possono essere identificati,ma se la precisione può essere costantemente bloccata su quei valori decimali attraverso decine di migliaia di cicli di ispezione.
Una telecamera industriale non e' affatto come una telecamera per smartphone.
Molte persone credono erroneamente che gli algoritmi costituiscano il nucleo della visione artificiale.
Il limite superiore di qualsiasi algoritmo è definito dalle prestazioni dell'hardware. Nessun algoritmo, per quanto sofisticato, può raggiungere una precisione sotto-microna con una fotocamera di consumo che costa poche centinaia di yuan.È paragonabile a cercare di fotografare le cellule sotto un microscopio usando una fotocamera di un telefono cellulare.
Un hardware completo di visione industriale è costituito da almeno quattro strati: sorgenti luminose, lenti, fotocamere e grabbatori di fotogrammi, ognuno dei quali richiede un'ottimizzazione rigorosa.
Il parametro più critico per le fotocamere industriali non è il numero di pixel, madimensione dei pixel.
Le fotocamere degli smartphone di consumo perseguono cifre di megapixel elevate. Un sensore da 100 megapixel suona convincente, ma i singoli pixel possono essere solo 0,8 μm o più piccoli.rumore elevato e gamma dinamica limitataSebbene siano adatti per l'abbellimento dei ritratti, non sono adatti per l'ispezione industriale.
Le fotocamere industriali seguono la logica di progettazione opposta. I sensori industriali di fascia alta presentano in genere dimensioni di pixel superiori a 2,5 μm e talvolta 5 μm o 10 μm. I pixel più grandi catturano più fotoni, mentre i pixel più grandi catturano più fotoni.fornire immagini più pulite e misurazioni più stabili.
Un'altra specifica critica èprofondità dei pixelLe foto di consumo ordinarie adottano una codifica a 8 bit con 256 livelli di scala di grigi..La differenza può sembrare marginale a prima vista, ma i calcoli di precisione dei subpixel si basano interamente su queste ricche informazioni sulla scala dei grigi.
Se la fotocamera definisce la precisione minima raggiungibile, l'obiettivo determina la massima precisione potenziale.
Le immagini catturate con lenti ordinarie presentano una distorsione dei bordi: le linee rette appaiono curve.Eppure diventa catastrofico per la misurazione della visione artificiale a livello di micron.
Per ispezioni industriali di alta gamma,lenti telecentrichesono utilizzati al posto dell'ottica convenzionale.le lenti telecentriche mantengono un ingrandimento costante indipendentemente dalla distanza dell'oggetto e raggiungono tassi di distorsione fino a diversi decimilaesimi o inferioriPer quanto riguarda il prezzo, un obiettivo telecentrico premium costa spesso più della fotocamera industriale associata.
Attualmente, i marchi internazionali dominano ancora il mercato nazionale delle lenti industriali ad alta precisione.
Una nota massima del settore dice: "Nella visione artificiale, l'illuminazione rappresenta il 70% del successo, gli algoritmi solo il 30%".
Molte sfide di ispezione non derivano da algoritmi difettosi, ma dal fallimento di illuminare correttamente i difetti per ottenere immagini chiare.
L'angolazione della luce, la lunghezza d'onda, l'uniformità e la stabilità determinano la qualità finale dell'immagine.
I produttori nazionali in grado di produrre in serie in modo stabile fonti luminose specializzate di fascia alta, come le luci UV profonde, rimangono scarsi; la maggior parte delle forniture dipende ancora dalle importazioni.
L'hardware stabilisce le prestazioni di base, mentre gli algoritmi sbloccano il pieno potenziale dell'hardware.precisione in sottopixel.
Cos'e' esattamente la precisione dei subpixel?
L'unità fondamentale di un'immagine digitale è un pixel.limitata alla risoluzione di pixel interi.
Gli algoritmi subpixel sfruttano le variazioni graduali della scala dei grigi e la modellazione matematica per dedurre la posizione esatta del bordo all'interno di un singolo pixel.
La precisione raggiungibile varia a seconda dell'algoritmo:
Qual è il significato pratico di 0,01 pixel? Supponiamo che un pixel corrisponda a una dimensione fisica di 10 μm. Una precisione di 0,01 pixel si traduce in un errore di misura di 0,1 μm, o 100 nanometri.Senza aggiornamento hardware, gli algoritmi da soli aumentano la precisione di un fattore 100.
Per quanto possa sembrare impressionante, questa tecnologia non è certo un segreto: la teoria alla base è emersa decenni fa, con abbondanti articoli accademici e codice open source accessibili al pubblico.
La precisione citata in articoli di ricerca è misurata in condizioni di laboratorio ideali.
Il mantenimento di una precisione stabile fino a due decimali in condizioni così caotiche rappresenta una vera maestria ingegneristica.
Questo strato costituisce il vero fossato competitivo.
Molti estranei semplificano la visione artificiale come "installare una telecamera e scrivere degli algoritmi".Le soluzioni di visione artificiale create per diversi settori sono tecnologie essenzialmente distinte.
Altri settori di applicazione includono il fotovoltaico, la produzione automobilistica, i prodotti farmaceutici e la trasformazione alimentare.
Gli schemi ottici, le architetture degli algoritmi, le strutture delle apparecchiature meccaniche e gli standard di convalida differiscono drasticamente tra i settori verticali.L'esperienza acquisita nell'elettronica 3C offre pochi vantaggi quando si entra nella produzione di semiconduttoriLa padronanza di questi domini richiede almeno otto o dieci anni di accumulazione industriale.
Pertanto, l'ostacolo principale nella visione artificiale non è una singola tecnologia isolata, ma capacità integrate che coprono l'ottica, i macchinari, l'elettronica, gli algoritmi e il know-how dei processi verticali.Nessun anello può essere trascurato.
I mercati di fascia media-bassa sono ampiamente conquistati; i segmenti di fascia alta continuano a svilupparsi attivamente.
Per riassumere: i fornitori nazionali si sono assicurati un terreno solido nei mercati di fascia media che coprono elettronica 3C, fotovoltaica e imballaggi alimentari.I-TEK OptoElectronics e TZTEK forniscono macchine fotografiche industriali e sistemi di visione competitivi a circa un terzo o la metà del prezzo delle alternative importate, che soddisfano pienamente le esigenze di ispezione standard.
Fondata dal dottor Dong Ning dell'Università di Scienza e Tecnologia della Cina,I-TEK Optoelectronicsha sviluppato la prima fotocamera industriale a scansione lineare 8K prodotta in Cina nel 2012, riempiendo un vuoto critico interno.Da allora l'azienda ha lanciato telecamere a scansione lineare da 16K e telecamere raffreddate termoelettricamente da 150 megapixel., guadagnandosi un posto al tavolo globale per l'hardware di imaging industriale di fascia alta.
TZTEKraggiunge una precisione di ispezione di 0,3 μm per l'elettronica di consumo, pari alle migliori offerte di Hexagon e Keyence.riducendo il monopolio di lunga data dell'UCK.
Tuttavia, persistono notevoli lacune nei settori di fascia alta, in particolare nell'ispezione dei semiconduttori front-end.
Questi vincoli che si sovrappongono creano l'attuale modello di mercato: difficoltà a penetrare nei settori di fascia alta, mentre una feroce concorrenza dei prezzi domina i mercati di fascia media.
Tornando al titolo del video:"I principi sono di comune conoscenza, ma la precisione rimane difficile da raggiungere in tutto il paese".
Questa affermazione contiene solo la metà della verità. Le teorie degli algoritmi subpixel, dell'ottica telecentrica, del controllo del movimento di precisione sono tutte documentate nei libri di testo.La vera sfida sta nel tradurre la teoria in prodotti industriali stabiliIn questo modo, la precisione viene garantita in modo affidabile a valori decimali e i costi vengono ridotti a livelli accessibili ai produttori.
L'industria della visione artificiale non ha spazio per rivoluzionarie scoperte improvvise o tecnologie "proiettile d'argento".
I suoi ostacoli competitivi sono incorporati in migliaia di dettagli sottili:
Tali intuizioni sono raramente pubblicate in articoli accademici o completamente divulgate all'interno di brevetti.
L'industria della visione artificiale cinese si è sviluppata in due decenni: da una completa dipendenza dalle importazioni a una completa sostituzione interna nei segmenti medio-basso,e ora progressi incrementali alla fine altaI progressi sono stati difficili, ma la direzione è chiara.
Dopotutto, quelle minuscole lacune dopo il punto decimale possono essere chiuse solo attraverso progressi progressivi e persistenti.