Intervju sa Wang Yaonan, akademikom Kineske akademije inženjeringa: Umjetna inteligencija čini da mašinski vid bude inteligentna

May 07, 2024 Ostavi poruku

Zahvaljujući razvoju umjetne inteligencije koju pokreće model velikog jezika, istraživanje i primjena grafičke ikonografije otvorili su novu priliku, a to je promoviranje razvoja velikog jezičkog modela do modela velike vizije." Dana 30. decembra 2023. povodom dočeka Nove i Nove godine, Wang Yaonan, akademik Kineske akademije inženjeringa i direktor Nacionalnog inženjerskog istraživačkog centra za tehnologiju vizualne percepcije i kontrole robota, podijelio je najnovije trendove u razvoju inteligencije mašinskog vida na 19. konferenciji mladih naučnika Kineskog društva grafičke grafike.

 

U ekskluzivnom intervjuu novinaru Nandua, Wang Yaonan je rekao da umjetna inteligencija čini mašinski vid inteligentnim, a veća aritmetička snaga može podržati obuku velikih vizualnih modela. Međutim, pametniji modeli velike vizije takođe trebaju viši nivo aritmetike, bolje arhitekture modela i efikasnije algoritme učenja.

 

Ovu konferenciju organizuju Kinesko društvo za grafiku slika, Pazhou Lab, Tehnološki univerzitet Južne Kine, Univerzitet Sun Yat-sen i Radni komitet za mlade Kineskog društva za grafiku slika.

 

Govorimo o trendovima u industriji

 

Od vizuelnog računarstva do vizuelne inteligencije

 

Yao-Nan Wang: Kinesko istraživanje mašinskog vida ima istoriju dugu skoro 40 godina, u početku počevši od proučavanja senzora, odnosno: pretvaranja svetlosnih informacija u informacije o slici. Sljedeće što treba učiniti je obrada vida, uključujući i poboljšanje dobijene slike kako bi bila jasnija.

 

Nakon što imamo jasnu sliku, potrebno je da sa slike dobijemo cilj koji nas zanima. Na primjer, u polju vožnje bez vozača, mašinski vid treba da otkrije mete na slici, da odgovori na pitanje koja je osoba, a koja automobil.

 

To su ono što nazivamo tri glavna područja mašinskog vida. Svodim to na: slikanje, obradu i razumijevanje.

 

Mašinski vid se preselio sa vizuelnog računarstva u prošlosti na vizuelnu inteligenciju danas. Vizuelno računarstvo u kombinaciji sa veštačkom inteligencijom poboljšalo je nivo kognicije i poboljšalo sposobnost razumevanja složenih okruženja, a čitava industrija vizuelne inteligencije doživela je brz razvoj u poslednjih godinu dana.

 

Pravac razvoja inteligencije mašinskog vida je sprovođenje širokog spektra aplikacija, primenjenih na industrijsku inspekciju, inteligentnu proizvodnju i satelitsku daljinsku detekciju i druga polja.

 

Govoreći o mašinskom vidu, moramo govoriti o njegovoj primjeni, razvoju tehnologije vođenom aplikacijom. Kinesko društvo za grafiku slika ima 30 specijalnih komiteta, uglavnom usredsređenih na grafičke slike za sprovođenje istraživanja, koji služe nacionalnoj ekonomiji. Ove tehnologije imaju širok spektar scenarija primjene, uključujući industriju, poljoprivredu, geografske informacione sisteme, daljinsko istraživanje, zemljišne resurse i tako dalje.

 

Osoba može vidjeti svijet po rođenju i razumjeti svijet nakon toga, a 80% informacija dobija vidom. Mašinski vid je da simulira ljudsko oko, i na kraju dostigne nivo ljudskog oka, iu nekim aspektima prevaziđe ljudsko oko, da vidi dalje, vidi jasnije.

 

Razgovarajte o modelu velike vizije

 

Veliki vizuelni model će biti sve inteligentniji

 

Yao-Nan Wang: Model velikog jezika je AI vođen podacima koji koristi znanje iz knjiga, jezika i teksta kao podatke za obuku modela neuronske mreže koji može zaključiti i odgovoriti na osnovu onoga što je naučio.

 

Podaci za veliki vizualni model, s druge strane, dolaze uglavnom iz različitih slika, uključujući vizualne podatke koje generiraju ljudi i priroda. Na primjer, medicinski veliki vizualni model je da unese slike ljudskih organa i lezija kao vizualne podatke u veliki model, a zatim se trenira da ih dobije, tako da može čitati CT fotografije poput doktora i postići efekat rasuđivanje stanja pacijenta nakon fotografisanja kada pacijent dođe kod doktora.

 

Trenutni vizualni model nema isti kao ljudski mozak kao što zamišljamo, jaz je još uvijek vrlo velik. Sa povećanjem podataka za učenje i prilagođavanjem parametara modela, model će postajati sve veći i veći i sve više znanja, a nivo njegove inteligencije sve veći i pametniji.

 

Moramo povećati nivo aritmetičke moći i ubrzati brzinu računanja da bismo mogli brže da gradimo modele; dizajnirati bolje arhitekture modela, uključujući veću interpretabilnost i sigurniju i podložniju kontroli; i istraživanje efikasnijih algoritama učenja.

 

Zapravo, vizualno makromodeliranje nije novost u posljednjih nekoliko godina, razvijalo se korak po korak. Osamdesetih godina prošlog stoljeća, s razvojem umjetne inteligencije, ljudi su počeli proučavati neuronske mreže. Samo što su se u posljednjih nekoliko godina aritmetičke i algoritamske mogućnosti povećale tako da ljudi mogu pokušati izgraditi velike modele, što je dovelo do velikih jezičkih modela i velikih vizualnih modela. U prošlosti, kada nije bilo dovoljno aritmetičke snage, ljudi nisu pravili tako velike modele.

 

Govoreći o izgledima za 2024

 

Nadamo se da će posao iz Guangzhoua rasti do cijele zemlje i svijeta.

 

Yaonan Wang: Nacionalni inženjerski istraživački centar Univerziteta Hunan za tehnologiju vizualne percepcije i kontrole robota preselio se u Guangzhou Zengcheng, smješten u području Velikog zaljeva Guangdong-Hong Kong-Makao, 2022. godine i uspostavio HU Guangdong-Hong Kong-Macao Greater Bay Institut za istraživanje inovacija u području (Guangzhou Zengcheng).

 

Institut se fokusira na istraživanje i primjenu inteligentne vizije za mašine, uključujući robote za specijalne operacije u oblastima inteligentne proizvodnje, medicine i farmacije, kao i generalizovane modele velike vizije. Na primjer, ova istraživanja se primjenjuju na prerađivačku industriju, koja može zamijeniti veliki broj radnika i upotpuniti inspekciju kvaliteta proizvoda, posebno u 3C i high-end industriji dijelova. Trenutno, Institut je razvio softverske i hardverske sisteme, čija je glavna funkcija osnaživanje digitalne i inteligentne transformacije Guangdong preduzeća i promoviranje razvoja proizvodne industrije.

 

Pored toga, Institut izvodi i inteligentne sisteme mašinskog vida i upravljanja, koji se uglavnom koriste u proizvodnji vrhunske inteligentne opreme, kao što je industrijski Internet softver, koji ima veoma veliki broj algoritama.

 

Guangdong je predvodnik reformi i otvaranja i glavno ekonomsko bojno polje, sa kompletnim industrijskim lancem i lancem snabdevanja, i mnogim proizvodnim preduzećima, došli smo do Guangdonga rasporeda prvo zbog potražnje na tržištu. Osim toga, naš istraživački centar ima niz R & D tima u Guangdongu je sletio puno projekata, transformacija naučnih i tehnoloških dostignuća.

 

U prvoj polovini 2023. godine naišli smo na neke izazove, uglavnom u nabavci dijelova i komponenti. 2024, vjerujem da će ovi problemi biti riješeni, a industrijski lanac, lanac nabavke i mogućnosti istraživanja i razvoja industrije umjetne inteligencije u Guangdongu će biti poboljšane. Na velikom domaćem tržištu otvaraju se nove staze. U živoj atmosferi, u kojoj svi preuzimaju inicijativu, djeluju i inoviraju, svi izazovi se mogu riješiti.

 

Uvjeren sam u razvoj AI industrije u Guangdongu. U proteklih 30 godina uložili smo mnogo napora da budemo samopouzdani u nauci i tehnologiji i akumulirali smo mnogo rezultata naučnog istraživanja. Guangdong je najveća ekonomska provincija u Kini.

 

Polje umjetne inteligencije i robotike kojim se bavimo uhvatilo je dobru priliku, koja je eksplozivno porasla u posljednje dvije godine, donoseći mnoga nova tržišta i povlačeći nove industrijske kolosijeke. U budućnosti će biti sve više pametnih terminala, što će dovesti do razvoja proizvodnih kapaciteta i industrije opreme. 2024. godine, nadam se da će naš istraživački institut u Zengchengu, Guangzhou, moći da prenese naše poslovanje u cijelu zemlju i svijet.