Umjetna inteligencija obuhvaća računalne sustave i metode kojima se rješavaju zadaci poput prepoznavanja uzoraka, zaključivanja ili obrade jezika. Strojno učenje jedan je način izgradnje takvih sustava: model iz primjera pronalazi statističke veze koje poslije koristi na novim podacima. Hrvatska enciklopedija daje širi okvir pojma, dok nas ovdje zanima upravo taj prijelaz od primjera do predviđanja.
Zamislimo mali, potpuno izmišljeni projekt: fotografije jabuka treba razvrstati u skupine A i B. Skupine određuje unaprijed dogovorena oznaka, primjerice sorta koju je potvrdio uzgajivač. Ne procjenjujemo zrelost prema boji. Zelena jabuka može biti zrela, a crvena nezrela; takvo bi pojednostavljenje već na početku pokvarilo zadatak.
Prvo moramo znati što model treba prepoznati
Programeru je lako napisati pravilo koje svaku fotografiju s mnogo crvenih piksela šalje u skupinu A. Problem nastaje kad boja ne odgovara sorti, osvjetljenje promijeni izgled ili u kadar uđe crvena posuda. Tada ručno pravilo prepoznaje boju, premda smo od njega tražili nešto drugo.
Kod nadziranog strojnog učenja model dobiva primjere i njihove točne oznake. Tijekom treniranja uspoređuje svoje predviđanje s oznakom te prilagođava unutarnje parametre kako bi smanjio pogrešku. Googleov uvod u strojno učenje razlikuje takvo učenje s oznakama od metoda koje u podacima traže skupine bez unaprijed zadanih odgovora.
U našem projektu zato nije dovoljno skupiti velik broj slika. Treba provjeriti i oznake. Ako je uzgajivač jabuku označio pogrešno, model dobiva pogrešan odgovor kao uzor. Ako su sve jabuke A fotografirane na jednom stolu, a sve B na drugom, stol može postati korisniji trag od samog ploda.

Kako se nauči pogrešna povezanost
Pretpostavimo da model uspješno razvrstava fotografije iz iste radionice. To još ne govori što će napraviti s jabukom snimljenom mobitelom na tržnici. Pozadina, kut snimanja i sjena sada su drukčiji. Model koji se oslanjao na stol odjednom ostaje bez svojeg najpouzdanijeg traga.
Ovdje je korisno razlikovati pamćenje primjera od generalizacije, odnosno primjene naučenog na nove slučajeve. Preprilagođen model vrlo dobro prati podatke na kojima je treniran, ali slabije radi izvan njih. Zato se dio podataka odvaja za provjeru, kako objašnjava Googleova lekcija o preprilagođavanju. Provjera ima smisla samo ako odgovore iz tog skupa nismo već upotrijebili za treniranje.
Za zamišljene jabuke odvojili bismo fotografije drugih plodova, snimljene u drugim okolnostima. Deset gotovo jednakih kadrova iste jabuke ne predstavlja deset neovisnih situacija. Ako neke stavimo u trening, a druge u provjeru, rezultat može izgledati uvjerljivije nego što zaslužuje. Korisnija je provjera koja oponaša ono što model stvarno čeka nakon puštanja u rad.
U zamišljenoj provjeri razdvojili bismo dvije vrste pogrešaka. Ako se jabuka B razvrsta kao A, pregledali bismo njezinu fotografiju i oznaku; isto bismo napravili za obrnutu pogrešku. Zatim bismo usporedili okolnosti: pojavljuje li se problem uz istu posudu, mutne snimke ili određenu pozadinu? Jedan zajednički broj uspješnosti skriva takve razlike. Ako model treba razvrstavati plodove na pokretnoj traci, fotografije s urednog stola ne predstavljaju cijeli budući posao. Ovaj postupak ne daje izmišljeni rezultat, nego pokazuje kako birati pitanja nakon što dobijemo stvarne rezultate provjere.
Treniranje i korištenje nisu isti posao
Kad je treniranje završeno, modelu pokazujemo novu fotografiju i tražimo predviđanje. Taj korak naziva se primjena modela ili inferencija. Nova fotografija sama po sebi ne znači da je model odmah ponovno treniran. Hoće li se korisnički podaci poslije koristiti za poboljšavanje sustava, zasebno je pitanje konkretnog proizvoda i njegovih pravila.
To razlikovanje pomaže i kada koristimo umjetnu inteligenciju na hrvatskom. Dopuna u razgovoru može promijeniti odgovor jer sustav dobiva dodatni kontekst. Iz toga ne slijedi da je svaki korisnik trajno promijenio osnovni model za sve ostale korisnike.
Ni način pokretanja ne određuje kako je model naučio. Uređaj može obrađivati podatke lokalno ili slati zahtjev udaljenom poslužitelju. Razlika se razrađuje u vodiču o edge computingu, a važna je za vezu, privatnost i raspoložive računalne resurse.

Što se mijenja kad nema oznaka
Bez oznaka A i B model može grupirati slične fotografije. Takvo nenadzirano učenje možda izdvoji jabuke prema veličini ili osvjetljenju. Dobivene skupine još treba protumačiti; računalo nije samo utvrdilo da predstavljaju sorte. Učenje potkrepljivanjem ima drukčiji zadatak: sustav bira postupke i dobiva nagradu ili kaznu za njihove posljedice. Ta razlika između vrsta učenja opisana je u Googleovu pregledu.
Model također može biti dio većeg sustava. Kod digitalnog blizanca predviđanje može služiti usporedbi mogućih postupaka, uz podatke i pravila samog procesa. Širi pregled primjena umjetne inteligencije pokazuje zašto isti naziv pokriva vrlo različite poslove.
Za projekt s jabukama završno pitanje zato glasi: prepoznaje li model obilježje koje nas zanima ili samo okolnosti fotografiranja? Odgovor traži nove, dobro odabrane primjere i pregled pogrešaka. Ako stalno griješi na plodovima snimljenima u sjeni, dobili smo konkretan trag za popravak podataka ili modela, a ne razlog da njegov izlaz proglasimo razumijevanjem jabuka.





