Prošle godine, svijet je bio oduševljen pisanom čarolijom ChatGPT-a.
Vidjeli smo računala koja komponiraju eseje, pišu kod, pa čak i rasprave o filozofiji — sve u savršenom, sigurnom jeziku. Činilo se kao vrh AI inovacije.
Ali evo nas u 2025., i ta "samo-tekstualna" era generativne AI već izgleda zastarjelo.
Jer sada AI više ne samo piše — vidi, čuje i stvara.
Pridružite nam se u eri multimodalnog AI-a — nove generacije modela koji mogu istovremeno obraditi riječi, slike, zvuk i video, prepliću ih u harmonične i smislene iskustva.
To je sljedeći proboj u suradnji čovjeka i stroja, i mijenja način na koji percipiramo samu inteligenciju.
Od Riječi do Svjetova — Skok Izvan Teksta
Godinama je tekstualna obrada bila zona udobnosti AI-a.
Jezični modeli poput GPT-a, Claudea i Geminija naučili su predviđati sljedeću riječ s nevjerojatnom preciznošću.
Ali ljudski svijet nije sastavljen samo od riječi — to je simfonija osjetila: vizualnih elemenata, glasova, pokreta, emocija.
Ograničenje je bilo očito: kako bi model koji radi samo s tekstom mogao doista razumjeti meme, analizirati fotografiju, opisati sliku ili interpretirati ton glasa?
Tu ulazi multimodalni AI — modeli koji razumijevaju i stvaraju između višestrukih tipova podataka. Oni ne čitaju samo; promatraju, slušaju i sintetiziraju.
Pitajte multimodalni model da analizira sliku oštećene tiskane pločice — neće samo opisati sliku; mogao bi predložiti što nije u redu i kako to ispraviti.
Pokažite mu video isječak, i mogao bi sažeti narativu, detektirati emocije, ili čak urediti snimak za vas.
To više nije znanstvena fantastika. Već je ovdje.
Mozgovi Iza Proboja
Multimodalni modeli kombiniraju različite arhitekture neuronskih mreža — poput vidnih transformatora (za vizualne ulaze), kodera govora (za audio ulaze) i velikih jezičnih modela (za zaključivanje i generiranje teksta) — u jedan sustav.
Što znači da mogu:
- Interpretirati upit koji miješa tekst i slike ("Što je smiješno kod ovog memea?")
- Odgovoriti u različitim oblicima ("Evo natpisa, i također dizajna sličice za njega.")
- Naučiti odnose između osjetila — poput kako se riječi "plavo nebo" povezuju s stvarnim nijansama plave boje na slici.
Ovi sustavi oponašaju način na koji ljudi doživljavaju svijet: kroz međusobno povezana osjetila, ne izolirane tokove podataka.
Kao da smo sve vrijeme AI učili čitati knjige — i sada, odjednom, može gledati filmove i slušati glazbu.
Pioniri Multimodalne Ere
Borba za nadzor ovog novog područja je intenzivna — i zanimljiva.
- GPT-5 od OpenAI-a se razvija u generalistički model, sposoban obraditi tekst, slike i zvuk u jednoj konverzaciji. Učitajte fotografiju svojih bilješki na ploči, i on će sažeti, urediti i stvoriti prezentacije u hodu.
- Google Gemini 2 kombinira razumijevanje teksta i videa s pretraživanjem i zaključivanjem — zamislite AI koji može interpretirati YouTube videe i pozivati se na činjeničan kontekst u stvarnom vremenu.
- Anthropic-ov Claude 3.5 naglašava pouzdanost i objašnjivost dok uvodi zaključivanje iz slika — manje atraktivno, ali čvrsto ukorijenjeno.
- Runway, Pika i Sora transformiraju AI stvaranje videozapisa, omogućujući kreatorima da pretvore riječi u kinematografski video.
A pored giganta, startupovi se pojavljuju svugdje — kreirajući AI-vođeni softver za dizajn, video editore, zdravstvene asistente i kreativne agente s multimodalnošću kao temeljom.
Ukratko, AI trka za naoružanjem više nije o većim tekstualnim modelima. Radi se o modelima koji percipiraju svijet na način kako to rade ljudi.
Pravi Učinak — Kada AI Vidi i Čuje
Korak unazad i razmislimo kako ovaj pomak utječe na svakodnevni život i poslovanje.
1. Kreativne industrije se ponovno definiraju. Autori, redatelji i glazbenici rade s AI-om kao s co-kreativnim partnerima. Redatelj može napisati opis scene — "zalazak sunca u Tokiju, neonska refleksija na kišom opranim ulicama" — a softver poput Sore ili Runeaya može to učiniti vizualnom stvarnošću u sekundama. AI ne robotizira samo kreativnost; napaja maštu.
2. Učenje postaje neprekidno. Zamislite učitelja biologije koji traži od AI-a da opiše replikaciju DNA — ne u paragrafima, već u animiranoj simulaciji koja se čita naglas u stvarnom vremenu. Učenici neće samo čitati opise; promatrat će i slušati, otkrivajući na način kako se naši mozgovi instinktivno sviđa.
3. Zdravstvo se nadograđuje sa osjetilnim ulazom. Multimodalni AI može skenirati ton glasa pacijenta, lice i medicinske snimke kako bi identificirao rane znakove bolesti. Ne zamjenjuje liječnike — daje im natčovječku vid.
4. Korisnička podrška se mijenja. U blizoj budućnosti, podrške AI će razumjeti snimke zaslona, videozapise ili čak audio bilješke — rješavajući vašu tehničku problemu prije nego što ste je završili objasniti.
5. Pristupačnost ide na nove razine. AI može čitati slike slijepima, prevoditi znakovni jezik gluvih, i čak pružiti prilagođena sučelja u stvarnom vremenu.
Obojenoj Mač Multimodalnosti
Sa svakim skokom tehnologije dolaze sjene.
Kada AI može stvoriti videozapise koji se čine nerazdvojivi od stvarnosti, granice između fikcije i stvarnosti postaju sve zamućenije. Deepfakei, dezinformacije i krađa digitalnog identiteta već postaju stvarnost.
Tada je tu cijena računanja — multimodalno treniranje zahtijeva zapanjujuće količine energije i resursa, i time probleme održivosti.
I možda najjedljiv izazov: pristranost podataka.
AI se trenira na onome što mu pružamo — i ako podaci za treniranje sadrže stereotipe, oni postaju ugrađeni u sve modalnosti, ne samo jezik.
Lijek? Transparentnost, regulacija i etički okviri koji prate samu tehnologiju.
Jer što je AI sposobniji, to više moramo preuzeti odgovornost za odlučivanje kako se koristi.
Filozofski Pomak — Prema Percepciji Stroja
Evo tiho revolucionarnog dijela:
Više ne kreiramo strojeve koji samo misle — kreiramo strojeve koji percipiraju.
AI više nije ograničen samo na simboličko zaključivanje. Počinje osjetiti obrasce na istu multidimenzionalnu način kao što to rade ljudi — vizualno, audio, jezično.
To je razlika između čitanja opisa grmljavine i biti u kiši.
I to ima duboke implikacije: moglo bi značiti AI sustave koji formiraju intuiciju, empatiju ili kreativnu osjećajnost — ne zato što doživljavaju kao ljudi, već zato što doživljavaju svijet u bogatstvu koje je nekada bilo isključivo naše.
Budućnost — Od Multimodalnog do Omnimodalnog
Trenutni modeli su multimodalni — mogu obraditi više od jedne vrste ulaza.
Ali budućnost je omnimodalna — strojevi koji se bezglavno stapaju svi tipovi podataka koje čovjek pruža: tekst, slike, glas, dodir, okruženje i čak biometrijske podatke.
Zamislite svoj AI pomoćnik koji može gledati s vaših AR naočala, prepoznati vašu ton, čitati vaše emailove, osjetiti vašu razinu stresa i aktivno intervenirati kako bi pomogao — bez kompromisa vaše privatnosti i namjere.
To nije nadogradnja. To je novo sučelje čovjeka i stroja.
Završne Misli
Pomak od teksta do multimodalnosti generativnog AI-a zatvara jednu knjigu — i otvara nešto mnogo veće.
Iskušavajuće je vidjeti AI kao izum. Ali činjenica je, postaje novi medij — jedan koji ne samo da govori riječi, već slike, zvuk i iskustvo.
Kako se upuštamo u ove nove granice kreativnosti, najutjecajnije pitanje više nije "Što AI može?"
To je "Što možemo zamisliti — zajedno?"
Trebate li graditi visokoučinkovit udaljeni tech tim?
Pogledajte MyNextDeveloper, platformu gdje možete pronaći top 3% softverskih inženjera koji su duboko strastveni o inovaciji. Naša na-zahtjev, posvećena i temeljita rješenja za talente u softveru pružaju sveobuhvatno rješenje za sve vaše softverske potrebe.
Posjetite našu web stranicu kako biste otkrili kako možemo pomoći u sastavljanju vašeg savršenog tima.


