Natrag na Blog
Blog

Kako se generativna AI premešta dalje od teksta: Uspon multimodalnih modela

Oct 13, 2025·7 min read·Shranya Mahna
Kako se generativna AI premešta dalje od teksta: Uspon multimodalnih modela

Prošle godine, svijet je bio oduševljen pisanom čarolijom ChatGPT-a.

Vidjeli smo računala koja komponiraju eseje, pišu kod, pa čak i rasprave o filozofiji — sve u savršenom, sigurnom jeziku. Činilo se kao vrh AI inovacije.

Ali evo nas u 2025., i ta "samo-tekstualna" era generativne AI već izgleda zastarjelo.

Jer sada AI više ne samo piše — vidi, čuje i stvara.

Pridružite nam se u eri multimodalnog AI-a — nove generacije modela koji mogu istovremeno obraditi riječi, slike, zvuk i video, prepliću ih u harmonične i smislene iskustva.

To je sljedeći proboj u suradnji čovjeka i stroja, i mijenja način na koji percipiramo samu inteligenciju.

Od Riječi do Svjetova — Skok Izvan Teksta

Godinama je tekstualna obrada bila zona udobnosti AI-a.

Jezični modeli poput GPT-a, Claudea i Geminija naučili su predviđati sljedeću riječ s nevjerojatnom preciznošću.

Ali ljudski svijet nije sastavljen samo od riječi — to je simfonija osjetila: vizualnih elemenata, glasova, pokreta, emocija.

Ograničenje je bilo očito: kako bi model koji radi samo s tekstom mogao doista razumjeti meme, analizirati fotografiju, opisati sliku ili interpretirati ton glasa?

Tu ulazi multimodalni AI — modeli koji razumijevaju i stvaraju između višestrukih tipova podataka. Oni ne čitaju samo; promatraju, slušaju i sintetiziraju.

Pitajte multimodalni model da analizira sliku oštećene tiskane pločice — neće samo opisati sliku; mogao bi predložiti što nije u redu i kako to ispraviti.

Pokažite mu video isječak, i mogao bi sažeti narativu, detektirati emocije, ili čak urediti snimak za vas.

To više nije znanstvena fantastika. Već je ovdje.

Mozgovi Iza Proboja

Multimodalni modeli kombiniraju različite arhitekture neuronskih mreža — poput vidnih transformatora (za vizualne ulaze), kodera govora (za audio ulaze) i velikih jezičnih modela (za zaključivanje i generiranje teksta) — u jedan sustav.

Što znači da mogu:

  • Interpretirati upit koji miješa tekst i slike ("Što je smiješno kod ovog memea?")
  • Odgovoriti u različitim oblicima ("Evo natpisa, i također dizajna sličice za njega.")
  • Naučiti odnose između osjetila — poput kako se riječi "plavo nebo" povezuju s stvarnim nijansama plave boje na slici.

Ovi sustavi oponašaju način na koji ljudi doživljavaju svijet: kroz međusobno povezana osjetila, ne izolirane tokove podataka.

Kao da smo sve vrijeme AI učili čitati knjige — i sada, odjednom, može gledati filmove i slušati glazbu.

Pioniri Multimodalne Ere

Borba za nadzor ovog novog područja je intenzivna — i zanimljiva.

  • GPT-5 od OpenAI-a se razvija u generalistički model, sposoban obraditi tekst, slike i zvuk u jednoj konverzaciji. Učitajte fotografiju svojih bilješki na ploči, i on će sažeti, urediti i stvoriti prezentacije u hodu.
  • Google Gemini 2 kombinira razumijevanje teksta i videa s pretraživanjem i zaključivanjem — zamislite AI koji može interpretirati YouTube videe i pozivati se na činjeničan kontekst u stvarnom vremenu.
  • Anthropic-ov Claude 3.5 naglašava pouzdanost i objašnjivost dok uvodi zaključivanje iz slika — manje atraktivno, ali čvrsto ukorijenjeno.
  • Runway, Pika i Sora transformiraju AI stvaranje videozapisa, omogućujući kreatorima da pretvore riječi u kinematografski video.

A pored giganta, startupovi se pojavljuju svugdje — kreirajući AI-vođeni softver za dizajn, video editore, zdravstvene asistente i kreativne agente s multimodalnošću kao temeljom.

Ukratko, AI trka za naoružanjem više nije o većim tekstualnim modelima. Radi se o modelima koji percipiraju svijet na način kako to rade ljudi.

Pravi Učinak — Kada AI Vidi i Čuje

Korak unazad i razmislimo kako ovaj pomak utječe na svakodnevni život i poslovanje.

1. Kreativne industrije se ponovno definiraju. Autori, redatelji i glazbenici rade s AI-om kao s co-kreativnim partnerima. Redatelj može napisati opis scene — "zalazak sunca u Tokiju, neonska refleksija na kišom opranim ulicama" — a softver poput Sore ili Runeaya može to učiniti vizualnom stvarnošću u sekundama. AI ne robotizira samo kreativnost; napaja maštu.

2. Učenje postaje neprekidno. Zamislite učitelja biologije koji traži od AI-a da opiše replikaciju DNA — ne u paragrafima, već u animiranoj simulaciji koja se čita naglas u stvarnom vremenu. Učenici neće samo čitati opise; promatrat će i slušati, otkrivajući na način kako se naši mozgovi instinktivno sviđa.

3. Zdravstvo se nadograđuje sa osjetilnim ulazom. Multimodalni AI može skenirati ton glasa pacijenta, lice i medicinske snimke kako bi identificirao rane znakove bolesti. Ne zamjenjuje liječnike — daje im natčovječku vid.

4. Korisnička podrška se mijenja. U blizoj budućnosti, podrške AI će razumjeti snimke zaslona, videozapise ili čak audio bilješke — rješavajući vašu tehničku problemu prije nego što ste je završili objasniti.

5. Pristupačnost ide na nove razine. AI može čitati slike slijepima, prevoditi znakovni jezik gluvih, i čak pružiti prilagođena sučelja u stvarnom vremenu.

Obojenoj Mač Multimodalnosti

Sa svakim skokom tehnologije dolaze sjene.

Kada AI može stvoriti videozapise koji se čine nerazdvojivi od stvarnosti, granice između fikcije i stvarnosti postaju sve zamućenije. Deepfakei, dezinformacije i krađa digitalnog identiteta već postaju stvarnost.

Tada je tu cijena računanja — multimodalno treniranje zahtijeva zapanjujuće količine energije i resursa, i time probleme održivosti.

I možda najjedljiv izazov: pristranost podataka.

AI se trenira na onome što mu pružamo — i ako podaci za treniranje sadrže stereotipe, oni postaju ugrađeni u sve modalnosti, ne samo jezik.

Lijek? Transparentnost, regulacija i etički okviri koji prate samu tehnologiju.

Jer što je AI sposobniji, to više moramo preuzeti odgovornost za odlučivanje kako se koristi.

Filozofski Pomak — Prema Percepciji Stroja

Evo tiho revolucionarnog dijela:

Više ne kreiramo strojeve koji samo misle — kreiramo strojeve koji percipiraju.

AI više nije ograničen samo na simboličko zaključivanje. Počinje osjetiti obrasce na istu multidimenzionalnu način kao što to rade ljudi — vizualno, audio, jezično.

To je razlika između čitanja opisa grmljavine i biti u kiši.

I to ima duboke implikacije: moglo bi značiti AI sustave koji formiraju intuiciju, empatiju ili kreativnu osjećajnost — ne zato što doživljavaju kao ljudi, već zato što doživljavaju svijet u bogatstvu koje je nekada bilo isključivo naše.

Budućnost — Od Multimodalnog do Omnimodalnog

Trenutni modeli su multimodalni — mogu obraditi više od jedne vrste ulaza.

Ali budućnost je omnimodalna — strojevi koji se bezglavno stapaju svi tipovi podataka koje čovjek pruža: tekst, slike, glas, dodir, okruženje i čak biometrijske podatke.

Zamislite svoj AI pomoćnik koji može gledati s vaših AR naočala, prepoznati vašu ton, čitati vaše emailove, osjetiti vašu razinu stresa i aktivno intervenirati kako bi pomogao — bez kompromisa vaše privatnosti i namjere.

To nije nadogradnja. To je novo sučelje čovjeka i stroja.

Završne Misli

Pomak od teksta do multimodalnosti generativnog AI-a zatvara jednu knjigu — i otvara nešto mnogo veće.

Iskušavajuće je vidjeti AI kao izum. Ali činjenica je, postaje novi medij — jedan koji ne samo da govori riječi, već slike, zvuk i iskustvo.

Kako se upuštamo u ove nove granice kreativnosti, najutjecajnije pitanje više nije "Što AI može?"

To je "Što možemo zamisliti — zajedno?"

Trebate li graditi visokoučinkovit udaljeni tech tim?

Pogledajte MyNextDeveloper, platformu gdje možete pronaći top 3% softverskih inženjera koji su duboko strastveni o inovaciji. Naša na-zahtjev, posvećena i temeljita rješenja za talente u softveru pružaju sveobuhvatno rješenje za sve vaše softverske potrebe.

Posjetite našu web stranicu kako biste otkrili kako možemo pomoći u sastavljanju vašeg savršenog tima.