Faza zlatne groznice generativne AI premješta se u eru učinkovitosti. Na početku 2023. godine, većina tehnoloških startupa samo je željela da upit funkcionira. Sada kada koristimo ove aplikacije generativne AI s tisućama korisnika, razgovor se promijenio od "Može li generativna AI to učiniti?" do "Koliko generativna AI košta po zahtjevu?"
Trošak korištenja modela generativne AI, što je cijena koju plaćate pružatelju kao što su OpenAI, Anthropic ili Google za svaki generirani token, može postati veliki problem za startupe. Može biti skuplje od hostinga. Ako vaši troškovi nisu razumni, vaša značajka generativne AI nije proizvod; to je obveza.
Vjerujemo da je ekonomika zaključivanja vrlo važna za AI inženjere u 2024. godini. Koristeći slojevitu strategiju optimizacije, vidjeli smo da timovi smanje svoje rashode za do 80% bez gubitka kvalitete izlaza. Evo plana za svladavanje vaših margina generativne AI.
1. Strategija usmjeravanja sa više modela
Startupи često griješe što koriste jedan model generativne AI za svaki zadatak. Korištenje GPT-4 ili Claudea za sve je kao što najmate doktora znanosti da odgovori na pitanje korisničke podrške. To nije učinkovita upotreba generativne AI.
Da biste uštedjeli troškove, morate kategorizirati svoje zadatke prema složenosti. Preporučujemo arhitekturu sa tri razine:
- Razina 1: Složeni zadaci poput zaključivanja, logike s više koraka i kreativnog pisanja. Ovdje koristite napredne modele generativne AI.
- Razina 2: Zadaci srednje složenosti poput sažimanja, ekstrakcije ili analize sentimenta. Koristite modele kao Flash ili Haiku.
- Razina 3: Zadaci poput klasifikacije, formatiranja ili čišćenja podataka. Koristite male ili otvorene modele poput Lame 3.
Koristeći usmjerivač modela, vaša aplikacija može odabrati odgovarajući model na temelju namjere korisnika. Slanje 60% vašeg prometa manjim modelima može prepoloviti vašu fakturu.
2. Vještina rezanja i kompresije upita
Tokeni su ono što plaćate kada koristite velike jezične modele. Vjerojatno trošite previše na nepotrebne riječi. Dugi upiti i ponavljajući prozori konteksta mogu povećati troškove. Ti modeli ne trebaju toliko teksta da razumiju vašu namjeru.
Izbjegavajte pretjeranu verboznost u upitima, jer mnogi razvijatelji uključuju duge primjere. Iako su učinkoviti, oni također povećavaju troškove. Predlažemo fine-tuning modela za specifične zadatke. Treningom na nekoliko stotina primjera, često možete ukloniti duge upute, smanjujući tokene na ulazu za do 70%.
Koristite cachiranje konteksta ako vaša aplikacija ponavljano šalje isti kontekst. To omogućava pružatelju da ponovno koristi obrađene tokene po nižoj cijeni, što pomaže u smanjenju troškova.
3. Optimizacija RAG-a: Kvaliteta umjesto količine
RAG je standard za izgradnju AI-ja na temelju podataka, ali se često primjenjuje neučinkovito. Većina sustava dohvaća previše podataka, što povećava troškove.
Da biste smanjili troškove, fokusirajte se na prerasporedjivanje:
- Dohvatite potencijalne dijelove dokumenata koristeći pretragu. Ovo je učinkovit način pronalaženja relevantnih podataka.
- Koristite model da biste utvrdili najrelevantnije dijelove.
- Šalite samo te odabrane dijelove velikom jezičnom modelu.
Ovaj pristup osigurava da ne plaćate modelu za obradu nepotrebnih podataka. Cachiranje također može pomoći da se zaobiđe model za ponavljane upite.
4. Kontrola tokena na izlazu
Tokeni na ulazu su relativno jeftini. Tokeni na izlazu su skupi. Veliki jezični modeli mogu biti previše opširni, dodajući nepotrebne riječi koje povećavaju troškove.
Možete to kontrolirati kroz inženjerstvo izlaza:
- Postavite ograničenje na broj tokena koje model može generirati.
- Koristite JSON način i sheme da biste nametnuli strukturirane izlaze.
- Koristite sekvence zaustavljanja da biste prekinuli generiranje nakon što su potrebne informacije dostavljene.
5. Prijelaz na otvoreni kod i samohostiranje
Za rastući startupe, API-prvi pristup može postati skup. Velika skaliranje, hostiranje vlastitih modela može biti isplativije od plaćanja po tokenu.
Postavljanje modela poput Lame 3 ili Mistrala na vašu vlastitu infrastrukturu omogućava:
- Kontrola troškova: Plaćate za hardver umjesto tokena, čime su rashodi predvidivi.
- Kvantizacija: Pokrenite učinkovite modele na ograničenom hardveru bez značajnoga gubitka točnosti.
Sljedeća razmjena vrijednosti
U krajoliku AI startupa, pobjednici će biti oni s jakim marginama. Smanjenje troškova zaključivanja za 80% nije samo pitanje uštede novca; daje vam fleksibilnost da eksperimentirate, snizite cijene i ostanete konkurentni.
Generativna AI je moćna, ali može biti skupa. Optimizacijom svojih margina činite je učinkovitom i skalabilnom.
Preporučujemo da započnete s revizijom tokena. Utvrdite gdje se vaši tokeni troše i počnite s optimizacijom. Cilj je učiniti vašu AI učinkovitom koliko je i inteligentna. Trebaje truda, ali rezultati su vrijedi.
Trebate izgraditi visoko funkcionalan udaljeni tehnički tim?
Pogledajte MyNextDeveloper, platformu gdje možete pronaći najboljih 3% softverskih inženjera koji su duboko strasti prema inovacijama. Naša rješenja za softverskiе talente na zahtjev, namjenjena i detaljno razrađena pružaju sveobuhvatno rješenje za sve vaše softverske potrebe.
Posjetite našu web-stranicu da istražite kako vam možemo pomoći da sastavite svoj savršeni tim.



