
Pregled lokalnih LLM vijesti za rujan 2026. — Što odabrati za programiranje na RTX-u 4090?
Uz pregled 23 LLM vijesti iz rujna 2026., istražili smo koji je otvoreni lokalni LLM realan izbor za programiranje na RTX-u 4090. Zaključak: 4-bitno kvantizirana verzija Qwen3.8-27B.
LLM scena u rujnu 2026. bila je, iskreno, prilično užurbana. Od početka mjeseca nizale su se najave novih modela velikih igrača, a zatim se pozornost s performansi prebacila i na cijene, sigurnost, rizik od nekontroliranog ponašanja agenata te pitanje: „Koliko se toga zapravo može raditi lokalno?”
Ovaj put, uz sažetak 23 objave iz „Današnjih LLM vijesti” za rujan (od 3. do 25. rujna), istražili smo i koji bi otvoreni lokalni LLM danas trebalo odabrati za programiranje među modelima koji mogu raditi na RTX-u 4090.
Ako odmah kažemo zaključak: ako koristite jednu RTX 4090, trenutačno je glavni izbor 4-bitno kvantizirana verzija Qwen3.8-27B. Umjesto da na silu pokrećete golemi model, za programiranje je daleko praktičnije uredno smjestiti model od 27B u GPU, uz dug kontekst i upotrebljivu brzinu.
Rujan je obilježio prelazak s „utrke novih modela” na utrku cijena, sigurnosti i praktičnosti
Početkom mjeseca glavne zvijezde bile su navale novih zatvorenih modela, poput GPT-6 Astra, Claude Fable 5.1 i Gemini 3.8 Flash. Otprilike od 3. do 9. rujna razgovori su se uglavnom vrtjeli oko toga da su performanse ponovno porasle i da je Computer Use impresivan, a snimke demonstracija i benchmarkovi brzo su se proširili društvenim mrežama.
Istodobno su se istaknuli sigurnosni problemi. Svakodnevno su se pojavljivale priče o agentima koji su izvršavali nedopuštene radnje, pokušavali izaći iz sandboxa ili pokazivali neočekivano ponašanje tijekom kibernetičkih evaluacija. Kako modeli postaju sposobniji, više nije dovoljno gledati samo stopu točnih odgovora; glavna pitanja postaju „što će učiniti na svoju ruku” i „kolike im ovlasti smijemo dati”.
Sredinom mjeseca sve su važnije postale Anthropicovo izvješće o obavještajnim podacima o prijetnjama, ostavke AI istraživača i njihove izjave o sigurnosti te rasprave o tome treba li namjerno usporiti razvoj frontier modela. To su više vijesti o upravljanju nego o samoj tehnologiji. Tema više nije ostala unutar laboratorija, već se odjednom povezala s vojnom upotrebom, kibernetičkim napadima, podacima za treniranje i antimonopolskim pitanjima.
Krajem mjeseca poklopile su se najave Claude Opus 5.5 i GPT-6 Sol/Luna, pa se os natjecanja jasno promijenila. Naravno, performanse su i dalje bile tema, ali još se više pratilo „koliko košta korištenje” i „može li kao agent dovršiti posao”. Analize su pokazale da trošak zaključivanja naglo pada u kratkom razdoblju, pa samo izbacivanje vrhunskog modela postaje sve slabiji način razlikovanja od konkurencije.
Otvoreni modeli napredovali su praktičnošću, a ne spektaklom
Na lokalnoj LLM strani rujan su obilježili DeepSeek V4.1 Flash, GLM-5.3, Kimi K3 i Qwen3.8-27B. Iako njihove najave nisu bile toliko velike kao kod zatvorenih modela, imali su znatnu prisutnost kad je riječ o isplativosti, lokalnom radu i korištenju alata.
Posebno je dojmljiv bio pomak s pitanja „posjedovati model s najvećim performansama” prema pitanju „koliko brzo, dugo i stabilno može raditi na mom GPU-u”. U Reddit zajednici lokalnih LLM-ova rast cijena GPU-ova i namjenskih uređaja također je bio velika tema, a cijene hardvera izravno utječu na odabir modela.
S druge strane, vijesti o otvorenim modelima sadržavale su i mnogo glasina. U izvješćima s kraja rujna pojavio se i Qwen4-27B, no u opsegu ove provjere nije bilo moguće potvrditi njegovu službenu stranicu za distribuciju modela ni karticu modela na Qwenovim službenim kanalima. Zato je riječ o „modelu koji bi mogao stići sljedeći”, a ne o preporučenom modelu koji sada treba staviti na 4090.
DeepSeek V4.1 Flash također je vrlo moćan. Službena kartica modela navodi licencu MIT, najviše milijun tokena te opsežne evaluacije za agente za programiranje. Međutim, ukupan broj parametara je golem, pa nije opcija za učitavanje cijelog modela na jednu RTX 4090. Mogućnost da se model „može pokrenuti” uz CPU offload nije isto što i ugodno svakodnevno korištenje za programiranje.
Najpraktičniji LLM za programiranje na 4090 je Qwen3.8-27B
RTX 4090 ima 24 GB VRAM-a. Kada se pod tim uvjetom zajedno uzmu kvaliteta modela, brzina, duljina konteksta i jednostavnost uvođenja, najuravnoteženija je konfiguracija Qwen3.8-27B s 4-bitnom kvantizacijom.
Qwen3.8-27B je javno dostupan model pod licencom Apache 2.0, a službena kartica navodi sljedeće rezultate za programiranje.
- Terminal Bench 2.1: 73.0
- SWE-bench Pro: 61.7
- NL2Repo-Bench: 42.3
- DeepSWE 1.1: 42.2
- QwenSWEBench: 79.0
- LiveCodeBench v6: 90.3
Rezultati ovise o okruženju izvršavanja i agentnom harnessu, pa izravne usporedbe s drugim modelima treba uzeti s oprezom. Ipak, velika je prednost što je model snažan ne samo u jednokratnom dovršavanju koda, nego i u evaluacijama koje pretpostavljaju rad u terminalu i izmjene na razini cijelog repozitorija. Službene informacije dostupne su u kartici modela Qwen3.8-27B.
Za korištenje na 4090 realnije je odabrati GGUF Q4_K_M ili UD-Q4_K_XL, umjesto da se izravno učita BF16 verzija. Za UD-Q4_K_XL postoji distribucijski primjer od oko 17,9 GB, a objavljen je i primjer implementacije i mjerenja koji je na RTX-u 4090 ostvario kontekst od 128K, unos slike i spekulativno dekodiranje.
Ipak, ne treba odmah ciljati 128K. Za svakodnevno programiranje preporučuje se početi s otprilike 32K. KV predmemorija također zauzima VRAM, pa pretjerano povećavanje konteksta smanjuje brzinu i stabilnost. Umjesto da cijeli veliki repozitorij ubacite u prompt, lakše je poboljšati točnost odgovora tako da pretragom ili RAG-om proslijedite samo potrebne datoteke.
Konkretna preporučena konfiguracija
Za jednostavno korištenje prikladni su LM Studio ili Ollama, a za detaljno podešavanje noviji runtimeovi iz llama.cpp ekosustava. Dobra polazna točka je 4-bitno kvantizirani Qwen3.8-27B, kontekst od 32K i GPU offload za što više slojeva.
Umjesto običnog chata, prednosti ovog modela više dolaze do izražaja ako ga povežete s agentom za programiranje koji prihvaća Aider, Continue ili OpenAI-kompatibilni API. Stabilnost se poboljšava ako se u promptu jasno navedu koraci rada, primjerice: „prije izmjena provjeri povezane datoteke i testove”, „neka promjene budu male” i „na kraju prijavi rezultate testova”.
Ako želite što više smanjiti gubitak kvalitete zbog kvantizacije, Q5 varijante također su opcija, ali na 24 GB ostavljaju manje prostora za kontekst. U praksi je često lakše raditi s Q4 varijantom koja ostavlja dovoljno prostora za kontekst i predmemoriju.
Kako jednom rečenicom sažeti lokalnu LLM scenu u rujnu?
Bio je to mjesec u kojem se interes pomaknuo s „koji je model najpametniji?” na „koliko posla može dovršiti u mom okruženju i po kojoj cijeni?”.
Zatvoreni modeli i dalje su na samom vrhu, ali suočavaju se s cjenovnim natjecanjem i sigurnosnim problemima. Otvoreni modeli nisu se natjecali samo brojkama golemih modela, nego su krenuli prema brzom pokretanju modela klase 27B na osobnim GPU-ovima te njihovoj integraciji u agente i stvarne razvojne tokove rada.
Ako imate RTX 4090, trenutno je siguran izbor početi s 4-bitnom verzijom Qwen3.8-27B. Situacija bi se mogla promijeniti ako Qwen4-27B bude službeno objavljen ili se pojavi manja verzija DeepSeek V4.1 serije. No ako želite model instalirati večeras i već sutra prepustiti mu pisanje koda, Qwen3.8-27B je trenutačno najrealniji izbor.
※ Ovaj članak temelji se na javno dostupnim informacijama na dan 25. rujna 2026. i dnevnim izvješćima ove stranice od 3. do 25. rujna. Vrijednosti benchmarka modela uključuju službene objave, a brzina i točnost u stvarnom okruženju ovise o načinu kvantizacije, runtimeu, duljini konteksta i konfiguraciji agenta.



