Članek opisuje eksperimentalni »drawing arena« sistem, kjer štirje vrhunski modeli z omejenim naborom orodij rišejo reprodukcije dveh slik (Mona Lisa, Zvezdna noč) ter pet risb po tekstovnih pozivih na prazno platno.
Vsi modeli uporabljajo enak nabor orodij (barvni svinčnik: nastavitev barve, čopiča, pritiska, poteze, brisanje, zabris/»smudge« in ogled platna), kar omogoča primerjavo strategij uporabe orodij pri daljših nalogah.
GPT-5.6 Sol se izkaže kot najbolj uravnotežen: najboljše ali skoraj najboljše vizualne rezultate doseže z razmeroma malo koraki, zmernim časom in nizkimi stroški v primerjavi z drugimi frontier modeli.
Claude Fable 5 porabi bistveno več časa, korakov in žetonov, pri čemer končna kakovost risb zaostaja za GPT-5.6 Sol, kar ga v tem eksperimentu postavi kot najmanj ugodno izbiro glede razmerja med kakovostjo in stroški.
V vseh ciljnih (target) ponovitvah modeli dosežejo najboljšo strukturno podobnost (SSIM) nekje sredi procesa, nato pa z nadaljnjim popravljanjem rezultat degradirajo, kar kaže na odsotnost robustne ustavitvene strategije pri lastnem izboljševanju vizualnega izhoda.
DEJSTVA:
Preizkušeni modeli so: GPT-5.6 Sol, Claude Fable 5, Grok 4.5 in Gemini 3.6 Flash; skupaj so ustvarili 28 risb (2 tarči + 5 pozivov × 4 modeli).
GPT-5.6 Sol povprečno porabi 29 korakov na risbo, 6,2 minute, 3,4 milijona žetonov in okoli 7,74 USD stroška, pri čemer ima povprečno 6 samopregledov platna.
Claude Fable 5 povprečno porabi 54 korakov, 12,5 minute, 14,6 milijona žetonov in približno 160,58 USD, z 15,6 samopregledi; strošek je približno 20-krat višji od ostalih.
Grok 4.5 ima povprečno 99 korakov na risbo, 4,8 minute, 34 milijonov žetonov in ocenjeni strošek 9,21 USD, pri čemer približno 65% vseh 1.349 klicev orodij predstavljajo nastavitve barve, čopiča in pritiska.
Gemini 3.6 Flash porabi povprečno 73 korakov, 6,9 minute, 27,7 milijona žetonov in 12,87 USD, hkrati pa je najintenzivnejši pri samopregledih (okoli 23 ogledov platna na risbo), kar mu omogoča najvišje SSIM vrhove, a ne nujno najboljši končni vizualni rezultat.
Claude Fable 5 in GPT-5.6 Sol sta v avtonomnem preizkusu ustvarila AI-glasbena videa, vendar so rezultati kljub uspešni tehnični izvedbi ostali slogovno in pripovedno nedosledni. Članek ugotavlja, da je Claude praviloma hitrejši in dražji, GPT pa bolj eksperimentalen pri montaži ter izbiri modelov.
BISTVO
TryAI je obema modeloma dal isto skladbo, »Uptown Funk«, besedilni opis, časovno usklajen prepis besedila, proračun in dostop do spletnega iskanja, generatorjev slik/videa ter FFmpeg.
Izvedeni so bili štirje samostojni zagoni: Claude Fable 5 in GPT-5.6 Sol, vsak s proračunoma 25 in 100 USD za generiranje vsebin.
Vsi štirje zagoni so sami dokončali veljaven video v polni dolžini z izvirno zvočno skladbo, brez prekoračitve časovne ali korakovne omejitve.
Claude je uporabljal izključno tekst-v-video pristop, medtem ko je GPT pri nižjem proračunu najprej ustvaril statične slike in jih nato animiral, pri višjem pa kombiniral več video modelov.
Ključne omejitve so bile nedoslednost likov med kadri, dobesedno vizualiziranje besedila, šibka sinhronizacija gibanja z ritmom in skoraj popolna odsotnost iterativnega preverjanja oziroma izboljševanja končne montaže.
DEJSTVA
Claude Fable 5 je pri proračunu 25 USD ustvaril 54 videoposnetkov, porabil 24,30 USD za generiranje in končni strošek skupaj z LLM-žetoni je znašal 41,29 USD.
GPT-5.6 Sol je pri 25 USD ustvaril 61 slik in 46 videoposnetkov; generiranje je stalo 23,18 USD, skupni strošek pa 27,45 USD.
Claude Fable 5 je pri 100 USD ustvaril 80 videoposnetkov, porabil 48,60 USD za generiranje ter dosegel izhodno ločljivost 1920 × 1080.
GPT-5.6 Sol je pri 100 USD ustvaril 70 videoposnetkov, uporabil Wan 2.5, Veo 3.1 Lite in Hailuo 2.3 Standard ter za generiranje porabil 36,57 USD.
Najdražji preizkus je bil Claude Fable 5 pri 100 USD: 73,65 USD skupnega stroška, od tega 25,05 USD za LLM-žetone; hkrati je bil tudi najhitrejši visokoproračunski zagon, s časom 38 minut in 56 sekund.
OpenAI lansira ChatGPT 5.6 z modeli Sol (najdražji), Terra (srednji kompromis) in Luna (najcenejši), poleg starega 5.5.
ChatGPT Work/Codex omogoča izbiro kombinacije modela, „effort“ in hitrosti, kar po avtoru tvori okoli 30 kombinacij.
Simulacija za 150 zaposlenih pri ChatGPT: 3.000 USD osnovne naročnine (150 × 20 USD) + približno 17.000 USD dodatnih stroškov porabe tokenov pri tipični uporabi.
Popolna uporaba Sol (High) v isti simulaciji bi dosegla okoli 37.000 USD mesečno, oziroma približno 250 USD na zaposlenega.
Thinking Machines Lab je predstavil svoj prvi interni model Inkling kot odprto-težnostni (open-weight) alternativni pristop k velikim zaprtim modelom OpenAI, Anthropic in Google.
Inkling je zasnovan kot mešanica ekspertov z zelo velikim številom parametrov, a optimizirano porabo za posamezno nalogo, kar cilja na kombinacijo zmogljivosti in stroškovne učinkovitosti.
Strategija podjetja je, da model služi kot prilagodljiva osnova za podjetja, ki ga preko platforme Tinker fino prilagodijo svojim podatkom in procesom, namesto da kupijo generičen chatbot kot storitev.
Thinking Machines zagovarja tezo, da organizacijsko-specifično znanje in prilagoditev AI presežeta centralno trenirane, “zacementirane” modele in da odprti modeli bolje ščitijo poslovno znanje pred “dvojnim plačevanjem”.
Podjetje je v kratkem času zgradilo infrastrukturo, sklenilo velik partnerski dogovor z Nvidio in izvedlo odmeven projekt z Bridgewater Associates, vendar ostaja odprto vprašanje dolgoročne ekonomike in financiranja takšnega pristopa.
DEJSTVA
Inkling ima skupno 975 milijard parametrov v arhitekturi mixture-of-experts, pri čemer za posamezno nalogo aktivira približno 41 milijard parametrov.
Model je bil treniran na približno 45 bilijonih tokenov besedila, slike, zvoka in videa ter nativno sklepa preko vseh štirih modalitet, trenutno pa generira le besedilne izhode (vključno s kodo in strukturiranimi podatki).
Na enem izmed kodirnih benchmarkov naj bi Inkling dosegel enako zmogljivost kot Nvidia Nemotron 3 Ultra, pri čemer porabi približno tretjino števila tokenov.
V skupnem projektu z Bridgewater Associates naj bi dodatno treniran odprtokodni model dosegel 84,7% uspešnost na testih finančnega sklepanja ob približno štirinajstkrat nižjih stroških poganjanja v primerjavi s top zaprtimi modeli.
Thinking Machines zaposluje približno 200 ljudi in je Inkling treniral na Nvidiinih GB300 NVL72 sistemih v okviru partnerstva za do enega gigavata Vera Rubin računske kapacitete.
CITATI
Podjetje poudarja, da Inkling “ni najmočnejši model na voljo danes, odprt ali zaprt”, temveč stremi k uravnoteženi zmogljivosti in prilagodljivosti.
V prejšnji objavi je zapisalo, da centralno trenirani, nato “zacementirani” modeli podcenjujejo ekspertno znanje, ki je “specifično za ljudi, ki ga imajo”, zato jih AI, ki ga oblikujejo organizacije same, lahko preseže.
Microsoftov izvršni direktor Satya Nadella opozarja, da podjetja pri zaprtih modelih “v bistvu plačajo dvakrat”: v naročnini in z oddajo poslovnega znanja, ki ga modeli ponovno uporabijo v prihodnjih verzijah.
Direktor Hugging Face Clem Delangue napoveduje, da bodo “frontier” modeli vse bolj rezervirani za eksperimentiranje in visoko vrednostne naloge, medtem ko bo večina produkcijskega AI dela prešla na zasebne ali odprtokodne alternative.
Thinking Machines pri po-treniranju priznava delno uporabo izhodov drugih odprtih modelov, vključno z Moonshot AI Kimi K2.5, vendar za naslednji model napoveduje “popolnoma samozadosten” post-trening brez takšne distilacije.
Model GLM 5.2 je na realnem naboru podatkov ene britanske male družbe pripravil četrtletni obračun DDV z odstopanjem le 0,07 GBP v primerjavi s človeško pripravljenim obračunom.
Test je vključeval celoten kvartal (59 transakcij) z uporabo dejanskega računovodskega sistema, CLI orodja in dostopa do interneta, pri čemer je bil model strogo ločen od referenčnih (ground truth) podatkov.
Rezultati kažejo, da je GLM 5.2 dosledno pravilno klasificiral transakcije, pravilno pripenjal račune in reševal kompleksne primere, pri čemer so bile napake pretežno konceptualne in ne finančno pomembne.
Najresnejša napaka je bila napačna knjižba osnovnega kapitala (founder shares), medtem ko so druge napake v večini primerov povezane z zamenjavo kategorij »zero‑rated« in »tax‑exempt« ter obravnavo razdeljenih (split) transakcij.
Avtorji sklepajo, da je knjigovodstvo za mala podjetja v veliki meri rešen problem ter da je naslednji korak gradnja ustrezne nadgradnje (scaffolding), ki take modele varno in učinkovito integrira v procese UK startupov in SME.
DEJSTVA:
Test je zajemal 59 transakcij v prvem četrtletju 2026 (januar, februar, marec) podjetja Vineyard Finance, s skupno 354 kontrolnimi točkami (59 × 6 kriterijev).
Model je v 68 minutah uporabil 5,73 milijona vhodnih žetonov in 193.483 izhodnih žetonov, s stroškom približno 2,73 USD za celoten kvartal.
Po mesecih je model naredil 112 klicev (turns) in 137 klicev orodij (tool calls), pri čemer je največji enkraten poziv izkoristil približno 13,3% od 1.048.576-žeton kontekstnega okna.
Skupno je bilo 20 neuspešno opravljenih kontrolnih kriterijev na 18 transakcijah, od tega ena ocenjena kot resna napaka (obravnava »founder shares« kot »Capital Account«).
Človeški računovodski servis za tipičen kvartalni obračun DDV za UK SME stane približno 750–2.100 GBP, kar pomeni, da je strošek modela pod 1% človeškega stroška.
OpenAI je predstavil GPT-Live, novo generacijo glasovnih modelov, ki želi pogovor z AI približati naravnemu človeškemu dialogu.
Ključna novost je arhitektura »full‑duplex«, ki omogoča hkratno poslušanje in govorjenje ter s tem nižjo latenco in bolj tekočo interakcijo.
GPT-Live zmanjšuje trenje pri uporabi AI v vsakodnevnih rutinah, ker odpravlja izključno besedilni vmesnik in omogoča bolj spontano glasovno rabo.
Problem: bolj človeški glas povečuje verjetnost, da uporabniki modelu verjamejo, kljub temu da ostajajo prisotne halucinacije in klasične omejitve LLM.
Oxfordova študija kaže, da pomemben delež ljudi uporablja chatbote kot čustvene zaupne partnerje, kar odpira vprašanja tveganj, zasebnosti in odvisnosti.
DEJSTVA:
OpenAI je v sredo lansiral GPT-Live-1 za uporabnike paketov Go, Plus in Pro ter GPT-Live-1 Mini kot privzeto različico za brezplačne uporabnike.
Oxford Internet Institute je anketiral 2.000 odraslih prebivalcev Združenega kraljestva glede uporabe velikih jezikovnih modelov.
31% rednih uporabnikov LLM poroča, da modele uporablja za čustveno podporo, vključno z razmišljanjem o problemih in sprejemanjem odločitev.
38% rednih uporabnikov LLM se obrača na te modele po nasvet glede osebnih odnosov, dve tretjini pa po informacije o zdravstvenih vprašanjih.