TEST: "Risanje" Mona Lise z GPT-5.6, Claudeom, Geminijem in Grokom

AI modeli : GPT-5.6 Sol jasno vodi v kakovosti risb in učinkovitosti.

VIR: https://www.tryai.dev/blog/ai-drawing-arena-colored-pencils-claude-gpt-grok

image

BISTVO:

Članek opisuje eksperimentalni »drawing arena« sistem, kjer štirje vrhunski modeli z omejenim naborom orodij rišejo reprodukcije dveh slik (Mona Lisa, Zvezdna noč) ter pet risb po tekstovnih pozivih na prazno platno.

Vsi modeli uporabljajo enak nabor orodij (barvni svinčnik: nastavitev barve, čopiča, pritiska, poteze, brisanje, zabris/»smudge« in ogled platna), kar omogoča primerjavo strategij uporabe orodij pri daljših nalogah.

GPT-5.6 Sol se izkaže kot najbolj uravnotežen: najboljše ali skoraj najboljše vizualne rezultate doseže z razmeroma malo koraki, zmernim časom in nizkimi stroški v primerjavi z drugimi frontier modeli.

Claude Fable 5 porabi bistveno več časa, korakov in žetonov, pri čemer končna kakovost risb zaostaja za GPT-5.6 Sol, kar ga v tem eksperimentu postavi kot najmanj ugodno izbiro glede razmerja med kakovostjo in stroški.

V vseh ciljnih (target) ponovitvah modeli dosežejo najboljšo strukturno podobnost (SSIM) nekje sredi procesa, nato pa z nadaljnjim popravljanjem rezultat degradirajo, kar kaže na odsotnost robustne ustavitvene strategije pri lastnem izboljševanju vizualnega izhoda.

DEJSTVA:

Preizkušeni modeli so: GPT-5.6 Sol, Claude Fable 5, Grok 4.5 in Gemini 3.6 Flash; skupaj so ustvarili 28 risb (2 tarči + 5 pozivov × 4 modeli).

GPT-5.6 Sol povprečno porabi 29 korakov na risbo, 6,2 minute, 3,4 milijona žetonov in okoli 7,74 USD stroška, pri čemer ima povprečno 6 samopregledov platna.

Claude Fable 5 povprečno porabi 54 korakov, 12,5 minute, 14,6 milijona žetonov in približno 160,58 USD, z 15,6 samopregledi; strošek je približno 20-krat višji od ostalih.

Grok 4.5 ima povprečno 99 korakov na risbo, 4,8 minute, 34 milijonov žetonov in ocenjeni strošek 9,21 USD, pri čemer približno 65% vseh 1.349 klicev orodij predstavljajo nastavitve barve, čopiča in pritiska.

Gemini 3.6 Flash porabi povprečno 73 korakov, 6,9 minute, 27,7 milijona žetonov in 12,87 USD, hkrati pa je najintenzivnejši pri samopregledih (okoli 23 ogledov platna na risbo), kar mu omogoča najvišje SSIM vrhove, a ne nujno najboljši končni vizualni rezultat.

$100 AI glasbeni video: Claude Fable 5 proti GPT-5.6 Sol

Claude Fable 5 in GPT-5.6 Sol sta v avtonomnem preizkusu ustvarila  AI-glasbena videa, vendar so rezultati kljub uspešni tehnični izvedbi ostali slogovno in pripovedno nedosledni. Članek ugotavlja, da je Claude praviloma hitrejši in dražji, GPT pa bolj eksperimentalen pri montaži ter izbiri modelov.

VIR: https://www.tryai.dev/blog/ai-music-video-arena-claude-vs-gpt-5.6

BISTVO
TryAI je obema modeloma dal isto skladbo, »Uptown Funk«, besedilni opis, časovno usklajen prepis besedila, proračun in dostop do spletnega iskanja, generatorjev slik/videa ter FFmpeg.

Izvedeni so bili štirje samostojni zagoni: Claude Fable 5 in GPT-5.6 Sol, vsak s proračunoma 25 in 100 USD za generiranje vsebin.

Vsi štirje zagoni so sami dokončali veljaven video v polni dolžini z izvirno zvočno skladbo, brez prekoračitve časovne ali korakovne omejitve.

Claude je uporabljal izključno tekst-v-video pristop, medtem ko je GPT pri nižjem proračunu najprej ustvaril statične slike in jih nato animiral, pri višjem pa kombiniral več video modelov.

Ključne omejitve so bile nedoslednost likov med kadri, dobesedno vizualiziranje besedila, šibka sinhronizacija gibanja z ritmom in skoraj popolna odsotnost iterativnega preverjanja oziroma izboljševanja končne montaže.

DEJSTVA
Claude Fable 5 je pri proračunu 25 USD ustvaril 54 videoposnetkov, porabil 24,30 USD za generiranje in končni strošek skupaj z LLM-žetoni je znašal 41,29 USD.

GPT-5.6 Sol je pri 25 USD ustvaril 61 slik in 46 videoposnetkov; generiranje je stalo 23,18 USD, skupni strošek pa 27,45 USD.

Claude Fable 5 je pri 100 USD ustvaril 80 videoposnetkov, porabil 48,60 USD za generiranje ter dosegel izhodno ločljivost 1920 × 1080.

GPT-5.6 Sol je pri 100 USD ustvaril 70 videoposnetkov, uporabil Wan 2.5, Veo 3.1 Lite in Hailuo 2.3 Standard ter za generiranje porabil 36,57 USD.

Najdražji preizkus je bil Claude Fable 5 pri 100 USD: 73,65 USD skupnega stroška, od tega 25,05 USD za LLM-žetone; hkrati je bil tudi najhitrejši visokoproračunski zagon, s časom 38 minut in 56 sekund.