AI modeli : GPT-5.6 Sol jasno vodi v kakovosti risb in učinkovitosti.

VIR: https://www.tryai.dev/blog/ai-drawing-arena-colored-pencils-claude-gpt-grok

image

BISTVO:

Članek opisuje eksperimentalni »drawing arena« sistem, kjer štirje vrhunski modeli z omejenim naborom orodij rišejo reprodukcije dveh slik (Mona Lisa, Zvezdna noč) ter pet risb po tekstovnih pozivih na prazno platno.

Vsi modeli uporabljajo enak nabor orodij (barvni svinčnik: nastavitev barve, čopiča, pritiska, poteze, brisanje, zabris/»smudge« in ogled platna), kar omogoča primerjavo strategij uporabe orodij pri daljših nalogah.

GPT-5.6 Sol se izkaže kot najbolj uravnotežen: najboljše ali skoraj najboljše vizualne rezultate doseže z razmeroma malo koraki, zmernim časom in nizkimi stroški v primerjavi z drugimi frontier modeli.

Claude Fable 5 porabi bistveno več časa, korakov in žetonov, pri čemer končna kakovost risb zaostaja za GPT-5.6 Sol, kar ga v tem eksperimentu postavi kot najmanj ugodno izbiro glede razmerja med kakovostjo in stroški.

V vseh ciljnih (target) ponovitvah modeli dosežejo najboljšo strukturno podobnost (SSIM) nekje sredi procesa, nato pa z nadaljnjim popravljanjem rezultat degradirajo, kar kaže na odsotnost robustne ustavitvene strategije pri lastnem izboljševanju vizualnega izhoda.

DEJSTVA:

Preizkušeni modeli so: GPT-5.6 Sol, Claude Fable 5, Grok 4.5 in Gemini 3.6 Flash; skupaj so ustvarili 28 risb (2 tarči + 5 pozivov × 4 modeli).

GPT-5.6 Sol povprečno porabi 29 korakov na risbo, 6,2 minute, 3,4 milijona žetonov in okoli 7,74 USD stroška, pri čemer ima povprečno 6 samopregledov platna.

Claude Fable 5 povprečno porabi 54 korakov, 12,5 minute, 14,6 milijona žetonov in približno 160,58 USD, z 15,6 samopregledi; strošek je približno 20-krat višji od ostalih.

Grok 4.5 ima povprečno 99 korakov na risbo, 4,8 minute, 34 milijonov žetonov in ocenjeni strošek 9,21 USD, pri čemer približno 65% vseh 1.349 klicev orodij predstavljajo nastavitve barve, čopiča in pritiska.

Gemini 3.6 Flash porabi povprečno 73 korakov, 6,9 minute, 27,7 milijona žetonov in 12,87 USD, hkrati pa je najintenzivnejši pri samopregledih (okoli 23 ogledov platna na risbo), kar mu omogoča najvišje SSIM vrhove, a ne nujno najboljši končni vizualni rezultat.