Claude 4.1 Opus

Claude 4.1 Opus je najnovejši model umetne inteligence podjetja Anthropic, ki že povzroča veliko zanimanja na področju agentne umetne inteligence, prenove kode in zahtevnih nalog, ki zahtevajo poglobljeno razmišljanje. Ta model prinaša številne izboljšave in novosti, ki ga postavljajo v ospredje sodobnih AI orodij.

image

    Ključne novosti in izboljšave

    • Najvišja ocena na področju kodiranja: Claude 4.1 dosega 74,5 % na testu SWE-bench Verified, kar je njegova najvišja ocena doslej in pomeni pomemben napredek v primerjavi s prejšnjimi različicami.

    • Zanesljivo iskanje in odpravljanje napak: Podjetje Rakuten poroča, da model učinkovito najde in odpravi napake v kodi, pri tem pa ohranja redko ravnovesje, ki ga pri AI orodjih pogosto pogrešamo.

    • Izboljšave za mlajše razvijalce: Windsurf je opazil izboljšanje za eno standardno deviacijo pri nalogah, ki jih običajno opravljajo manj izkušeni razvijalci, v primerjavi s prejšnjo različico Opus 4.

    • Natančnejša prenova več datotek: Claude 4.1 omogoča bolj natančno prenovo kode v več datotekah hkrati, pri čemer je število napak občutno manjše.

    • Napredna funkcija “razširjenega razmišljanja”: Ta funkcija omogoča modelu, da probleme rešuje postopoma, po korakih, kar bistveno izboljša natančnost in zanesljivost rezultatov.

    • Dostopnost: Model je že na voljo prek API-ja, Amazon Bedrock in Vertex AI, pri čemer cene ostajajo nespremenjene.

    • Prihodnje nadgradnje: Anthropic napoveduje še večje izboljšave v bližnji prihodnosti, s poudarkom na uporabi v resničnem svetu in agentnih rešitvah.

      Pomembnost in vpliv

      Claude 4.1 Opus ni zgolj še ena posodobitev – predstavlja pomemben korak naprej v razvoju praktičnih agentnih AI orodij. Prehod od “samodokončanja” (auto-complete) do “samorazmišljanja” (auto-reason) je zdaj realnost, kar pomeni, da umetna inteligenca postaja vse bolj uporabna in zanesljiva tudi pri kompleksnih nalogah.

      Z modelom Claude 4.1 Opus se dviguje standard na področju umetne inteligence za razvijalce in podjetja. Njegove izboljšane sposobnosti reševanja problemov, natančnost pri prenovi kode in napovedane prihodnje nadgradnje kažejo, da agentna umetna inteligenca postaja ne le obetavna, temveč tudi praktična rešitev za vsakodnevne izzive v svetu programiranja in tehnologije.

      GPT-5

      • Najzmogljivejši model doslej: GPT-5 predstavlja pomemben preskok v razvoju umetne inteligence, saj ni le pametnejši, temveč zna prepoznati, kdaj je potreben poglobljen razmislek in kako pristopiti k zapletenim situacijam.

      • Ključne novosti:
        • Brezplačna uporaba za vse uporabnike, z različnimi stopnjami dostopa glede na naročniški paket (Free, Plus, Pro, Team, Edu, Enterprise).
        • Nadgrajen glasovni način in izboljšan model »mišljenja« (reasoning), ki omogoča preklapljanje med hitrim in poglobljenim razmišljanjem.
        • Odprava dostopa do starejših modelov (o3, 4.5…).
        • Cenejši, hitrejši in domnevno boljši prek API-ja.
        • Izboljšana uporaba agencijskih orodij, kot je samodejno premikanje po spletnih straneh.
        • Vgrajeno »razmišljanje« omogoča odločanje o globini odgovora glede na kompleksnost naloge.
      • Izboljšave v zmogljivostih:
        • Najboljši rezultati na področjih kodiranja, matematike, zdravstva in pisanja, z večjo hitrostjo in natančnostjo.
        • Razvijalcem omogoča oblikovanje, odpravljanje napak in gradnjo kompleksnih aplikacij ter iger iz enega samega navodila.
        • Pisci dobijo naprednega sopilota, ki je bolj poetičen, strukturiran in učinkovit pri urejanju osnutkov.
      • Manj halucinacij!

      • image
      • Varnost in zanesljivost:
        • Novo usposabljanje za varnost zmanjšuje halucinacije, povečuje iskrenost odgovorov in omogoča zavrnitev neprimernih zahtev brez pretirane zaščitniškosti.
      • Dostopnost in različice:
        • Pro uporabniki imajo dostop do GPT-5 Pro, ki je zasnovan za globoko in trajno razmišljanje, primerljivo s človeškimi strokovnjaki na področjih z visokimi tveganji.
        • Uporabniki Free imajo ob preseženi omejitvi dostop do GPT-5 mini, Plus uporabniki imajo višje omejitve, Pro uporabniki pa neomejen dostop.
      • Napredna funkcionalnost:
        • GPT-5 lahko razmišlja z orodji in jih uporablja za gradnjo, kar pomeni temeljito spremembo v interakciji z agenti in LLM-ji.
        • Zmožen je zadržati več informacij in iz enega navodila ustvariti različne aplikacije, ki jih je mogoče prilagoditi.
        • Primer: iz preprostega navodila je GPT-5 ustvaril spletno aplikacijo za učenje francoščine z različnimi funkcionalnostmi.
      • Primerjava z dosedanjimi modeli:
        • GPT-3 je deloval kot dijak, GPT-4 kot študent, GPT-5 pa kot doktor znanosti na katerem koli področju (po Altmanu).

      image

      • Praktična usmerjenost:
        • GPT-5 je zasnovan za praktične aplikacije, ne le za akademsko raziskovanje.
        • Avtomatizira 72 % nalog programskega inženiringa, kar pomeni velik napredek v industriji.
        • Najboljši model za kodiranje na svetu, z velikim vplivom na celotno industrijo.
      • Omejitve in izzivi:
        • GPT-5 ni najboljši pri poslovnem in kreativnem pisanju.
        • Zahteva uvajanje v kodno bazo in standarde podjetja ter specifične namige za začetek dela, saj nima lastnega pomnilnika.
      • Vpliv na prihodnost:
        • GPT-5 označuje začetek nove dobe umetne inteligence, ki deluje kot sposoben sodelavec, ne le kot orodje.
        • Prinaša večjo varnost, zanesljivost in sposobnost reševanja kompleksnih problemov, kar ga približuje splošni umetni inteligenci (AGI).
        • Ključno vprašanje ostaja, kako se bodo uporabniki prilagodili sodelovanju z naprednim AI.

      image

      LMM halucinacije: Soundslice je dodal novo funkcionalnost ker ga je v to “prisilil” LMM

      Ustanovitelj Soundslice je odkril, da ChatGPT halucunera – lažno obljublja – pretvorbo ASCII tabulatur, in namesto da bi to preprosto zavrnil, je razvil podporo za to halucinacijsko funkcijo.

      Screenshot of ChatGPT telling users to enter this ASCII tab into soundslice.com

      V članku na svojem blogu  https://www.holovaty.com/writing/chatgpt-fake-feature/  Adrian Holovaty opisuje nenavadno izkušnjo v podjetju Soundslice, kjer je njihov skener za notne zapise začel prejemati nepričakovane prenose zaslonskih posnetkov ASCII tabulatur od uporabnikov, ki jih je tja usmeril ChatGPT. Umetna inteligenca je uporabnikom napačno sporočala, da Soundslice podpira uvoz ASCII tabulatur za predvajanje zvoka, kar je povzročilo pritok nepomembnih prenosov in zmedo glede ponudbe podjetja. Po premisleku se je Holovatyjev tim odločil, da bo razvil funkcijo, ki bo zadovoljila to zahtevo, kljub temu da je bila nenamerna in izhajala iz napačnih informacij.

      Ta situacija odpira zanimiva vprašanja o tem, kako naj podjetja odgovorijo na netočnosti, ki jih širijo AI orodja, kot je ChatGPT. Čeprav je ustvarjanje rešitev, ki ustrezajo potrebam uporabnikov, pomembno, Holovaty izraža ambivalentnost glede tega, da mora podjetje prilagoditi svoj izdelek na podlagi nesporazuma, in poudarja izzive pri usklajevanju pričakovanj potrošnikov, na katere vplivajo nezanesljivi viri.

      Adrian Holovaty je tako opazil, da so se v dnevnikih napak (access logs) pojavljali zasloni seje ChatGPT z ASCII-tablaturami, ki so prihajali v njegov skener za notne liste. ChatGPT je uporabnikom samozavestno zagotavljal, da Soundslice lahko pretvori ASCII-tablature v slišno glasbo, s čimer je ustvarjal lažna pričakovanja. Namesto da bi po spletni strani razporedil opozorila, se je Holovaty odločil, da bo fukcionalnost tudi dejansko razširil, da bo lahko obdeloval ASCII-tablature.

      To je morda prvi primer, da je podjetje dodalo funkcijo izključno zato, da bi popravilo razširjene napačne informacije posredovane od “umetne inteligence”. Halucinacije umetne inteligence torej ne le da lahko zavajajo uporabnike, ampak tudi pritiskajo na produktne ekipe, da ponovno premislijo o načrtih – ali naj podjetja sledijo vsakemu mitu, ki ga ustvari umetna inteligenca, ali naj ohranijo svojo vizijo

      DeepSeek zdaj omogoča vsakomur, da ustvari in zažene preproste video igre v Pythonu ali HTML5; ni potrebna nobena namestitev.

      • DeepSeek je pravkar izdal nadgrajeno različico svojega reasoning modela R1, skupaj z lažjo različico, ki lahko deluje na enem samem grafičnem procesorju. DeepSeekov izpopolnjen model, R1-0528-Qwen3-8B, deluje na enem samem grafičnem procesorju z 40 GB.
      • Premaga modele, kot je Gemini 2.5 Flash, v zahtevnih matematičnih primerjavah, kot je AIME 2025.
      • V drugem naprednem matematičnem testu, HMMT, je skoraj enakovreden z Microsoftovim Phi 4.
      • Kljub manjšemo obsegu je zasnovan za akademsko in industrijsko uporabo – in je brezplačno na voljo pod licenco MIT. Vendar pa ima model R1-0528 precej velik problem: cenzuro. Neodvisno testiranje kaže, da je znatno bolj omejen pri obravnavanju politično občutljivih tem.Čeprav je njegova zmogljivost pri kodiranju in razmišljanju impresivna, pogosto odraža uradna stališča kitajske vlade – zlasti pri vprašanjih, kot so Xinjiang in kritika vodstva.
      • DeepSeek počne tisto, česar mnogi laboratoriji za odprtokodne modele ne morejo: omogoča visoko raven reasoninga (sklepanja oz. razmišljanja) na manj zahtevni strojni opremi. A je hkrati tudi primer, kako politični pritisk oblikuje umetno inteligenco. Vprašanje zdaj ni več le »Kako pameten je ta model?«, ampak »Kdo odloča, kaj bo rekel?«
      • Za razliko od Claude 3.7 ali GPT o3 so nadgrajena orodja za kodiranje DeepSeek brezplačna, kar je zelo pomembno za šole in neprofitne organizacije. Uporabniki lahko zdaj ustvarjajo interaktivne spletne strani, ki v enem koraku pridobivajo realne podatke, jih analizirajo in vizualizirajo rezultate.Raziskovalci, novinarji in celo zdravstveni delavci lahko ustvarjajo nadzorne plošče in orodja brez infrastrukture.

      OpenAI O3 pro

      image

      OpenAI je predstavil O3 pro, novo zmogljivo različico svojega reasoning modela O3. To je zdaj najnaprednejši model, ki je na voljo v ChatGPT.

      O3 pro bo od tega tedna nadomestil O1-pro za uporabnike Pro in Team.

      Deluje korak za korakom skozi probleme in izboljšuje zmogljivost v matematiki, znanosti in programiranju.

      Cena API je 20 USD na milijon vhodnih tokenov in 80 USD na milijon izhodnih tokenov.

      Strokovni preizkuševalci so O3 pro pred O3 preferirali zaradi jasnosti, natančnosti in upoštevanja navodil.

      Lahko išče po spletu, izvaja Python, obdeluje vizualne vnose in prikliče pretekle interakcije.

      O3 pro je v glavnih primerjavah umetne inteligence prekašal Google Gemini 2.5 Pro in Claude 4 Opus.

      Trenutne omejitve: zaenkrat ni mogoče ustvarjati slik, ni podpore za Canvas, začasni klepeti so onemogočeni.

      OpenAI ne le premika meje modela, ampak na novo opredeljuje, kaj v praksi pomeni »splošna inteligenca«. Preskok v zmogljivosti na področju sklepanja in znanosti kaže, kam se AI razvija: ne le hitra in tekoča, ampak tudi resnično premišljena.