Microsoft Phi-4

Microsoft je pravkar predstavil Phi-4, kompaktni jezikovni model z le 14 milijardami parametrov, ki se lahko kot profesionalec loti zapletenega razmišljanja.

image

V čem Phi-4 izstopa:
Matematične spretnosti: Prekaša veliko večje modele in je celo boljši od Gemini Pro 1.5 pri matematičnih tekmovalnih nalogah.
Učinkovita zasnova: Zaradi skrbno izbranih naborov podatkov in izboljšav po usposabljanju je majhen, vendar ima veliko moč.
Varnost : Vključuje orodja, kot so ščitniki za pozive in filtri vsebine, ki poskrbijo za odgovorne in kakovostne rezultate.
Phi-4 je zdaj na voljo v Azure AI Foundry pod Microsoftovo raziskovalno licenco, v kratkem pa bo na voljo v aplikaciji Hugging Face.

image

  • To je Microsoftov najnovejši član družine generativnih umetnih inteligenc, ki ima 14 milijard parametrov. Zaradi boljših podatkov za učenje in pametnejšega razvoja je odlična pri nalogah, kot je reševanje težkih matematičnih problemov.
  • Manjši modeli, kot je Phi-4 (poleg konkurentov, kot sta GPT-4o mini in Claude 3.5 Haiku), so vzhajajoče zvezde, saj so cenejši in hitrejši, hkrati pa še vedno zagotavljajo dobro zmogljivost.
  • Model Phi-4 je pridobil podporo z visokokakovostnimi sintetičnimi in s strani ljudi ustvarjenimi podatkovnimi nizi ter nekaj skrivnostne omake pri popravkih po usposabljanju.
  • Za zdaj je Phi-4 zaklenjen in na voljo le na Microsoftovi platformi Azure AI Foundry za raziskovalno uporabo.
  • To je prvi model serije Phi, ki je bil predstavljen, odkar je oktobra Sébastien Bubeck, eden najboljših Microsoftovih strokovnjakov za umetno inteligenco, zapustil podjetje in odšel v OpenAI.

Izbira najprimernejšega modela (stanje oktober 2024)

Prvi korak je razumevanje vašega cilja. Ali se ukvarjate z ustvarjanjem besedil, ustvarjanjem slik, klasifikacijo, regresijo ali čim drugim? Različni modeli umetne inteligence so optimizirani za različne naloge:

image

Modeli GPT GPT-4o IN  GPT-4.0 Turbo:

Idealni so za vsestranske besedilne naloge, kot so ustvarjanje vsebine, prevajanje, povzemanje, odgovarjanje na vprašanja itd.
Za bolj zapletene poizvedbe in natančne, niansirane odgovore bo najboljša izbira model GPT-4.0 Turbo. Ta model je odličen pri sledenju navodilom po korakih, sklepanju in prepoznavanju logičnih napak.
Za hitre in človeku podobne odgovore uporabite GPT-4o, saj je ta model optimiziran za zmogljivost in učinkovitost.

Claude Haiku in Claude Sonet:

Claude 3 se odlikujeta po razširjenem kontekstualnem oknu, ki znatno izboljša njuno sposobnost za razumevanje zapletenih in dolgih informacij. Trenutno sta najboljša za naloge ustvarjalnega pisanja (pripovedovanje zgodb, dosleden ton glasu, gradnja likov itd.).
Claude Sonnet uravnoteženo usklajuje inteligentnost in hitrost.
Tako kot GPT-4o je tudi Claude Haiku kompakten model, ki omogoča skoraj takojšnje odgovore.

Claude Opus:

Claude Opus je zasnovan za opravljanje zelo zapletenih nalog (kot so interaktivno kodiranje, odkrivanje zdravil, napredna analiza financ in tržnih trendov, napovedovanje itd.) in se ponaša z izjemno zmogljivostjo, inteligenco, tekočnostjo in razumevanjem. Ponuja vrhunske zmogljivosti na različnih področjih.

Gemini:

Sposoben je obdelati več vrst podatkov, kar omogoča naloge, kot so analiza slik, povzemanje videoposnetkov in ustvarjanje glasbe iz namigov. Poleg tega lahko kritično razmišlja in analizira, hkrati pa je v stiku z besedilnimi podatki v realnem času iskalnika Google (razen Gemini 1.0 Pro), zato je idealen za reševanje problemov, odločanje in reševanje zapletenih vprašanj.
Gemini 1.5 Pro trenutno stane 20-krat več kot Gemini 1.0 Pro, tako za vhodne kot izhodne podatke, kar je mogoče pripisati njegovi boljši zmožnosti za obdelavo večjih in kompleksnejših podatkovnih nizov ter več modalno obdelavo.
Nasprotno pa ima Gemini 1.5 Flash enako ceno za vhodne in izhodne podatke kot Gemini 1.0 Pro, vendar se ponaša z najvišjimi hitrostmi obdelave, zaradi česar je idealen za naloge z velikim obsegom in kritičnimi zakasnitvami.

DALL-E:

odličen za ustvarjanje visokokakovostnih slik iz besedilnih opisov

Zaključek:

Torej če sumiramo: različni modeli umetne inteligence imajo različne stroške, ki odražajo njihovo kompleksnost in zmogljivosti. Če želite kar najbolj racionalno izkoristiti vaša sredstva, je pomembno razumeti, kdaj uporabiti posamezen model.

Osnovni modeli: GPT-3.5 Turbo in Claude 3 Haiku so stroškovno učinkoviti in so najcenejši.  Ti modeli so kot nalašč za preproste naloge, pogosta testiranja in hitre iteracije, saj vam omogočajo, da izboljšate svoje pozive (prompte) za najnižjo ceno.

Napredni modeli: GPT-4o, GPT-4.0 Turbo Vision, Gemini 1.5 Pro in Claude 3 Sonnet so dražji  na interakcijo. Ti modeli ponujajo izboljšane zmogljivosti in izpopolnjene izpise, zato so idealni za zahtevnejše projekte, ki zahtevajo višjo kakovost in natančnost.

Premium modeli: Claude 3 Opus in Dall-E 3 so najdražji, vendar prinašata najboljše rezultate in visokokakovostne izpise. Ne glede na to, ali ustvarjate podrobne slike ali pripravljate zapletene vsebine, ta modela zagotavljata vrhunske rezultate (kot jih pač trenutno stanje LL lahko omogoča.


Modeli, okvirno razporejni po ceni/zmogljivosti/zahtevnosti (seveda je to moja subjektivna ocena )

1. Gemini 1.0 Pro

1. Gemini 1.5 Flash

1. GPT 4o Mini

1. Claude 3 Haiku

5. GPT 4o

10. Gemini 1,5 Pro

10. GPT4.0 Turbo

10. Claude 3 Sonnet

10. Claude 3.5 Sonet

30. DALL-E 3

50. Claude 3 Opus

Midjourney posodobitve

imageUrejanje zunanjih slik: Prvič lahko uporabniki urejajo slike, ki so jih naložili zunaj Midjourneyja. To presega generativne slike z umetno inteligenco in omogoča širši ustvarjalni nadzor.

Ponovne prilagoditve tekstur in osvetlitve: Uporabniki lahko spreminjajo teksture, materiale in osvetlitev, kar omogoča preoblikovanje nastavitev – z nekaj kliki spremenite sobo iz dnevne v nočno.

Zmožnosti za pretvorbo iz skice v umetniško delo: Uporabniki lahko naložijo preproste skice ali ročne risbe in jih spremenijo v popolnoma realizirane umetnine z oblikovanjem, podprtim z umetno inteligenco.

Izboljšave moderiranja: Da bi ohranili kakovost in varnost, Midjourney ob uvajanju te funkcije izvaja strožje protokole za moderiranje in zasebnost ( lahko si predstavljate kaj bo sledilo).

Midjourneyjev urejevalnik deluje intuitivno celo s pozivi in samodejno zazna območja za spreminjanje brez obsežnega ročnega vnosa.

Trenutno je funkcija dostopna samo dolgoletnim naročnikomz letno naročnino, tistim, ki so naročeni več kot 12 mesecev, in uporabnikom z več kot 10 000 ustvarjenimi slikami.

Grok (ex Twiter/X) posodobitve

Plačljivi člani socialnega omrežja X lahko zdaj naložijo sliko in o njej postavljajo vprašanja. Funkcija je v začetni fazi, vendar Musk obljublja hitre izboljšave in mislim, da so možnosti velike.

imageVečmodalne zmožnosti: Grok lahko zdaj analizira slike. Naj gre za razumevanje šale v memu ali razčlenjevanje zapletenih vizualnih podob, ta nova funkcionalnost dodaja resno vsestranskost.
Odgovori, bogati s kontekstom: Ta funkcija pomeni, da nismo več omejeni le na besedilne odgovore. Grokova vizualna analiza odpira nove možnosti uporabe – vidim aplikacije za ustvarjanje vsebine, analizo trendov v realnem času in še veliko več.
Nadgradnja posodobitev programa Grok-2: To dodaja še eno raven modelu Grok-2, ki je uvedel FLUX.1 za ustvarjanje slik. Zdaj lahko Grok slike interpretira, ne le ustvarja, s čimer je konkurenčen drugim večmodalnim orodjem umetne inteligence.
Prihodnje razumevanje dokumentov: Musk je namignil, da je podpora dokumentom naslednja na vrsti, zato bodo morda kmalu na voljo tudi datoteke PDF in druge datoteke. Všeč mi je, da xAI pri tem napreduje hitro – po Muskovih besedah v nekaj mesecih dosežejo tisto, za kar drugi potrebujejo leta.
Povečanje privlačnosti X za uporabnike Premium: Z nedavno uvedbo orodij, kot je Radar za naročnike Premium+, X dodaja pravo vrednost svojim plačljivim stopnjam. Zaradi tovrstnih funkcij je platforma veliko bolj privlačna, zlasti če iščete vpogled v trendovske teme.

Meta objavil odprto-kodno različico Googlovega generatorja podcastov

imageMeta je pred kratkim predstavila NotebookLlama, „odprto“ različico Googlove funkcije za generiranje podkastov, ki jo najdete v programu NotebookLM. S pomočjo modelov Meta Llama lahko NotebookLlama ustvarja pogovorne, podkastne povzetke prenesenih besedilnih datotek, kot so članki v obliki PDF novic ali prispevki na blogu. Cilj te tehnologije je ponoviti vidik interaktivnega pripovedovanja zgodb Googlovega viralnega orodja in dodati lastne elemente dramatizacije in prekinitev, da vsebina zveni bolj dinamično.

Postopek se začne tako, da NotebookLlama iz naložene datoteke ustvari prepis. Nato besedilo izboljša z vključitvijo bolj dramatičnih interakcij, preden ga pretvori v zvok z uporabo odprtokodnih modelov za pretvorbo besedila v govor. Vendar kakovost teh ustvarjenih podcastov trenutno zaostaja za kakovostjo NotebookLma, saj glasovi pogosto zvenijo robotsko in se nerodno prekrivajo. Raziskovalci Meta so te pomanjkljivosti priznali in poudarili, da bi naprednejši modeli pretvorbe besedila v govor lahko bistveno izboljšali naravnost rezultatov.

Razvijalci so omenili tudi, da bi lahko trenutni pristop – uporaba enega samega modela za ustvarjanje osnutka podkasta – izboljšali tako, da bi sprejeli obliko razprave med dvema agentoma umetne inteligence, kar bi zagotovilo bogatejšo razpravo. Menijo, da bi to lahko privedlo do bolj prepričljive in skladne pripovedi podkasta. Kljub tej inovaciji je NotebookLlama tako kot druge vsebine, ki jih ustvarja umetna inteligenca, še vedno dovzetna za pogost problem „halucinacij“, kar pomeni, da lahko nekateri deli ustvarjenega podkasta vključujejo netočne ali izmišljene informacije.

Čeprav NotebookLlama ni prvi poskus posnemanja funkcije podcasta NotebookLM, je zaradi svoje odprtokodne narave in sodelovanja podjetja Meta pomemben udeleženec na tem nastajajočem področju. Možnost izboljšanja kakovosti modelov in sprejetja novih pristopov daje programu NotebookLlama prostor za prihodnji napredek, čeprav še ni dosegel povsem naravnega rezultata.

Orion ne bo GPT-5, bo pa korak proti AGI (artificial general intelligence)

OpenAI se pripravlja, da bo do decembra predstavil svoj naslednji model umetne inteligence s kodnim imenom Orion. Za razliko od prejšnjih modelov, kot sta GPT-4o in o1, sprva ne bo široko dostopen prek ChatGPT. Namesto tega namerava OpenAI omogočiti zgodnji dostop izbranim partnerskim podjetjem, ki bodo lahko z novim modelom gradila svoje izdelke in funkcije. Izvršni direktor podjetja OpenAI je Orion opisal kot potencialno 100-krat zmogljivejši od GPT-4 in naj bi napredoval v smeri splošne umetne inteligence (AGI). Ta novi model se razlikuje od  reasoning modelaa (sklepanje?) o1, znanega kot Strawberry, ki ga je OpenAI objavil septembra. Poročila prav tako kažejo, da je bil Strawberry uporabljen za ustvarjanje sintetičnih podatkov za Orionov proces usposabljanja. Zaključek Orionovega usposabljanja je septembra zaznamoval slavnostni dogodek v organizaciji OpenAI, ki je sovpadal s skrivnostno objavo Sama Altmana na družbenih omrežjih, ki je namigovala na „zimska ozvezdja“, kar naj bi se nanašalo na Oriona.

image

Začetek delovanja Oriona se je zgodil v prelomnem času za OpenAI po zgodovinskem krogu financiranja v višini 6,6 milijarde dolarjev. Podjetje doživlja tudi pomembne spremembe v vodstvu, saj so pred kratkim svoje odhode napovedali ključne osebe, kot so simpatična tehnična direktorica Mira Murati, vodja raziskav Bob McGrew in podpredsednik za usposabljanje po končanem usposabljanju Barret Zoph.