Nov 2, 2024 | LLM (AI)
Prvi korak je razumevanje vašega cilja. Ali se ukvarjate z ustvarjanjem besedil, ustvarjanjem slik, klasifikacijo, regresijo ali čim drugim? Različni modeli umetne inteligence so optimizirani za različne naloge:

Modeli GPT GPT-4o IN GPT-4.0 Turbo:
Idealni so za vsestranske besedilne naloge, kot so ustvarjanje vsebine, prevajanje, povzemanje, odgovarjanje na vprašanja itd.
Za bolj zapletene poizvedbe in natančne, niansirane odgovore bo najboljša izbira model GPT-4.0 Turbo. Ta model je odličen pri sledenju navodilom po korakih, sklepanju in prepoznavanju logičnih napak.
Za hitre in človeku podobne odgovore uporabite GPT-4o, saj je ta model optimiziran za zmogljivost in učinkovitost.
Claude Haiku in Claude Sonet:
Claude 3 se odlikujeta po razširjenem kontekstualnem oknu, ki znatno izboljša njuno sposobnost za razumevanje zapletenih in dolgih informacij. Trenutno sta najboljša za naloge ustvarjalnega pisanja (pripovedovanje zgodb, dosleden ton glasu, gradnja likov itd.).
Claude Sonnet uravnoteženo usklajuje inteligentnost in hitrost.
Tako kot GPT-4o je tudi Claude Haiku kompakten model, ki omogoča skoraj takojšnje odgovore.
Claude Opus:
Claude Opus je zasnovan za opravljanje zelo zapletenih nalog (kot so interaktivno kodiranje, odkrivanje zdravil, napredna analiza financ in tržnih trendov, napovedovanje itd.) in se ponaša z izjemno zmogljivostjo, inteligenco, tekočnostjo in razumevanjem. Ponuja vrhunske zmogljivosti na različnih področjih.
Gemini:
Sposoben je obdelati več vrst podatkov, kar omogoča naloge, kot so analiza slik, povzemanje videoposnetkov in ustvarjanje glasbe iz namigov. Poleg tega lahko kritično razmišlja in analizira, hkrati pa je v stiku z besedilnimi podatki v realnem času iskalnika Google (razen Gemini 1.0 Pro), zato je idealen za reševanje problemov, odločanje in reševanje zapletenih vprašanj.
Gemini 1.5 Pro trenutno stane 20-krat več kot Gemini 1.0 Pro, tako za vhodne kot izhodne podatke, kar je mogoče pripisati njegovi boljši zmožnosti za obdelavo večjih in kompleksnejših podatkovnih nizov ter več modalno obdelavo.
Nasprotno pa ima Gemini 1.5 Flash enako ceno za vhodne in izhodne podatke kot Gemini 1.0 Pro, vendar se ponaša z najvišjimi hitrostmi obdelave, zaradi česar je idealen za naloge z velikim obsegom in kritičnimi zakasnitvami.
DALL-E:
odličen za ustvarjanje visokokakovostnih slik iz besedilnih opisov
Zaključek:
Torej če sumiramo: različni modeli umetne inteligence imajo različne stroške, ki odražajo njihovo kompleksnost in zmogljivosti. Če želite kar najbolj racionalno izkoristiti vaša sredstva, je pomembno razumeti, kdaj uporabiti posamezen model.
Osnovni modeli: GPT-3.5 Turbo in Claude 3 Haiku so stroškovno učinkoviti in so najcenejši. Ti modeli so kot nalašč za preproste naloge, pogosta testiranja in hitre iteracije, saj vam omogočajo, da izboljšate svoje pozive (prompte) za najnižjo ceno.
Napredni modeli: GPT-4o, GPT-4.0 Turbo Vision, Gemini 1.5 Pro in Claude 3 Sonnet so dražji na interakcijo. Ti modeli ponujajo izboljšane zmogljivosti in izpopolnjene izpise, zato so idealni za zahtevnejše projekte, ki zahtevajo višjo kakovost in natančnost.
Premium modeli: Claude 3 Opus in Dall-E 3 so najdražji, vendar prinašata najboljše rezultate in visokokakovostne izpise. Ne glede na to, ali ustvarjate podrobne slike ali pripravljate zapletene vsebine, ta modela zagotavljata vrhunske rezultate (kot jih pač trenutno stanje LL lahko omogoča.
Modeli, okvirno razporejni po ceni/zmogljivosti/zahtevnosti (seveda je to moja subjektivna ocena )
1. Gemini 1.0 Pro
1. Gemini 1.5 Flash
1. GPT 4o Mini
1. Claude 3 Haiku
5. GPT 4o
10. Gemini 1,5 Pro
10. GPT4.0 Turbo
10. Claude 3 Sonnet
10. Claude 3.5 Sonet
30. DALL-E 3
50. Claude 3 Opus
Oct 30, 2024 | LLM (AI)
Urejanje zunanjih slik: Prvič lahko uporabniki urejajo slike, ki so jih naložili zunaj Midjourneyja. To presega generativne slike z umetno inteligenco in omogoča širši ustvarjalni nadzor.
Ponovne prilagoditve tekstur in osvetlitve: Uporabniki lahko spreminjajo teksture, materiale in osvetlitev, kar omogoča preoblikovanje nastavitev – z nekaj kliki spremenite sobo iz dnevne v nočno.
Zmožnosti za pretvorbo iz skice v umetniško delo: Uporabniki lahko naložijo preproste skice ali ročne risbe in jih spremenijo v popolnoma realizirane umetnine z oblikovanjem, podprtim z umetno inteligenco.
Izboljšave moderiranja: Da bi ohranili kakovost in varnost, Midjourney ob uvajanju te funkcije izvaja strožje protokole za moderiranje in zasebnost ( lahko si predstavljate kaj bo sledilo).
Midjourneyjev urejevalnik deluje intuitivno celo s pozivi in samodejno zazna območja za spreminjanje brez obsežnega ročnega vnosa.
Trenutno je funkcija dostopna samo dolgoletnim naročnikomz letno naročnino, tistim, ki so naročeni več kot 12 mesecev, in uporabnikom z več kot 10 000 ustvarjenimi slikami.
Oct 30, 2024 | LLM (AI)
Plačljivi člani socialnega omrežja X lahko zdaj naložijo sliko in o njej postavljajo vprašanja. Funkcija je v začetni fazi, vendar Musk obljublja hitre izboljšave in mislim, da so možnosti velike.
Večmodalne zmožnosti: Grok lahko zdaj analizira slike. Naj gre za razumevanje šale v memu ali razčlenjevanje zapletenih vizualnih podob, ta nova funkcionalnost dodaja resno vsestranskost.
Odgovori, bogati s kontekstom: Ta funkcija pomeni, da nismo več omejeni le na besedilne odgovore. Grokova vizualna analiza odpira nove možnosti uporabe – vidim aplikacije za ustvarjanje vsebine, analizo trendov v realnem času in še veliko več.
Nadgradnja posodobitev programa Grok-2: To dodaja še eno raven modelu Grok-2, ki je uvedel FLUX.1 za ustvarjanje slik. Zdaj lahko Grok slike interpretira, ne le ustvarja, s čimer je konkurenčen drugim večmodalnim orodjem umetne inteligence.
Prihodnje razumevanje dokumentov: Musk je namignil, da je podpora dokumentom naslednja na vrsti, zato bodo morda kmalu na voljo tudi datoteke PDF in druge datoteke. Všeč mi je, da xAI pri tem napreduje hitro – po Muskovih besedah v nekaj mesecih dosežejo tisto, za kar drugi potrebujejo leta.
Povečanje privlačnosti X za uporabnike Premium: Z nedavno uvedbo orodij, kot je Radar za naročnike Premium+, X dodaja pravo vrednost svojim plačljivim stopnjam. Zaradi tovrstnih funkcij je platforma veliko bolj privlačna, zlasti če iščete vpogled v trendovske teme.
Oct 30, 2024 | LLM (AI)
Meta je pred kratkim predstavila NotebookLlama, „odprto“ različico Googlove funkcije za generiranje podkastov, ki jo najdete v programu NotebookLM. S pomočjo modelov Meta Llama lahko NotebookLlama ustvarja pogovorne, podkastne povzetke prenesenih besedilnih datotek, kot so članki v obliki PDF novic ali prispevki na blogu. Cilj te tehnologije je ponoviti vidik interaktivnega pripovedovanja zgodb Googlovega viralnega orodja in dodati lastne elemente dramatizacije in prekinitev, da vsebina zveni bolj dinamično.
Postopek se začne tako, da NotebookLlama iz naložene datoteke ustvari prepis. Nato besedilo izboljša z vključitvijo bolj dramatičnih interakcij, preden ga pretvori v zvok z uporabo odprtokodnih modelov za pretvorbo besedila v govor. Vendar kakovost teh ustvarjenih podcastov trenutno zaostaja za kakovostjo NotebookLma, saj glasovi pogosto zvenijo robotsko in se nerodno prekrivajo. Raziskovalci Meta so te pomanjkljivosti priznali in poudarili, da bi naprednejši modeli pretvorbe besedila v govor lahko bistveno izboljšali naravnost rezultatov.
Razvijalci so omenili tudi, da bi lahko trenutni pristop – uporaba enega samega modela za ustvarjanje osnutka podkasta – izboljšali tako, da bi sprejeli obliko razprave med dvema agentoma umetne inteligence, kar bi zagotovilo bogatejšo razpravo. Menijo, da bi to lahko privedlo do bolj prepričljive in skladne pripovedi podkasta. Kljub tej inovaciji je NotebookLlama tako kot druge vsebine, ki jih ustvarja umetna inteligenca, še vedno dovzetna za pogost problem „halucinacij“, kar pomeni, da lahko nekateri deli ustvarjenega podkasta vključujejo netočne ali izmišljene informacije.
Čeprav NotebookLlama ni prvi poskus posnemanja funkcije podcasta NotebookLM, je zaradi svoje odprtokodne narave in sodelovanja podjetja Meta pomemben udeleženec na tem nastajajočem področju. Možnost izboljšanja kakovosti modelov in sprejetja novih pristopov daje programu NotebookLlama prostor za prihodnji napredek, čeprav še ni dosegel povsem naravnega rezultata.
Oct 30, 2024 | LLM (AI)
OpenAI se pripravlja, da bo do decembra predstavil svoj naslednji model umetne inteligence s kodnim imenom Orion. Za razliko od prejšnjih modelov, kot sta GPT-4o in o1, sprva ne bo široko dostopen prek ChatGPT. Namesto tega namerava OpenAI omogočiti zgodnji dostop izbranim partnerskim podjetjem, ki bodo lahko z novim modelom gradila svoje izdelke in funkcije. Izvršni direktor podjetja OpenAI je Orion opisal kot potencialno 100-krat zmogljivejši od GPT-4 in naj bi napredoval v smeri splošne umetne inteligence (AGI). Ta novi model se razlikuje od reasoning modelaa (sklepanje?) o1, znanega kot Strawberry, ki ga je OpenAI objavil septembra. Poročila prav tako kažejo, da je bil Strawberry uporabljen za ustvarjanje sintetičnih podatkov za Orionov proces usposabljanja. Zaključek Orionovega usposabljanja je septembra zaznamoval slavnostni dogodek v organizaciji OpenAI, ki je sovpadal s skrivnostno objavo Sama Altmana na družbenih omrežjih, ki je namigovala na „zimska ozvezdja“, kar naj bi se nanašalo na Oriona.

Začetek delovanja Oriona se je zgodil v prelomnem času za OpenAI po zgodovinskem krogu financiranja v višini 6,6 milijarde dolarjev. Podjetje doživlja tudi pomembne spremembe v vodstvu, saj so pred kratkim svoje odhode napovedali ključne osebe, kot so simpatična tehnična direktorica Mira Murati, vodja raziskav Bob McGrew in podpredsednik za usposabljanje po končanem usposabljanju Barret Zoph.