vir: https://github.com/DGoettlich/history-llms

Projekt History LLMs razvija velike zgodovinske jezikovne modele (LLM), ki so strogo časovno zaklenjeni na določena obdobja in ne poznajo dogodkov po izbranem letu, saj teh podatkov ni v učni množici. Modeli tako omogočajo analizo diskurzov, idej in vrednot »iz perspektive časa«, ne skozi prizmo kasnejšega zgodovinskega znanja.​

Projekt izvajata Univerza v Zürichu in Univerza v Kölnu, GitHub repozitorij pa služi kot informacijsko središče, ki povezuje opise modelov, metodologijo in prihodnje podatkovne ter modelne repozitorije. Jedro ekipe sestavljajo Daniel Göttlich, Dominik Loibner, Guohui Jiang in Hans‑Joachim Voth, kontakt pa poteka prek naslova history-llms@econ.uzh.ch.​

Osrednja inovacija je koncept time‑locked LLM‑jev: vsak model ima določen »knowledge cutoff« (npr. 1913, 1929, 1933, 1939, 1946), učni korpus pa se zaključi z besedili do tega leta. Primer je model Ranke‑4B‑1913, ki ne »ve« za prvo svetovno vojno in odgovarja na podlagi predvojnega intelektualnega in političnega sveta, zajetega v časopisih, knjigah in esejih.​

Jedro modelne družine predstavljajo Ranke‑4B modeli z okoli 4 milijardami parametrov, grajeni na arhitekturi Qwen3. Vsak od njih je treniran na 80 milijardah tokenov, izbranih iz skrbno kuriranega zgodovinskega korpusa z več kot 600 milijardami časovno označenih tokenov. Ekipa napoveduje objavo dodatnih repozitorijev (pretraining, data, posttraining, Hugging Face), kjer bodo modeli in podatki javno dostopni.​

Zgodovinski LLM‑ji so kompresirane reprezentacije velikih besedilnih zbirk in služijo kot orodje za analizo diskurznih struktur ter semantičnih vzorcev. Niso popoln odsev javnega mnenja, ker temeljijo na objavljenih, pogosto elitnih in dominantnih virih, ter podedujejo njihove pristranskosti. Namenjeni so dopolnjevanju, ne nadomeščanju, klasičnega arhivskega raziskovanja in kritičnega branja primarnih virov.​

Projekt se jasno razlikuje od pristopa »sodobnih LLM‑jev, ki se pretvarjajo, da so zgodovinski«, kjer model sicer simulira slog neke dobe, vendar pozna celotno kasnejšo zgodovino. To vodi do pojava »hindsight contamination«, ko odgovori neizogibno odražajo vednost o prihodnjih dogodkih, kar popači avtentičnost zgodovinskega diskurza. Time‑locked modeli ta problem zmanjšujejo, ker preprosto nimajo dostopa do poznejših podatkov.​

Ker izhajajo iz zgodovinskih virov, modeli reproducirajo tudi rasistične, antisemitske, mizogine in imperialistične vsebine, značilne za svoja obdobja. Ekipa to razume kot ključen raziskovalni vidik, ne kot normativno stališče, zato v modele namerno ne vgrajuje retroaktivnega »čiščenja« teh pogledov. Vzpostaviti namerava zaščitne mehanizme, da se prepreči zloraba takih vsebin v sodobnih kontekstih.​

Za raziskovalce in učitelje zgodovinski LLM‑ji odpirajo nove možnosti: analizo nacionalizma, kolonializma, rase ali spola v točno določenem času, primerjave med različnimi letnicami ter pedagoško uporabo modela kot »glasu obdobja«. Repozitorij vključuje tudi BibTeX zapis za standardizirano citiranje projekta kot tehničnega poročila iz leta 2025 z URL‑jem https://github.com/DGoettlich/history-llms.