Eks AI-sid on ka erinevaid. Tasuta Chat GPT ga ilmselt jah ei tasu ootusi üles ajada. Üldiselt on mulle elus arstid ka ikka sellist kelbast ajanud, et kõhe hakkab.
Tegelikult oleks saanud neid LLM-e juba eelmine sajand jooksutada, aga siis sügati mune ja räägiti, et AI jooksutamiseks vajaliku arvutusvõimsuse saabumine võtab 50 aastat aega.
With a footprint of only 0.24GB of memory, 1-bit Bonsai 1.7B pushes the limits of on-device speed, reaching 130 tokens per second on an iPhone 17 Pro Max. Combining industry-leading energy efficiency with solid accuracy, it’s a lightweight model built for heavyweight tasks.
OpenAI sai FOMO murega rahajõmmidelt umbes 2 kuni 2.5 Eesti SKP jagu raha, et kulutada kuhu kulub ![]()
Ainuüksi 2026. aastaks ennustatav kahjum saab OpenAI-l olema pea 1/2 Eesti riigieelarve jagu.
Bitid-baidid, teraflopsid-bogomipsid on väiksem osa võrrandist, neid oleks eelmise sajandi lõpus vähemalt mingitesse klastritesse koondatuna jagunud. Puudu oli tohututes kogustes digiteeritud ja juba digitaalsena sündinud andmeid. No eks masinõpe ise oli ka arenemisjärgus. Tänane AI kui statistiline mudel elab puhtalt selle pealt, et on näinud tohututes kogustes andmeid ja nende vahel seosed välja arvutanud. Praegu on saadaval terved digiteeritud raamatukogud, avalikud koodirepod, seadused, õppematerjalid, pmst kogu veeb - see kõik oli eelmisel sajandil puudu.
Ma küsisin AI käest ja sain sellise vastuse:
Bonsai 1.7B (või sarnased 1-bitised mudelid) vajab optimaalseks tulemuseks järgmises mahus andmeid:
1. Treeningmaht gigabaitides (GB)
1-bitiste mudelite puhul on leitud, et nad on “andmenäljasemad” kui tavalised mudelid, et saavutada sama täpsustase. Bonsai 1.7B treenitakse tavaliselt 2 triljoni tokeni peal.
- Puhas tekst: 1 TB teksti on keskmiselt 300 miljardit tokenit.
- Arvutus: 2 000 / 300 ≈ 6.67 TB (terabaiti).
- Vastus gigabaitides: See teeb ligikaudu 6 000 – 7 000 GB kvaliteetset, filtreeritud tekstiandmestikku.
Iseenesest see 6-7 TB poleks 30 aastat tagasi olnud ülejõu käiv asi.
Võrdlus: 1996 vs Tänapäev
| Omadus | 1996 (ASCI Red - Maailma tipp) | 2026 (1x NVIDIA H100 GPU) |
|---|---|---|
| Jõudlus | 1 TFLOPS | ~1000 TFLOPS (FP16/Tensor) |
| Hind | $55,000,000 | ~$30,000 |
| Suurus | Terve saalitäis kappe | Üks videokaart |
| Treenimisaeg | 647 aastat | Mõni nädal |
ASCI Red oma Pentium Pro prosedega pole just parim arvuti mudelite treenimiseks.
AI pakkus parimana:
| Seade | Aasta | Mälu | Arvutusjõudlus (umbes) | Aeg SmolLM-135M treenimiseks |
|---|---|---|---|---|
| Nvidia GeForce 256 | 1999 | 32 MB | 50 GFLOPS | ~8-10 aastat |
Seda jama on raske kommenteerida Äkki kolite kuskile AIde foorumisse ja lasete neil siis omavahel vaielda?
Mina olen juba 20 aastat tagasi OpenCV algoritme treeninud, sa decibel ilmselt ei ole.
Ma lihtsalt mäletan ülikooliajast, et räägiti 50 aastast ja keegi ei julgenud reaalselt isegi 3 meetrise toikaga AI-d puudutada, oleks hakatud kohe imelikuks pidama. See sinu 20 aastat tagsi on veidi hilisem aeg.
Kui räägime konkreetselt LLM-dest, siis läbimurre toimus kui tulid pildile transformerite põhised mudelid, kusagil aastal 2017-18. Enne seda räägiti jah, et konkreetselt keelemudelite väljatöötamise puhul on arvutusvõimsus piiratud, aga “munade sügamisest” oli asi kaugel, arendustöö on käinud juba vähemalt 90-date algusest. Ka see Google 2017 aasta “Attention is all you need” läbimurdva artikli aluseks oli eelmiste saavutuste töö, mida üritati paremaks saada.
Kui võtame tehisnärvivõrgud laiemalt, siis nende kallal töötati juba veel varem.
Mina panin sõbra abiga oma päris esimese PC kokku aastal 1995, eelarve oli 20KEEK ja see kulus pea kogu ulatuses ära. Seejuures ei mahtunud sinna sisse ei helikaart, 3Dkiirendi ega CD lugeja. Need said kõik hiljem lisatud. Minu esimene 3D kiirendit sisaldanud kaart oli TNT2, mis tuli välja 1999 esimesel poolaastal. 1999 aasta lõpus tuli alles välja 256, mis oli TNT2-st kohati kuni 2 korda kiirem.
1999 detsember ei ole kohe kuidagi “30 aastat tagasi” - 1996 aastal oli kiireim kaart 3dfx Vodoo, mis oli 256-st pea 10 korda aeglasem.
Ja see on ainult teoreetiline arvutusvõimsuse pool. Sobivat taristut ei olnud. Kõige kõvem distributed computing projekt oli SETI ja seegi oli võimalik vaid kasutusiseloomu tõttu - mitte midagi hullu ei olnud, kui mõnda tükki arvutati läbi mitu kuud või 3 korda.
Peamine probleem oli siiski juba viidatu - kättesaadavat hea kvaliteediga elektroonilisel kujul teksti oli lihtsalt kole vähe.
Kui mina ülikoolis käisin, siis laiutasid igal pool ekspertsüsteemide vennad ja AI oli põlu all, oli nn. AI talv. Mujal maailmas on see AI talv piiritletud aastatega 1987-93, Eesti ülikoolides kestis see kindlasti aastatuhande vahetuseni välja, edasisest ma ei tea.
Ma ei saa nüüd aru. Räägid “LLM-de jooksutamisest eelmisel sajandil” enne seda kui olulised läbimurded olid veel saavutamata. See on veidi sama jutt, kui ette heita, et miks 18-dal sajandil inimesed ei sõitnud bensiinimootoriga. Too James Watt selle asemel “sügas tol ajal mune” ja arendas Newcomeni aurumootorit edasi.
Tõepoolest, närvivõrkude programmeerimise-alast kirjandust ilmus laialdaselt juba sügavatel 1990-datel. Ei olnud see juba siis mitte mingi pisike kusagil nurgataguses laboratooriumis arendatav salateadus.
Ma räägin, et asi ei jäänud tegelikult raua taha, vaid mõtlemise taha. Pidevalt korrutati mantrat, et pole niigi paljut arvutusvõimsust, et jooksutada kassi aju tasemel AI-d, seega pole mõtet ka oma aega sellele kulutada. See oli iseenesest õige ja on ka tänapäeval veel õige, nimelt kassi aju vastab umbes 10T mudelile. Samas, Transformeri sarnane läbimurre oleks võinud tulla ka varem, kui oleks piisavalt ressurssi sisse lükatud ja poleks kogu aeg poetud raua vähese võimekuse taha.
Decibel, aga mida kasulikku Sa ise selle teadmisega peale hakkad, kui nüüd tead täpselt et mille taha see kõik jäi? Mida soovitad teistele? Mis saab nüüd edasi? Mida see kõik nüüd muudab? Mida muudad Sina ise?
Fakt on see, et tänapäeva täiesti korralikke mudeleid saab ka 90ndate lõpu raua peal jooksutada, treenimine ja andmed on samas muidugi oleks ja moleks.
No täpselt, “oleks-moleks.” Aga ei olnud, tollal.
Kas siis mitte just too ekspertsüsteemide koolkonna “AI mull” ei lõhkenud ?
Ja äkki need ekspertsüsteemid olidki arengu loomulik osa ? Seda et sinu ülikoolis mõni professor laias ekspertsüsteemide ideega mõned aastad, ei tähenda suures plaanis just kuigi palju, töö tehisnärvivõrkudega läks siiski 90-datel edasi.
Ja pole ka lõplikult kivisse raiutud et ainuüksi praegused tehisnärvivõrgu põhised mudelid meid nö “päris AI-ni” viivad. Eks lõplik tõde selgub, kui kunagi selleni jõutakse, mis selleks tegelikult vaja läks. Või on mõne arvates sellega selge pilt, kuidas jõuda sinna ?
Ega ikka ei saa küll, kui sa just tollast “tipprauda” ei võta. Alustame sellest, et kuidas sa “90ndate raua peal” min. 4GiB, enamasti ikka 8, 16 jne. “continous RAM space” kokku paned? Infiniband? Või räägid sa 90ndate superklastritest või mainframedest?
Isegi kui sul on mingisugune “kiirus” või “arvutusvõimsus” siis 99% jääb see sul “ühe kasti” või “ühe küpsise” piiridesse. Heal juhul ehk kahe, aga need on valdavalt non-x86 rauad. Üldjuhul oled sa “kägistatud” mingi äärmiselt näruse 1Gbait sekundis peale ja sedagi Väga Heal Juhul.
Terminator 2 tehti 1992 selle pärast, et varem lihsalt EI OLNUD tehniliselt ligilähedaseltki võimalik midagi seesugust teha.