Kas sa ei saanud aru, et integeridega ei saa neid koefitsente arvutada? Sest nad lähevad lõpmatult väikeseks ja ei mahu integeri sisse ära?
Praegu ei saa, aga piisab väikesest arhitektuursest muutusest ja kogu see GPU äri lendab korstnasse. Vaata kuidas ainuüksi kvantiseerimine on pannud AMD, Inteli ja Arm-i lendama.
Kuna energia hind ja kättesaadavus muutuvad järjest kriitilisemaks teguriks AI jooksutamisel, siis informaatikud ja loomulikult ka AI ise, ragistavad järjest intensiivsemalt ajusid.
Transformer → Mamba on juba pikk samm selles suunas.
Suurim vahe treenimisel tuleb sisse siis, kui mudelit treenitakse suure kontekstiakna (näiteks 32k, 128k või enama tokeni) peal.
- Transformer: Treenimise ajal on vaja backpropagation’i (veatagastusalgoritmi) jaoks meelde jätta kõik enesetähelepanu (attention) maatriksid. Kuna see maatriks kasvab ruudus (O(N^2)), viskab Transformer pika konteksti puhul väga kiiresti ette kurikuulsa Out of Memory (OOM) vea. Riistvara ujukomaarvutuste (FLOPide) vajadus ja mälukasutus plahvatavad.
- Mamba: Kuna Mamba alusloogika on lineaarne (O(N)), kulutab ta pika teksti puhul dramaatiliselt vähem ujukomaarvutusi ja mälu. Sa võid treenida Mambat gigantsete kontekstiakendega, ilma et mälumaht muutuks kättesaamatuks.
AI slop?
Nvidia GPU-de ja Trasnformeriga genereeritud.

