Mechanika veľkých
jazykových modelov

Zabudnite na mágiu. LLM sú v jadre matematické stroje na predpovedanie nasledujúceho elementu v sekvencii. Pochopenie ich vnútornej štruktúry je kľúčom k efektívnej práci s informáciami v 21. storočí.

Príbeh o starom knihovníkovi a štatistike

„Pamätám si, ako mi v roku 2010 jeden starší kolega v archíve povedal, že stroje nikdy nepochopia kontext vety,“ začína svoje rozprávanie náš hlavný inžinier. Vtedy sme pracovali na jednoduchých algoritmoch, ktoré hľadali kľúčové slová, ale úplne ignorovali význam medzi riadkami. Problém nebol v nedostatku dát, ale v tom, že sme sa snažili naučiť počítač gramatiku namiesto toho, aby sme ho nechali pozorovať pravdepodobnosť.

„— Pozri sa na túto vetu, povedal mi vtedy ten kolega a ukázal na text v starej knihe. Ak napíšem 'Mačka sedí na...', čo doplníš? Povedal som, že rohožke. A on sa zasmial, že presne to je štatistika, nie inteligencia.“ Tento moment predznamenal prechod k Transformerom. Jazykové modely dnes nerobia nič iné, len analyzujú miliardy takýchto sekvencií, aby určili, že po slove 'rohožka' s vysokou pravdepodobnosťou nasleduje bodka.

„— Jazyk nie je súbor pravidiel, ktoré treba naprogramovať. Je to živý organizmus dát, v ktorom sa význam rodí z opakovania a vzájomnej blízkosti slov v obrovskom priestore.“

A high-angle shot of a vintage server room with many cables

Často kladené otázky o LLM

Čo je to vlastne 'veľký' v kontexte LLM?

Prívlastok 'veľký' sa vzťahuje na počet parametrov v neurónovej sieti, ktoré model používa na spracovanie informácií. Moderné modely ako GPT-4 disponujú stovkami miliárd až biliónmi parametrov. Tieto parametre sú v podstate číselné váhy, ktoré určujú, akú dôležitosť má dané slovo v konkrétnom kontexte vzhľadom na ostatné slová v dopyte.

Rozumie AI skutočne tomu, čo píše?

Z technického hľadiska AI nerozumie významu v ľudskom zmysle slova. Nemá vedomie ani emócie. Operuje v rámci viacrozmerného vektorového priestoru, kde sú slová s podobným významom umiestnené blízko seba. Keď model generuje odpoveď, vyberá slová, ktoré matematicky najlepšie zapadajú do kontextu predchádzajúceho textu. Viac o tomto procese nájdete v sekcii AI vyhľadávanie: Technická príručka.

Prečo modely niekedy halucinujú?

Halucinácie vznikajú, keď model uprednostní gramatickú a štylistickú pravdepodobnosť pred faktickou presnosťou. Ak model nemá v tréningových dátach dostatok informácií o špecifickej téme, jeho mechanizmus predpovedania stále 'musí' vygenerovať nasledujúce slovo. Výsledkom je text, ktorý znie veľmi presvedčivo a odborne, ale je fakticky nesprávny.

Abstract 3D visualization of interconnected data nodes and n

Proces spracovania dát v 4 krokoch

Spracovanie informácií v LLM nie je lineárne. Prebieha v masívne paralelných cykloch, ktoré umožňujú modelu brať do úvahy celú vetu naraz, nie len slovo po slove. Tento prístup, nazývaný 'Self-Attention', zmenil spôsob, akým stroje čítajú.

  • 01

    Zber a čistenie

    Terabajty textov z webu, kníh a kódov sa filtrujú od šumu a duplicity, aby sa zabezpečila kvalita bázy.

  • 02

    Predtrénovanie

    Model sa učí predpovedať maskované (skryté) slová v miliardách viet, čím si buduje základné chápanie jazyka.

  • 03

    Jemné ladenie (Fine-tuning)

    Špecializované sady dát učia model konkrétne úlohy, ako je programovanie, preklad alebo technické písanie.

  • 04

    RLHF ladenie

    Učenie s posilňovaním na základe ľudskej spätnej väzby pomáha modelu generovať bezpečnejšie a užitočnejšie odpovede.

Tokenizácia: Ako stroj vidí vaše slová

Keď do AI zadáte dopyt, model nevidí písmená ani slová tak, ako my. Prvým krokom je rozbitie textu na menšie jednotky zvané tokeny. Token môže byť celé slovo, časť slova alebo dokonca len jeden znak. Napríklad slovo „neuveriteľný“ môže byť rozdelené na „neu“, „veri“ a „teľný“.

Tento proces umožňuje modelu efektívne pracovať s neznámymi slovami a gramatickými príponami. Každý token je následne priradený k unikátnemu číselnému identifikátoru. V systéme GPT-4 jeden token predstavuje v priemere približne 0,75 anglického slova. Pri slovenskom jazyku je tento pomer kvôli zložitejšej morfológii o niečo vyšší.

Prečo je to dôležité? Všetky limity modelov (context window) sú definované v tokenoch, nie v slovách. Ak má model limit 8 000 tokenov, znamená to, že si dokáže „zapamätať“ približne 6 000 slov prebiehajúcej konverzácie. Viac informácií o dopytoch nájdete na stránke Metódy zadávania dopytov pre AI.

Štatistické fakty

  • 175 mld. Parametrov v modeli GPT-3
  • 1.5 TB Veľkosť čistého textového datasetu
  • 0.1 ms Čas na vygenerovanie jedného tokenu

Ste pripravení na hlbšiu analýzu?

Pochopenie mechaniky je len prvý krok. Zistite, ako sa tieto modely vyvíjali v čase a ako ovplyvňujú dnešnú digitálnu infraštruktúru.