Keď do AI zadáte dopyt, model nevidí písmená ani slová tak, ako my. Prvým krokom je rozbitie textu na menšie jednotky zvané tokeny. Token môže byť celé slovo, časť slova alebo dokonca len jeden znak. Napríklad slovo „neuveriteľný“ môže byť rozdelené na „neu“, „veri“ a „teľný“.
Tento proces umožňuje modelu efektívne pracovať s neznámymi slovami a gramatickými príponami. Každý token je následne priradený k unikátnemu číselnému identifikátoru. V systéme GPT-4 jeden token predstavuje v priemere približne 0,75 anglického slova. Pri slovenskom jazyku je tento pomer kvôli zložitejšej morfológii o niečo vyšší.
Prečo je to dôležité? Všetky limity modelov (context window) sú definované v tokenoch, nie v slovách. Ak má model limit 8 000 tokenov, znamená to, že si dokáže „zapamätať“ približne 6 000 slov prebiehajúcej konverzácie. Viac informácií o dopytoch nájdete na stránke Metódy zadávania dopytov pre AI.