Large Language Model
Un model de llenguatge no sap res: només prediu quin serà el tros de text següent. Tokens, probabilitat, mostreig i finestra de context.
Introducció
Un model de llenguatge no sap què és una vaca.
No sap què és ser cec, ni què és un camí, ni què vol dir que algú et tiri una pedra.
I tot i així, escriu.
Aquesta pàgina explica com.
La resposta és més simple del que sembla, i alhora més estranya: un model de llenguatge només fa una cosa, endevinar quin és el tros de text següent. Res més. Tot el que en surt —respondre preguntes, traduir, programar, resumir— és aquesta única operació feta molt bé i repetida moltes vegades.
LLM vol dir Large Language Model, model de llenguatge gran. El gran no és una metàfora: són els paràmetres que el model ajusta mentre s’entrena, milers de milions, i el text amb què s’entrena, bona part del que hi ha escrit a internet.
Aquí veuràs de què està feta aquesta predicció. Farem servir un poema com a text de proves: La vaca cega, de Joan Maragall (1893).
Un text és una llista de tokens
El model no llegeix lletres, ni paraules.
Llegeix tokens: trossos de text que apareixien sovint al text amb què es va entrenar. Un token pot ser una paraula sencera, un fragment de paraula o un signe de puntuació.
Mira com queda partida una frase. Cada [...] és un token:
El gat dorm al sofà. 7 tokens [El][ gat][ dorm][ al][ sof][à][.]
El gato duerme en el sofá. 8 tokens [El][ gato][ duer][me][ en][ el][ sofá][.]
The cat sleeps on the sofa. 7 tokens [The][ cat][ sleeps][ on][ the][ sofa][.]Fixa’t en dues coses.
L’espai forma part del token següent, no de l’anterior: és [ gat], amb l’espai davant.
I sofà no cap en un sol token, mentre que sofa sí. El model l’ha de partir en [sof][à].
El català surt car
La llista de tokens es va construir comptant quins trossos de text són freqüents.
I el text on es va comptar és, sobretot, anglès.
Per tant una paraula catalana es parteix en més trossos que la mateixa paraula en anglès:
intelligence 2 tokens [int][elligence]
inteligencia 3 tokens [int][elig][encia]
intel·ligència 4 tokens [intel][·][lig][ència]Això no és una curiositat: és el preu que pagues per escriure en la teva llengua.
Un text català gasta al voltant d’un token cada 3 caràcters; un d’anglès, un cada 4. La mateixa idea ocupa un terç més. Com que els models es paguen per token i tenen un límit de tokens, escriure en català costa més diners i omple abans aquest límit.
I encara hi ha una conseqüència pitjor: si el català és rar al text d’entrenament, el model n’ha vist menys exemples, i escriu pitjor.
La freqüència es nota fins i tot dins del català:
Barcelona 1 token [Barcelona]
Girona 2 tokens [Gir][ona]
Tarragona 3 tokens [T][arr][agona]
Lleida 3 tokens [L][le][ida]Estàs llegint una vista prèvia.
Inicia la sessió amb Google per llegir la pàgina sencera.
Inicia la sessió amb GoogleNomés et demanarem que acceptis les condicions del servei.