Available inSpanishEnglishFrenchGermanHindiPortugueseRussian
Cómo funcionan los LLM: de los tokens a los transformers
Explica por qué el modelo con el que trabajas se comporta así, desde el token que lee hasta el bucle de agente que lo rodea, sin abrir una sola diapositiva. Para desarrolladores que usan APIs de LLM a diario y nunca han desmontado el mecanismo; sin cálculo, sin código. Sesenta y seis tarjetas en diez capítulos cubren tokens, embeddings, atención, sampling, RLHF, alucinaciones, retrieval y agentes, y nada sobre qué modelo lidera este mes.
Ves aparecer una respuesta a trozos. ¿Cuál es la unidad que el modelo lee y escribe de verdad?
Un token: un trozo de texto de un vocabulario fijo
— No es la letra. Y no siempre la palabra entera.
Source
El tokenizador convierte tu texto en números antes de que el modelo vea nada, con un vocabulario aprendido de un corpus: las cadenas frecuentes ocupan un token y las raras se parten en varios. Todo lo que viene después se mide en esas unidades: lo que pagas, el tamaño del context window y su ceguera ante la ortografía. En español, una estimación aproximada es de tres o cuatro caracteres por token. Se confunde con la palabra. En prosa corriente ambas coinciden lo bastante como para tapar la diferencia, y entonces un nombre propio, un tecnicismo o una palabra con tilde cuestan varios tokens de golpe.