¿Qué es un LLM?
Un LLM no entiende el lenguaje como nosotros. Es una red neuronal con miles de millones de parámetros entrenada en una tarea simple: dada una secuencia de palabras, predice cuál viene después. Repetida miles de millones de veces sobre toda la internet, esa tarea le fuerza a aprender gramática, hechos, razonamiento e incluso patrones de conversación.
Analogía con CNN. Una CNN toma una imagen 28×28, la convierte en mapas de características y finalmente en 10 probabilidades sobre dígitos. Un LLM toma una secuencia de tokens, los convierte en vectores enriquecidos por contexto, y finalmente en un vector de probabilidades sobre todo el vocabulario (~50 000 a 200 000 opciones) para el siguiente token.
CNN → imágenes
Aprende de píxeles. Salida: 10 clases (dígitos).
LLM → texto
Aprende de texto (transformer). Salida: ~100 000 clases (tokens).
Idea común
Una red que predice el siguiente número en una secuencia. Aquí el número es una palabra.
Tokenización: partir el texto en piezas
Antes de procesar nada, el LLM divide el texto en tokens. Un token puede ser una palabra entera, un sufijo común o un solo carácter, según qué tan frecuente sea esa secuencia en el corpus. El Token ID es el número entero único asignado a cada token del vocabulario.
Tokenizador (aproximado) ✂️
Escribe una frase. Cada color es un token; abajo su Token ID. Prueba palabras raras o nombres propios: se parten en pedazos más pequeños.
BPE (Byte-Pair Encoding)
El algoritmo recorre millones de textos y va fusionando los pares de caracteres más repetidos. Las secuencias muy comunes acaban siendo un solo token; las raras se quedan partidas.
El significado no vive en el token
Los pedazos no necesitan significar nada: son ladrillos reutilizables. «·antes» aislado no significa nada, pero su vector aporta la pista «final de adjetivo/adverbio». Partir en sub-palabras da generalización: el modelo entiende palabras que nunca vio, ensamblándolas de piezas conocidas.
Embeddings: vectores con significado
Cada token se convierte en un vector de centenas o miles de dimensiones (típicamente 768 a 12 288). No son arbitrarios: el modelo los aprende de modo que palabras con significado parecido tengan vectores parecidos.
Si proyectamos esos vectores a un plano 2D (t-SNE o UMAP) aparecen clusters: los animales en una zona, los colores en otra, los nombres propios en otra. La red no aprende un diccionario explícito — aprende que «perro» y «gato» aparecen en contextos similares y los empuja al mismo barrio del espacio vectorial.
Predicción del siguiente token
Tras decenas de capas Transformer, el LLM produce un vector de logits — igual que la CNN. La única diferencia es la escala: en lugar de 10 clases, hay ~100 000, una por token del vocabulario. Softmax los convierte en una distribución de probabilidad sobre qué viene después.
¿Qué token viene después? 🎲
Elige un contexto. El modelo concentra la probabilidad cuando el contexto es informativo, y la dispersa cuando hay muchas continuaciones razonables.
Generación autoregresiva. Para producir una respuesta completa, el modelo predice un token, lo agrega al final del prompt y repite. «El perro se acercó a la → puerta»; nuevo prompt: «…a la puerta → y»… Cada palabra de una respuesta de ChatGPT fue elegida una a una, condicionada en todas las anteriores.
Una red, muchas tareas
La misma red neuronal —sin entrenamiento adicional— clasifica sentimientos, traduce, resume e inventa historias. Esa generalidad es lo que hizo a los LLM tan disruptivos: no hace falta una red distinta para cada tarea; basta describir la tarea con palabras.
Clasificar
Sentimiento, tema, intención.
Traducir
Entre idiomas, sin red aparte.
Resumir
Condensar textos largos.
Generar
Redactar, inventar, responder.
Cómo «piensa» y sus límites
El modelo no razona en el sentido humano. Lo que parece planificación es el resultado de la atención combinada con la activación de conceptos, distribuida en cientos de capas y ajustada a cada token que produce.
Chain-of-thought. Lo más parecido a una cadena de pensamiento es lo que el modelo escribe «en voz alta». Si le pides «piensa paso a paso», ese texto se vuelve parte del contexto para los siguientes tokens — y eso sí mejora el resultado.
Límites del proceso
Sin internet
Solo sabe lo aprendido hasta su fecha de corte de entrenamiento.
Sin memoria
No recuerda llamadas anteriores; cada consulta es independiente.
Estocástico
Dos preguntas iguales pueden dar respuestas distintas (salvo temperatura = 0).
Puede equivocarse con confianza
No tiene un mecanismo natural para decir «no sé»: hay que enseñárselo en el fine-tuning.
Escanea y responde desde tu móvil
Cada estudiante recibe 10 preguntas al azar de un banco de 80. Al terminar verás tu calificación final y podrás descargar tu boleta para enviarla al docente.
- Escanea el QR con la cámara del teléfono.
- Escribe tu nombre y responde las 10 preguntas.
- Pulsa Calificar → revisa aciertos y errores.
- Tu resultado se envía automáticamente al panel del docente (y puedes descargarlo como respaldo).
Evaluación: 10 preguntas aleatorias
Seleccionadas al azar de un banco de 80. Para aprobar necesitas 7 de 10. Puedes reintentar con un nuevo conjunto.
Calificaciones en vivo
Se actualiza automáticamente conforme los estudiantes envían su evaluación. Docente: MSc. Freddy León Cruz.
| # | Estudiante | Nota | % | Resultado | Fecha | Acción |
|---|---|---|---|---|---|---|
| Aún no hay respuestas. Comparte el QR con tus estudiantes. | ||||||