GLM-5.2: Lo que no te cuentan
Un rincón coordinado por Francisco Javier Rodriguez Amorín
SCIENTIA NON HABET HOSTEM NISI IGNORANTEM: «La ciencia no tiene más enemigo que el ignorante.»
Este artículo desglosa, capa por capa, la anatomía completa de este gigante digital: desde sus parámetros hasta su huella ecológica, pasando por el ejército de ingenieros y el prodigioso proceso matemático que ocurre en milisegundos cuando haces una consulta.
¿Qué esconde realmente un modelo de inteligencia artificial de vanguardia en 2026?
En julio de 2026, GLM-5.2 de Zhipu AI es uno de los modelos de lenguaje más avanzados del planeta. Pero, ¿qué significa que tenga 1,2 billones de parámetros? ¿Cuánto cuesta entrenarlo? ¿Cuántas personas trabajan detrás? ¿Y cómo es posible que, al escribir «El cielo es de color», el modelo sepa que debe continuar con «azul»?
1. ¿Qué son los parámetros en un modelo de IA?
En el corazón de GLM-5.2, los parámetros no son «líneas de código», sino los pesos y sesgos de una red neuronal. Piensa en ellos como el cableado sináptico de un cerebro digital.
- Definición matemática: Son tensores (matrices multidimensionales) de números decimales (floats). Cuando el modelo recibe un texto, estos números multiplican y transforman los datos de entrada capa tras capa.
- El «conocimiento»: Durante el entrenamiento con petabytes de datos, el modelo ajusta estos números para minimizar el error al predecir la siguiente palabra. Un valor alto en un parámetro indica una fuerte conexión entre dos conceptos (ej. «París» y «Torre Eiffel»).
- Tamaño de GLM-5.2: Con una arquitectura Mixture of Experts (MoE) ultraescalada, GLM-5.2 ronda los 1,2 billones de parámetros totales, aunque por suerte, solo activa unos 120 mil millones por consulta (los «expertos» relevantes para ese tema).
Para ponerlo en perspectiva: si cada parámetro fuera un grano de arroz, un modelo de este tamaño llenaría varios estadios de fútbol.
2. Requisitos de hardware
Gestionar 1,2 billones de parámetros en 2026 requiere una hazaña de ingeniería eléctrica y de redes.
Durante el Entrenamiento (Pre-entrenamiento y fine-tuning):
- Cómputo (GPUs): Se necesita un clúster de aproximadamente 12.000 a 15.000 GPUs (como la NVIDIA B200 o la competencia doméstica china, la Huawei Ascend 910C).
- Memoria VRAM (El gran desafío): Un modelo de 1,2 billones de parámetros en precisión FP8 (el estándar de 2026 para ahorrar memoria) ocupa ~1,2 Terabytes (TB) solo en pesos. Sin embargo, para entrenar necesitas guardar:
- Los pesos (1,2 TB)
- Los gradientes (1,2 TB)
- Los estados del optimizador (ej. AdamW, que ocupa el doble: ~2,4 TB)
- Activaciones de las capas (otros 2-3 TB)
- Total: ~7-8 TB de VRAM. Dado que una GPU B200 tiene 192 GB de VRAM, se necesitan unas 40 GPUs solo para cargar el modelo base, pero para que el cálculo sea eficiente se usan técnicas de paralelismo 3D que exigen duplicar esto, requiriendo las 15.000 GPUs para que el entrenamiento dure meses y no décadas.
- Interconexión (El cuello de botella): Se utilizan conmutadores InfiniBand de 800 Gbps por puerto con topologías Fat-Tree no bloqueantes. El cableado de fibra óptica en este clúster supera los 200 kilómetros solo dentro del centro de datos.
Durante la Inferencia (Uso diario en la App/Web):
Gracias al MoE, solo se cargan en memoria los «expertos» más usados. Para servir a millones de usuarios, Zhipu AI usa servidores con 8x GPUs B200 (1,5 TB de VRAM combinada) para mantener el modelo caliente. Para responder en menos de 1 segundo, estos servidores utilizan SSD de última generación como swap de parámetros, intercambiando expertos en milisegundos.
3. Trabajo humano
Más de 2.500 personas han tocado este modelo directa o indirectamente. Se dividen en:
- El Círculo de Oro (50 personas): Investigadores principales (PhDs en Matemáticas y ML) que diseñan la arquitectura MoE, crean nuevas funciones de pérdida (loss functions) para evitar el collapsing de los expertos, y publican papers blancos. Sus salarios anuales superan el millón de dólares cada uno.
- Los Ingenieros de Sistemas (MLEs y SREs) (300 personas): Son los «bomberos» del clúster. A diario se enfrentan a GPU hangs (congelamientos), caídas de nodos por sobrecalentamiento y errores ECC de memoria. Su trabajo es reiniciar el entrenamiento desde checkpoints cada 2 horas sin perder el progreso.
- El Ejército de Datos (400 personas): Ingenieros de datos que crean pipelines para limpiar petabytes de texto chino, inglés y código. Eliminan duplicados, filtran pornografía y discurso de odio, y balancean dominios (ciencia, leyes, medicina).
- Los Anotadores Expertos (1.500+ personas): Contratados a través de empresas como Scale AI o filiales locales. No son solo clickers; para GLM-5.2 se contrataron abogados, médicos y físicos para que redactaran respuestas perfectas (RLHF – Reinforcement Learning from Human Feedback). Cada uno evalúa cientos de respuestas al día.
- El Equipo de Seguridad (200 personas): Ingenieros de Prompt Injection y Red Teaming que intentan engañar al modelo a diario para volverlo robusto contra jailbreaks.
4. Coste Económico
El coste total de desarrollo y despliegue de GLM-5.2 en 2026 se estima en 4.200 millones de dólares (sumando CapEx y OpEx a 3 años).
- Hardware (CapEx): 2.800 millones de dólares. Las GPUs B200 cuestan ~40.000 USD cada una x 15.000 = 600 millones solo en chips, pero el centro de datos incluye sistemas de refrigeración líquida por inmersión, generadores diésel de respaldo y transformadores eléctricos de alta tensión.
- Energía y Mantenimiento (OpEx anual): 400 millones de dólares. El clúster consume 85 Megavatios (MW) de potencia pico. Con un coste industrial de 0,10 USD/kWh, la factura anual ronda los 75 millones, pero el mantenimiento de hardware (sustituir GPUs fundidas) duplica esa cifra.
- Talento (OpEx anual): 250 millones de dólares. La guerra por los ingenieros de IA en Beijing y Silicon Valley ha inflado los salarios; un Staff ML Engineer en Zhipu AI gana entre 800.000 y 1,2M USD anuales en acciones y salario base.
- Entrenamiento final: El run final de 3 meses de preentrenamiento consumió 75 millones de dólares solo en electricidad y desgaste de GPUs.
5. Coste Ecológico

En julio de 2026, la sostenibilidad ya no es un extra, es un requisito regulatorio en la UE y China.
- Consumo eléctrico: El entrenamiento de GLM-5.2 quemó 250 GWh (equivalente al consumo anual de 23.000 hogares estadounidenses). La inferencia (el uso diario por millones de usuarios) consume el doble al año (~500 GWh).
- Huella de carbono (CO2): Zhipu AI tiene centros en Guiyang (hidroeléctrica) y Zhangjiakou (energía eólica). Gracias a esto, la huella de carbono es relativamente baja: 28.000 toneladas de CO2 en entrenamiento (frente a las 300.000 que emitiría en una región con carbón). Aun así, equivale a plantar 1,3 millones de árboles para compensarlo.
- Consumo de agua: La refrigeración líquida por inmersión (la más eficiente) usa agua desionizada en circuito cerrado, pero las torres de enfriamiento auxiliares evaporan agua. Se estima un consumo de 1.200 millones de litros de agua dulce al año para enfriar el centro de datos, suficiente para abastecer a 20.000 personas.
- E-waste (residuos): Las GPUs se degradan rápido. Se estima que el clúster generará 120 toneladas de residuos electrónicos (chips, placas base y cables) cada 4 años. Zhipu AI tiene acuerdos con recicladoras para extraer oro, cobre y tierras raras, pero el proceso sigue siendo altamente contaminante.
6. ¿Cómo maneja GLM-5.2 la frase «El cielo es de color» para continuarla?

Aquí ocurre la magia de los parámetros en tiempo real. Cuando escribes «El cielo es de color», el modelo ejecuta este proceso en milisegundos:
1. Tokenización: De palabras a números que la máquina entiende
GLM-5.2 no ve letras, ve números. El primer paso es tokenizar, es decir, trocear el texto en unidades mínimas llamadas tokens.
- No siempre palabra por palabra. GLM-5.2 usa un tokenizador Byte-Pair Encoding (BPE) avanzado.
- Las palabras muy comunes se quedan enteras:
["El", "cielo", "es", "de", "color"]→ 5 tokens. - GLM-5.2 tiene un vocabulario de 100.000 tokens (incluye chino, inglés, código, emojis y símbolos matemáticos).
Ejemplo real con GLM-5.2:
| 📝 Texto original | 🔢 Token ID | 🧩 Representación |
|---|---|---|
| 1 «El» | [245] | Token Palabra común, asignación directa |
| 2 «cielo» | [1024] | Token Sustantivo con alta frecuencia |
| 3 «es» | [89] | Token Verbo copulativo, muy común |
| 4 «de» | [56] | Token Preposición de alta frecuencia |
| 5 «color» | [3421] | Token Sustantivo con ID superior |
💡 El detalle clave: Durante este paso, el modelo ya está usando parámetros. El embedding que asigna a cada token es aprendido (son parámetros entrenables).
2. Embedding: Convertir tokens en vectores numéricos
Una vez tokenizada, GLM-5.2 convierte cada ID en un vector de 12.288 números decimales. Esto se llama embedding.
- Estos números no son aleatorios; son parámetros aprendidos durante el entrenamiento.
- Palabras con significados parecidos tienen vectores cercanos (distancia matemática pequeña).
- El modelo añade información de posición para saber el orden de las palabras.
Ejemplo simplificado (en realidad son 12.288 dimensiones, aquí mostramos 4):
| 🔤 Token | 📊 Vector (embedding) — 4 dimensiones mostradas |
|---|---|
| «El» | [0.12, -0.45, 0.89, 0.03] |
| «cielo» | [0.98, -0.12, 0.34, 0.67] |
| «es» | [0.05, 0.78, -0.23, 0.44] |
| «de» | [-0.33, 0.21, 0.56, -0.09] |
| «color» | [0.77, 0.44, -0.11, 0.92] |
3. Atención Multi-Cabeza: El cerebro que conecta todo
Los embeddings pasan por decenas de capas de Atención. El modelo calcula cuánto debe fijarse cada palabra en las demás para entender el contexto.
- Cada token genera tres vectores: Query (Q), Key (K) y Value (V).
- GLM-5.2 tiene 128 cabezas de atención trabajando en paralelo, pero gracias al MoE solo activa las ~10 más relevantes por token.
Ejemplo de atención en nuestra frase:
| 🔍 Palabra | 🎯 Atención principal hacia |
|---|---|
| «El» | «cielo» (casi 100%) |
| «cielo» | «color» (70%) y«es» (20%) |
| «es» | «cielo» (60%) y«color» (30%) |
| «de» | «color» (90%) |
| «color» | «cielo» (50%) y«de» (40%) |
4. Capas Feed-Forward: Procesar la información
Después de la atención, cada token pasa por una red feed-forward. Aquí es donde el modelo piensa realmente.
- Toma el vector resultante y lo expande a un tamaño mayor (ej. de 12.288 a 49.152 dimensiones) para capturar relaciones complejas, y luego lo comprime de vuelta.
- En GLM-5.2 (MoE), un enrutador decide qué expertos (feed-forwards especializadas) activar para cada token.
Ejemplo con «cielo»: El enrutador activa al Experto en Meteorología, al Experto en Poesía y al Experto en Astronomía. Desactiva al Experto en Cocina y al Experto en Derecho.
5. Capa de salida: Predecir la siguiente palabra
Después de docenas de capas, el vector final de «color» contiene todo el contexto. Una capa lineal lo convierte en un vector de 100.000 dimensiones (una por cada token del vocabulario).
Se aplica softmax para convertir esas puntuaciones en probabilidades (que sumen 100%).
Resultado para «El cielo es de color»:
| 📝 Palabra siguiente | 📊 Probabilidad | 🎯 |
|---|---|---|
| «azul» | 48% 🏆 Mayor |
🔵 |
| «gris» | 22% | 🌫️ |
| «rojizo» | 11% | 🔴 |
| «negro» | 8% | ⚫ |
| «blanco» | 5% | ⬜ |
| Otras 99.994 palabras | 4% (distribuido) | ⋯ |
6. Decodificación: Elegir la palabra final
GLM-5.2 no siempre elige la palabra más probable (eso haría las respuestas aburridas y siempre iguales).
- Top-p sampling (nucleus sampling): Filtra las palabras cuyo acumulado de probabilidad llega al 90%, y elige aleatoriamente entre ellas ponderado por su probabilidad.
- Temperature: Un parámetro que aplana o afila las probabilidades. Baja temperatura = conservador; alta temperatura = creativo.
Elección final: GLM-5.2 elige «azul»y devuelve:
«El cielo es de color azul»
7. El proceso completo
Frase entrada: "El cielo es de color" ↓ [Tokenización] "El" → [245], "cielo" → [1024], "es" → [89], "de" → [56], "color" → [3421] ↓ [Embedding + Posición] Cada ID → Vector de 12.288 números + vector de posición ↓ [Capas de Atención (MoE)] 128 cabezas, solo activas las relevantes. Cálculo de Q, K, V entre todas las palabras. "cielo" presta atención a «color» (70%). ↓ [Capas Feed-Forward (MoE)] Enrutador activa expertos: Meteorología, Poesía, Astronomía. ↓ [Repetir ~80 capas] Cada capa refina los vectores con más contexto. ↓ [Capa de Salida] Vector final de «color» (12.288 dims) → 100.000 puntuaciones. ↓ [Softmax] Puntuaciones → Probabilidades: «azul» 48%, «gris» 22%, ... ↓ [Decodificación (Top-p + Temperature)] Elige «azul» (o a veces «gris» si está creativo). ↓ Frase salida: «El cielo es de color azul»
📎 Enlaces y recursos oficiales
Si quieres profundizar, probar el modelo o seguir la evolución de Zhipu AI, aquí tienes los principales enlaces oficiales:
🏢 Zhipu AI — La empresa
- Sitio web oficial: zhipuai.cn (disponible en chino e inglés)
- Código bursátil (HKEX): 02513 (Z.AI Co., Ltd.)
- Plataforma de desarrollo (API): docs.bigmodel.cn — Documentación oficial y consola de API
🧠 GLM-5.2 — El modelo
- Blog de lanzamiento: z.ai/blog/glm-5.2
- Paper técnico (arXiv): arXiv:2602.15763 — «GLM-5: from Vibe Coding to Agentic Engineering»
- Chat de prueba: chat.z.ai — Prueba el modelo en directo
📦 Descargas y código abierto
- GitHub: github.com/zai-org/GLM-5 — Código fuente y documentación
- Hugging Face (modelo BF16): zai-org/GLM-5.2 — 744B parámetros en precisión BF16
- Hugging Face (modelo FP8): zai-org/GLM-5.2-FP8 — Versión optimizada en FP8
- ModelScope (China): ZhipuAI/GLM-5.2 — Espejo oficial para descargas en China
- Licencia: MIT (completamente abierto, sin restricciones regionales, permite uso comercial)
⚡ API y servicios en la nube
- API oficial de Z.ai: docs.z.ai/guides/llm/glm-5.2 — Precio desde $0.95 por 1M tokens de entrada
- Supercomputadora Nacional de China (SCNet): API GLM-5.2 en SCNet — Despliegue Day 0 en infraestructura nacional
🌐 Comunidad
- Discord: discord.gg/QR7SARHRxK
- WeChat: Escanea el código QR en el repositorio de Hugging Face
El precio del prodigio
GLM-5.2 es una maravilla de la ingeniería, pero también un recordatorio de que la inteligencia artificial no es magia: es matemáticas, electricidad, agua, metales raros y miles de horas de trabajo humano.
Cada vez que el modelo elige una palabra, está realizando 1,2 billones de operaciones matemáticas (multiplicaciones de matrices) para decidir cuál de esos parámetros tiene más relevancia, devolviéndote la palabra más lógica, hermosa o útil según el contexto.
El desafío de la próxima década no será solo hacer modelos más grandes, sino hacerlos más eficientes, más sostenibles y más transparentes.
Artículo actualizado a agosto de 2026. GLM-5.2 es propiedad de Zhipu AI (Z.AI Co., Ltd.).
Francisco Javier Rodríguez Amorín con las herramientas Zia y DeepSeek.
Comparte, tus amig@s lo agradecerán…
🐘 Mastodon: @LQSomos |
🗣️ Friendica: Loquesomos |
📱 UpScrolled: @LQSomos
💬 Telegram: LoQueSomosWeb |
🦋 Bluesky: LQSomos |
🐦 Twitter: @LQSomos
📘 Facebook: LoQueSomos |
📸 Instagram: LoQueSomos |
📲 WhatsApp: LoQueSomos
▶️ YouTube: @LoquesomosAudiovisual
