- Briefing
- Etapa Aprende · 3/5
Aprende
Glosario de cinco capas
55 términos. Analogía, ejemplo con números, trampa y el recorte Ox.
- Vas a entender
- Cinco capas: claro, analogía, ejemplo, trampa, Ox.
- Saltar por letra, no tragar el diccionario.
- Usarlo como atril, no como novela.
A
LLM · el autocompletado gigante
En claro. Un programa que ha visto cantidades brutales de texto y solo sabe hacer una cosa: adivinar la siguiente pieza. No es una persona. No es Google. Compactó estadísticas en números.
Analogía. El teclado del teléfono que se atrevió a escribir un capítulo entero de código.
Ejemplo. Tú: «El cielo es». Suele seguir «azul», no porque «sepa» meteorología, sino porque esa pareja apareció millones de veces y el contexto empuja.
Trampa. Si miente con seguridad, sigue siendo un loro brillante. Confianza ≠ verdad.
Recorte Ox. Ox Alpha es un LLM vestido de «razonamiento»: primero borra un borrador privado, luego te habla. OpenRouter lo vende para coding y agentes, no para poesía.
Token · pieza Lego del lenguaje
En claro. No es una letra. No siempre es una palabra. Es el trozo en el que el modelo corta el texto: «hola» puede ser 1; «extraordinariamente» puede ser 3; un emoji 1 o 2; un renglón de código, 20.
Analogía. Si el texto es un collar, los tokens son las cuentas. Distintos fabricantes cortan cuentas distintas.
Ejemplo. «Hello» ≈ 1 token en inglés. «Hola» puede ser 1 o 2 según el cuchillo. 1.048.576 tokens ≈ un libro gordo + un repo entero.
Trampa. Los SMS contaban 160 letras. WhatsApp no. Los modelos recuerdan y cobran en tokens, no en letras. «Un millón de palabras» es marketing perezoso.
Recorte Ox. Ox Alpha admite 1.048.576 de entrada y 131.072 de salida. Eso es 2²⁰ y 2¹⁷, no un millón redondo.
Tokenizer · el cuchillo / el diccionario
En claro. La receta que convierte letras en números (IDs). Cada lab tiene la suya, o copia una. Si dos APIs, con el mismo texto, reportan el mismo número de tokens (salvo un extra FIJO), casi seguro comparten cuchillo.
Analogía. Dos personas con el mismo teclado T9 de 2005. Mensajes distintos, mismas pulsaciones para «hola».
Ejemplo. Prueba pública: tok(Ox, P) − tok(GLM-5.3, P) = 75 en EN, DE, CN, código y emoji. Kimi, Qwen, MiMo y MiniMax NO dan 75 constante.
Trampa. Mismo cuchillo ≠ mismos pesos. Alguien pudo fine-tunear GLM. El +75 prueba diccionario + membrete, no el DNI del cerebro.
Recorte Ox. Esta es LA prueba estrella del expediente. Un universitario puede repetirla: mismo texto a las dos APIs, restar.
Parámetro · perilla / peso / sinapsis artificial
En claro. Un número que el modelo giró al entrenar. Hay cientos de miles de millones. No es un trozo de texto. «Menos parámetros» no significa «más tonto»: puede significar «más eficiente».
Analogía. Una orquesta de 744 músicos donde solo 40 tocan a la vez. Suena a sinfónica, cobra como banda.
Ejemplo. GLM-5.x: ~744B totales, ~40B activos por token (MoE). Un denso de 2T cobra ~50× más por palabra. Interconnects: ~750B, un tercio de Kimi K3, y aun así frontier en coding.
Trampa. La gente usa «parámetros» como insulto de patio. En 2026 pasó lo contrario: post-training bueno > tamaño bruto.
Recorte Ox. Ox no publica cuenta. Si es GLM-5.x, hereda ~744B/40B. Flash/Air rumoreado ~300B: chisme, no ficha.
B
MoE (mezcla de expertos) · el hospital con triaje
En claro. No es un cerebro. Es un edificio de sub-cerebros y un portero. El portero despierta solo a unos pocos por cada pieza de texto. El conocimiento vive en todo el edificio; la factura cobra a los despiertos.
Analogía. No despiertas a 744 médicos por un esguince. El triaje llama a 40. El hospital sigue siendo enorme.
Ejemplo. coste ≈ k · P_activos · tokens (no P_totales). GLM: 40B / 744B ≈ 5% del edificio trabaja en cada palabra.
Trampa. «MoE es trampa de marketing». A veces sí (expertos de juguete). En GLM-5 está medido: 40B activos. Flash/Air suele ser el hermano que despierta todavía menos.
Recorte Ox. Si Ox es Flash, la barra de especialistas se va más a la izquierda: por eso pueden regalar un fin de semana de tokens.
C
Ventana de contexto · el escritorio de trabajo
En claro. Cuánto texto cabe de una vez: lo que pegas + lo que genera. No es memoria infinita. Tampoco garantiza que use bien el principio y el final (se pierde «en el medio»).
Analogía. Un pupitre de 1 km. Caben todos los cuadernos. Aun así puedes perder las mates en el metro 400.
Ejemplo. 2²⁰ = 1.048.576. Chrome con 200 pestañas «cabe». No significa que encuentres la de Hacienda. GLM-5.2 ya usaba 1M con IndexShare.
Trampa. 1M de Xiaomi también. El número no es DNI. Sí descarta el eslogan «1.000.000 de tokens» redondo.
Recorte Ox. Ox y GLM-5.2/5.3 publican exactamente 1.048.576. Nadie ha auditado que Ox USE el millón bien a los 800K.
Prompt · lo que le pegas en el recuadro
En claro. El texto (y a veces imagen/video) que le das. Incluye lo que ves y lo que NO ves: el system prompt, el membrete de 75 tokens.
Analogía. La carta que metes en el sobre. El sobre (system) ya traía un membrete. Por eso Ox siempre pesa 75 g más.
Ejemplo. Si pegas un repo de 40.000 tokens y una pregunta de 20, el modelo ve ~40.020 + el membrete. El caché intenta no releer el repo.
Trampa. «Le dije que fuera honesto» no borra el system prompt del lab. El membrete stealth de Ox dice: no te identifiques como otro modelo.
Recorte Ox. Pliny filtró el wrapper: «You are ox-alpha… undisclosed organization». Eso es el +75, no el cerebro.
API · el mostrador con reglas
En claro. No hablas con el cerebro. Hablas con una ventanilla: mandas JSON, vuelven tokens. OpenRouter es un centro comercial: un mostrador, muchos almacenes detrás.
Analogía. Pediste delivery sin logo. La caja, el ticket y el número de reclamación son de un restaurante concreto.
Ejemplo. Error 1210: «This model always engages in thinking and cannot be disabled; please use low, high, or max». Misma frase que chat.z.ai / GLM-5.3.
Trampa. El mostrador bonito (OpenRouter) no inventó el 1210. El almacén sí. Un error interno delata el barrio.
Recorte Ox. stealth/ox-alpha es el nombre del pasillo, no del almacén. Pritish (ex-Llama) vio 1210/1214 idénticos a z.ai.
D
Stealth · coche de pruebas sin placa
En claro. Un lab sirve el modelo gratis y anónimo para ver si aguanta el tráfico y qué dice la gente. Luego se quitan la máscara… o no. En este canal de OpenRouter, 4 de 4 anteriores eran labs chinos.
Analogía. Un restaurante abre como «Sitio Sin Nombre». Semana gratis. Luego pone el letrero. Los cuatro anteriores eran cocinas chinas distintas.
Ejemplo. Pony Alpha (feb 2026) → GLM-5. Hunter/Healer → MiMo-V2. Elephant → Ling-2.6-flash. Owl → LongCat-2.0. Ox es el quinto, el primero con video nativo.
Trampa. Stealth ≠ secreto militar. Es marketing de falta de marca. Tampoco es «open-weights»: Inkling de Mira SÍ publicó pesos; Ox no.
Recorte Ox. OpenRouter dice: no somos el dueño. El proveedor retiene prompts. OpenCode promete zero retention. Tres contratos chocan. No pegues secretos.
Fingerprinting · medir manías porque no abre el cráneo
En claro. Batería de pruebas que un modelo no puede dejar de «ser él»: tokenizer, errores de API, encoder de video, estilo a temperatura 0, rechazo de audio, caché, logs.
Analogía. No ves la cara. Ves talla de zapato, acento, marca de café y la línea de metro. Cinco coincidencias no son un capricho.
Ejemplo. Video: 2s 30fps 360p = 296 tokens en Ox Y en GLM-5V-Turbo. MiMo 910. Qwen 408. GLM-4.6V 1.832. Tres elecciones de encoder coinciden.
Trampa. Una sola prueba no es DNI. El jailbreak «soy GLM» es la más fácil de falsificar. El encoder de video es la más difícil.
Recorte Ox. Siete u ocho huellas. Seis apuntan a Z.ai. El playbook también podría ser Xiaomi. El cuchillo mata a Xiaomi.
E
Temperatura · cuánta improvisación se permite
En claro. A 0, siempre elige el token más probable: loro disciplinado. A 1, más creativo y más caótico. Para comparar clones se usa 0: si dos sistemas escriben casi carácter a carácter igual, son familia o copia.
Analogía. Temperatura 0 = receta del abuelo, siempre igual. Temperatura 1 = jazz. No fingerprintas un jazzman.
Ejemplo. Testers a temp 0: mismas rarezas de markdown, mismo decimal alemán en LaTeX (0{,}375), respuestas factuales casi calco vs GLM-5.3.
Trampa. «Es creativo» no es identidad. El estilo a temp 1 varía. La prueba dura es temp 0 + tokenizer, no un poema.
Recorte Ox. Si alguien te enseña un output «único» de Ox a temp alta, no es huella. Pide la resta de tokens.
Caché de prefijos (KV cache) · el termo del barista
En claro. Si pegas el mismo repo 40 veces, un servidor listo no lo relee entero: guarda el cómputo del principio. Hit rate alto = cocina seria. No es el cerebro; es la infraestructura.
Analogía. 97 de 100 cafés salen del termo, no del molino. Solo un local hacía eso tan bien… o eso creíamos.
Ejemplo. Un tester en pi.dev midió ~97% en Ox. El catálogo OpenRouter mostraba ~87% Ox vs ~92% GLM-5.3. Anthropic típico ~64%, OpenAI ~83%. Firma blanda.
Trampa. El 97% NO es cifra oficial. Inflarlo como DNI de z.ai fue un error de este dossier y se recortó. El encoder y el +75 pesan más.
Recorte Ox. Compatible con cocina z.ai. No prueba pesos. Un lab ajeno con buen caché también podría.
Encoder de video · el peaje de los fotogramas
En claro. El video no entra como Netflix. Se parte en fotogramas (o tubos espacio-tiempo) y se convierte en tokens caros. Cada lab elige resolución, fps y tokens por parche.
Analogía. Traducir una película a cómic. Si dos estudios usan los mismos viñetas por minuto, copiaron el storyboard.
Ejemplo. Cuatro clips controlados: Ox = GLM-5V-Turbo token a token (296, 296, 884, 1.064). Independiente del fps (30 vs 5 da igual: muestreo fijo).
Trampa. «Ve video» no identifica el lab. El PRESUPUESTO de tokens sí. Un fine-tune de Cursor que conserve el preprocessor de Z.ai es posible pero forzado.
Recorte Ox. La huella más difícil de fingir de este episodio. Por eso Composer 3 from-scratch queda mal: tendría que haber robado el peaje entero.
F
Agente · el becario con el portátil toda la tarde
En claro. Un chat responde. Un agente se queda en bucle: lee el error, cambia el archivo, vuelve a correr tests. Come tokens a lo bestia porque el repo se pega una y otra vez.
Analogía. No es el profesor que explica la tarea. Es el becario al que le dejas el portátil y vuelve a las 2 a.m. con un PR. Gasta café (tokens) sin parar.
Ejemplo. Davis: ~117 pasos de agente por tarea DeepSWE vs 124 de GLM-5.3. GPT-5.6-sol ~61. El olor de modelo grande está en los pasos, no en un tuit.
Trampa. «Agéntico» es la palabra de moda de 2026. Cualquier chat con herramientas se apunta el tanto. Mira el bucle y el caché, no el adjetivo.
Recorte Ox. La ficha oficial: coding, agentes largos, producción. Por eso OpenCode lo regala una semana: quieren ver si el bucle aguanta.
Jailbreak · quitarle la máscara a empujones
En claro. Truco para que el modelo ignore su system prompt y suelte lo que no debía: quién es, cómo hacer daño, el texto interno. Es evidencia blanda: los modelos también inventan identidad.
Analogía. En carnaval le quitas la máscara y grita su nombre. Pista. También podría estar actuando.
Ejemplo. Pliny: el wrapper dice que es ox-alpha de una org no revelada. Otro tuit débil: «I'm GLM… Z.ai». Davis/tokenizer no lideran con eso.
Trampa. Un jailbreak no es un leak del lab. «My agent has spoken» (Pliny) es opinión de un agente, no un PDF de Z.ai.
Recorte Ox. Peso bajo en este dossier. El +75 y el peaje de video cargan el retrato. El nombre vomitado es adorno.
G
Manifold · el mercado de apuestas, no un paper
En claro. Gente apuesta dinero (o puntos) a hechos. El porcentaje es el precio de la apuesta, no una medición de laboratorio. 85% Z.ai significa «el mercado cree que es Z.ai», no «Z.ai firmó».
Analogía. Las casas de apuestas dan 80% a que llueva. Lleva el paraguas. No es un satélite.
Ejemplo. Snapshot 21 ago: Z.ai/Zhipu ~85%, Xiaomi ~6%, Other ~6%, xAI/Cursor ~2%. Volumen de miles de mana, no millones.
Trampa. Este dossier pone 85 en el briefing porque el MERCADO dice 85. La rúbrica interna de candidatos (22 MiMo, 9 Composer) es OTRA barra, nuestra, no Manifold.
Recorte Ox. Úsalo como temperatura de la sala, no como huella. Pliny y Davis apostaron GLM; eso no es la resta de tokens.
Open-weights · publican los números para que los bajes
En claro. El lab suelta los parámetros (a veces con licencia). Puedes correrlo en tu máquina si te cabe. Distinto de «open source» del código de entrenamiento, que casi nadie suelta entero.
Analogía. Te dan la receta de la tarta (pesos) pero no el diario de la cocina (datos + código de train). Inkling hizo eso. Ox no.
Ejemplo. Inkling (Mira, 15 jul 2026): pesos públicos, ~975B/41B, texto+imagen+audio. GLM-5.3 prometió pesos ~2 semanas después del 14 ago; el 21 aún no.
Trampa. Un stealth no es open-weights. Si Ox lo fuera, no haría falta fingerprinting: lo bajarías y leerías el config.json.
Recorte Ox. Ox es anónimo a propósito. Eso ya cierra Inkling. Cierra también «es Llama 4 que se me olvidó».
Fine-tune · el mismo edificio, otro oficio
En claro. Partes de un modelo ya entrenado y lo sigues entrenando en un oficio (código, medicina, «sé Cursor»). Conserva el tokenizer. Cambia el comportamiento. Por eso un fine-tune de GLM sigue oliendo a GLM en el cuchillo.
Analogía. Pintas un Ferrari de otro color. El motor, el chasis y el número de serie siguen siendo Ferrari. El taller puede ser otro… o el original.
Ejemplo. Composer 1 se rumoreó como fine-tune de GLM/Kimi. Composer 3 se anunció from-scratch 1.5T. Ox con tokenizer GLM + errores z.ai encaja peor con from-scratch.
Trampa. Fine-tune explica cuchillo GLM + benches no idénticos a 5.3. NO explica 1210, logs chinos y peaje 5V-Turbo salvo que sirvan desde la cocina z.ai.
Recorte Ox. Candidato a 9–12% en este dossier (Cursor/Anomaly). Vivo. No líder. 100T/día sigue siendo factura de hyperscaler.
H
Thinking / razonamiento · el borrador privado antes de hablarte
En claro. El modelo genera tokens que TÚ no ves (la chuleta) y luego la respuesta limpia. GLM-5.3 no deja apagarlo: low / high / max. Si pides disabled, explota el 1210.
Analogía. Un amigo que solo puede decir una palabra cada vez, pero es buenísimo adivinando la siguiente. «Razonar» es escribir la chuleta primero.
Ejemplo. Ox, como 5.3, parece thinking siempre on. Max por defecto. Eso alinea API, no IQ. Un modelo chico también puede ser mandatory-thinking.
Trampa. «Piensa» no significa que tenga un homúnculo. Sigue prediciendo tokens. Solo reserva un presupuesto para el borrador.
Recorte Ox. Suma al perfil GLM. No elige el SKU. El cuchillo y el peaje pesan más que el adjetivo reasoning de OpenRouter.
Benchmark · el examen, y el truco del examen corto
En claro. Una batería de tareas para comparar modelos. N importa. Quién pagó importa. Si el test se filtró al entrenamiento, el 90% es copiar.
Analogía. Encestar 10 tiros libres y proclamarte mejor que la NBA. Quizá. Quizá elegiste los fáciles.
Ejemplo. DeepSWE tiene 113 tareas. Davis corrió 10: Ox ~80%. Wenqi (autor) ~63% en un subset más serio. Kingbench: Ox 87.5 vs GLM-5.3 91.25.
Trampa. La tabla viral que pone a Ox sobre Fable/Sol como si fuera el leaderboard oficial está MAL. n=10 no es n=113.
Recorte Ox. Usamos benches como pista de familia (se parece a GLM), no como medalla de oro. Dylan Fetch en OpenTTD lo vio lento y flojo: disenso real.
I
EULA / retención de datos · la letra pequeña de la semana gratis
En claro. Tres papeles chocan. OpenCode: zero data retention. Ficha OpenRouter: el proveedor RETIENE prompts y no entrena. EULA stealth: el acceso gratis es contraprestación para entrenar. No puedes creer los tres.
Analogía. El restaurante dice «no grabamos». El ticket dice «guardamos el pedido». El contrato de la app dice «usamos tu receta». Elige a quién crees antes de contar el secreto de la abuela.
Ejemplo. Tuit OpenRouter: «this time the provider does not train». El /terms/stealth al que la ficha enlaza dice lo contrario para User Content.
Trampa. «Gratis» no es caridad. En stealth suele ser pago en prompts. Trata Ox como un extraño en un café público.
Recorte Ox. El dossier no resuelve el contrato. Te avisa: no pegues claves, historiales médicos, ni el repo secreto de la empresa.
J
2²⁰ / potencia de dos · el kilo de informáticos, no el del súper
En claro. Un bit es 0 o 1. Con n bits caben 2ⁿ cosas. 2¹⁰ = 1.024. 2²⁰ = 1.048.576. Las GPUs aman esos tamaños. Por eso casi nunca ves «1.000.000 de tokens» redondo en una ficha seria.
Analogía. Huevos de 12, no de 10. El envase encaja. Aquí el envase es la máscara de atención.
Ejemplo. Pendrive «64 GB» no tiene 64.000.000.000 bytes redondos. Ox context = 1.048.576 = GLM-5.2/5.3. Max out 131.072 = 2¹⁷ = GLM-5V-Turbo, no el 128K oficial de 5.3.
Trampa. Xiaomi también usa 1M. 2²⁰ no es DNI. El 131.072 vs 128K sí empuja a «no es el 5.3 de folleto».
Recorte Ox. En Labs → escritorio 2ⁿ puedes mover n y ver cómo crece hasta el pupitre de Ox.
K
Lab · quién entrenó el modelo, no quién lo vende
En claro. Z.ai, Xiaomi, OpenAI, Cursor, Thinking Machines… son labs (o estudios). OpenRouter NO es un lab: es el centro comercial. OpenCode es una terminal/agente que consume modelos.
Analogía. El mall te vende el café. No te dice qué finca tostó el grano — salvo que el vaso tenga su sello (error 1210).
Ejemplo. Canal stealth 2026: Zhipu, Xiaomi, Ant, Meituan. Occidente casi nunca pone un animal anónimo aquí. Inkling salió CON nombre el 21 ago.
Trampa. «Es China» no es racismo de silicio. Es estadística de ESTE canal. Un lab US podría usarlo; de momento 4/4 no lo hizo.
Recorte Ox. La tesis líder nombra lab (Z.ai) y familia (GLM-5.x). El SKU (Flash vs 5.3V) sigue abierto.
L
Multimodal · no solo come texto
En claro. Modalidad = tipo de dato. Texto, imagen, audio, video. Ox: texto+imagen+video IN, texto OUT. Rechaza audio. Inkling: texto+imagen+audio. GLM-5.3 público: solo texto.
Analogía. No come cacahuetes. El primo Inkling sí. No es ese primo. El 5.3 de folleto ni siquiera trae cámara.
Ejemplo. Un clip de 2s a 360p le cuesta 296 tokens. El mismo clip a GLM-5V-Turbo: 296. A MiMo v2.5: 910 y ADEMÁS acepta audio.
Trampa. «Multimodal» en un tuit no dice cuáles modalidades. Siempre pregunta: ¿audio? ¿video? ¿salida de imagen? Ox no genera video; lo LEE.
Recorte Ox. Video nativo es lo que lo separa del 5.3 público y lo que lo acerca a GLM-5V. Audio rechazado es lo que mata a Inkling y a MiMo-Omni.
M
Flash / Air · el hermano más barato
En claro. En las familias chinas, Flash/Air suele ser el mismo edificio con menos gente despierta (o destilado). Más barato de servir. Por eso alguien puede regalar 100T de capacidad.
Analogía. Coca-Cola y Coca-Cola Light. Misma casa, menos azúcar. El sabor delata la marca. Las calorías delatan el SKU.
Ejemplo. Leo/@synthwavedd dijo «GLM-5.3 Flash». AGTP repitió «~300B community estimates». Cero ficha de Z.ai. Wenqi: «big model smell» (~63% DeepSWE) corta contra un destilado pequeño.
Trampa. Flash no es un sabor que hayas comprobado. Trátalo como chisme técnico encima de la ID GLM, no como segunda identidad.
Recorte Ox. Tesis líder: familia GLM-5.x multimodal. Flash/Air es el apellido más ruidoso, no el único. 5.3V (mismo tamaño + cámara) encaja igual de bien.
N
System prompt · el membrete
En claro. Texto oculto pegado al inicio: quién eres, qué no digas, qué tono. El usuario no lo ve. El modelo lo lee como página 1. Cuenta tokens. En Ox son ~75 fijos.
Analogía. Membrete de hotel. El cuerpo de la carta es tuyo. Las 75 palabras de arriba son de la cadena: «usted es ox-alpha, organización no revelada».
Ejemplo. Δ(Ox, GLM-5.3)=75 en 6–25 prompts y varios idiomas. Si el cuchillo cambiara, 75 se volvería 71 u 90. Pliny filtró el wrapper que encaja con esas 75.
Trampa. El membrete puede mandar fingir identidad. Por eso un jailbreak que grita «soy GLM» es blando: el system prompt también puede pedir lo contrario.
Recorte Ox. 75 es el extra, no el crimen. El crimen es que el resto del recuento coincide token a token con GLM-5.3.
Pesos / Weights · las perillas ya giradas
En claro. Los números que el modelo guardó después de estudiar. Son los parámetros congelados. Descargar pesos = llevarte el cerebro. Ox no publica ninguno. Inkling sí.
Analogía. Receta vs plato tapado. Open-weights te dan el pastel horneado. Stealth te sirve el plato y esconde la cocina.
Ejemplo. Inkling ~975B/41B Apache-2.0, julio 2026. Ox: cero. GLM-5.3 público tampoco es open-weights en el sentido Inkling; se sirve por API.
Trampa. Pesos ≠ tokens. Tokens son Lego de tu frase. Pesos son las manos. «Open-weights» no es «código abierto total»: a menudo faltan datos y receta de entrenamiento.
Recorte Ox. Sin pesos públicos hay que fingerprinting. Si Z.ai soltara un 5.3V open-weights, el +75 pasaría de misterio a catálogo.
MoE gating · el portero
En claro. Red pequeña que mira cada token y elige qué k expertos se encienden. «Gating más tacaño» = Flash/Air: misma marca, menos turno, más barato de servir.
Analogía. Triaje de urgencias. No despiertas al hospital. El portero no es un médico distinto: es la persona con la lista.
Ejemplo. GLM-5: ~744B totales, ~40B activos/token. Si Ox es Flash, el gating despierta menos. El tokenizer puede seguir siendo el mismo. Sabor de casa, calorías de Light.
Trampa. Gating ≠ identidad del lab. Muchos labs hacen MoE. El portero explica la factura, no el DNI. El cuchillo y el encoder sí empujan el DNI.
Recorte Ox. ~300B rumoreados es chisme de gating. Trátalo como SKU, no como prueba. +75 sigue siendo más duro.
O
Denso vs MoE · toda la orquesta vs solo 40
En claro. Denso = todas las perillas se despiertan en cada token. MoE = un portero despierta k. Un denso de 2T cobra 2T todo el rato. Un MoE de 744B/40B cobra 40B. Por eso 744B puede ser más barato que 2T.
Analogía. Farola que enciende toda la ciudad vs farolas que se encienden solo en tu calle. La ciudad sigue ahí. Pagas la calle.
Ejemplo. Coste ≈ k · P_activos · tokens (MoE) vs P_totales · tokens (denso). Un lab puede regalar un fin de semana con MoE. Con un denso 2T, quiebra.
Trampa. «Más parámetros» en un MoE no se traduce 1:1 a factura ni a inteligencia. No insultes con «menos parámetros».
Recorte Ox. Si Ox es GLM-5.x, hereda MoE. El rumor Flash es «aún menos despiertos», no un denso pequeño.
Sampling · cómo se elige el siguiente ladrillo
En claro. El modelo no escribe: calcula una lista de siguientes piezas con probabilidades y SACA una. Temperatura aplana o afila esa lista. Top-p recorta la cola. Sampling = ese sorteo.
Analogía. Ruleta con sectores más gordos para «azul» que para «magenta». Temp 0 = solo el sector más gordo. Temp 1 = la ruleta honesta.
Ejemplo. A temp 0, testers vieron markdown y LaTeX 0{,}375 iguales a GLM-5.3. Eso es sampling degenerado: el máximo a posteriori, repetible.
Trampa. Sampling no es «pensamiento». Es un dado. Un wrapper puede copiar el estilo a temp 0. El +75 no sale del dado: sale del cuchillo.
Recorte Ox. La prueba dura no es el sampling (blando). Es tokenizer + encoder. Sampling igual es evidencia de cocina, nota B.
Lost in the middle · cabida ≠ atención
En claro. Que quepan 1.048.576 tokens no prueba que el modelo lea el metro 400. A menudo atiende bien el principio y el final y pierde el centro. Capacidad es el pupitre. Atención es si encuentra el cuaderno.
Analogía. Chrome con 200 pestañas «cabe». No significa que recuerdes la 87.
Ejemplo. Nadie ha auditado Ox a 800K. GLM-5.2 metió IndexShare para no pagar atención plena a 1M. El millón es un máximo, no una receta.
Trampa. «Pega el monorepo porque cabe» es cómo se queman tokens y se pierde el requisito. Lost-in-the-middle es un paper clásico (Liu et al.), no un meme de Ox.
Recorte Ox. 2²⁰ alinea con GLM y Xiaomi: ingeniería, no DNI. No uses el millón como prueba de identidad ni como permiso para pegar secretos.
P
API vs chat · ventanilla vs terraza
En claro. Chat = burbujas bonitas. API = JSON: mandas temp, max tokens, thinking; vuelven prompt_tokens crudos. El cerebro puede ser el mismo. La ventanilla delata el almacén (error 1210).
Analogía. Pedir en barra vs delivery. Misma cocina. El ticket de reclamación sale de la ventanilla, no de la terraza.
Ejemplo. En chat no ves prompt_tokens. En API sí: por eso existe el test +75. RocketmanSh mandó max_tokens ilegal → 1210, el mismo cartel que chat.z.ai.
Trampa. Culpar a OpenRouter por la identidad es culpar a Amazon Logistics por el teléfono. Fingerprinting se hace por API.
Recorte Ox. stealth/ox-alpha es el pasillo. 1210, logs CJK y prompt_tokens son el ticket de almacén.
Alucinación · loro brillante, no bibliotecario
En claro. El modelo siempre adivina la siguiente pieza. A veces suena a hecho y no lo es. Alucinación = texto fluido no anclado a datos ni al recuadro. Confianza ≠ verdad.
Analogía. Estudiante que memorizó la biblioteca e improvisa la cita. El tono es de examen. La página no existe.
Ejemplo. «¿Quién ganó ayer?» sin buscador: inventa o se niega. Un jailbreak «soy GLM» puede ser el mismo patrón: completa «los modelos revelan su nombre».
Trampa. Temp 0 reduce variedad, no mentiras. Si lo más probable es un error, lo repetirá.
Recorte Ox. No lideramos con «Ox dijo que es GLM». Lideramos con cuentas y peajes, que no alucinan. El loro no finge un 296=296.
Bucle de agente · el becario de las 2 a.m.
En claro. Ciclo: lee objetivo → elige herramienta (terminal, browser, test) → ve resultado → cambia archivo → vuelve. Cada vuelta pega el repo otra vez. No es una charla.
Analogía. No es el profesor. Es el becario al que le dejas el portátil. El café son tokens. El termo es el prefix cache.
Ejemplo. OpenCode, Hermes Agent, Claude Code: top de consumo de Ox. Un chat = 1 vuelta. Un agente de repo puede ser 80. Por eso 97% hit rate y 100T de capacidad.
Trampa. «Agéntico» a veces es solo thinking tokens sin herramientas. Pregunta: ¿tiene terminal de verdad?
Recorte Ox. La ficha: coding, agentes largos, producción. El bucle es por qué caché, 1 GW y stealth coinciden.
Q
Pretrain / post-training · leer la biblioteca, luego el examen
En claro. Pretrain = tragarse internet y aprender a completar texto (base). Post-training = enseñarle a obedecer (instruct/chat) y a no ser un monstruo. GLM-5.3 ES post-training sobre el base 5.2.
Analogía. Primero lees todos los libros. Luego te entrenan para responder en un oral. Fine-tune extra = clases particulares con apuntes ajenos.
Ejemplo. Composer 3 se vendió as 1.5T from-scratch. Un from-scratch NO heredaría tokenizer GLM ni logs ModelScope. Un post-train de GLM sí.
Trampa. Fine-tune y «es GLM de z.ai» no son enemigos. Pregunta QUIÉN sirve y QUÉ heredó (cuchillo, encoder, 1210).
Recorte Ox. Tesis líder: familia GLM-5.x multimodal. Fine-tune de tercero: vivo, no líder. From-scratch Cursor: herido.
Wrapper / +75 · el sobre, no las tijeras
En claro. Un extra FIJO de tokens delante de tu prompt. En Ox, Δ vs GLM-5.3 = 75 en todos los idiomas. Eso es membrete (system prompt / plantilla), no otro cuchillo. Si el cuchillo cambiara, 75 no sería constante.
Analogía. Dos cocineros, mismo pepino: siempre 8 rodajas, más 75 de membrete en uno. Las tijeras son las mismas.
Ejemplo. RocketmanSh: Ox 88/106/97/108 vs GLM 13/31/22/33 → +75 cada fila. aitrackerbot N=25. r/singularity N=6. KatilaMarriete: OpenRouter Ox ≡ OpenCode Zen, ambos +75 vs GLM.
Trampa. Mismo tokenizer ≠ mismos pesos. Alguien pudo fine-tunear GLM. Pero Kimi/Qwen/MiMo/MiniMax divergen. No se copia un diccionario por accidente.
Recorte Ox. LA prueba estrella. Resta prompt_tokens. Si Δ es constante, es el mismo cuchillo. Un universitario puede repetirla hoy.
Error 1210 / 1214 · el sello de la fábrica
En claro. Cuando la API falla, el servidor suelta un código interno. 1210/1214 ya se habían visto en chat.z.ai. Es el idioma del taller, no del pasillo OpenRouter.
Analogía. Cajero «error 12-B»: solo el banco de la esquina usa ese código. Ya sabes de quién es el cajero aunque no tenga logo.
Ejemplo. RocketmanSh: max_tokens ilegal → 1210. Pritish: 1210/1214 = chat.z.ai. Josh rad: logs en chino + cadenas GLM de ModelScope.
Trampa. Un wrapper limpio podría traducir errores. Que SIGAN saliendo 1210 es descuido de proxy o servicio directo de z.ai. Occam: z.ai.
Recorte Ox. Mata Anomaly-self-host, Cursor-clean-ID, ByteDance-Volcano, MiniMax, Hy4. El ticket es de z.ai.
R
SKU · el piso, no el barrio
En claro. SKU = la variante concreta del producto (5.3 vs 5.3V vs Flash vs Air). El barrio puede ser Z.ai y el piso seguir sin letrero. Manifold apuesta al lab, no al SKU.
Analogía. Mismo edificio, distintas plantas. Sabes el barrio. No tienes el número del piso.
Ejemplo. 5.3 público = solo texto, 128K out. Ox ve video y saca 131.072. Así que no es el de folleto. Flash/~300B es rumor. 5.3V encaja con el encoder. Air es apodo de foro.
Trampa. MaxForAI a veces escribe Flash como si fuera ficha. No lo es. No conviertas un apellido ruidoso en segunda identidad.
Recorte Ox. Tesis líder: variante multimodal no publicada de GLM-5.x. SKU exacto espera comunicado o corrida live.
Distancia L1 / tokenizer fingerprint · el vector de rarezas
En claro. Se manda el mismo juego de textos raros (emoji, CJK, código, vacío) a dos APIs y se restan las cuentas. L1 = suma de |diferencias|. 0 = mismo cuchillo. 150–300 = cuchillo al azar.
Analogía. Dos llaves: si abren las mismas 6 cerraduras en el mismo orden, son copias. Si una falla en emoji por 33 tokens, no es la copia.
Ejemplo. Tony Zhou: vector Ox [76, 384, 114, 64, 49, 313] idéntico a z-ai/glm-5.3 (L1=0). MiMo 176. MiniMax 172. unclecode modelprint: GLM 4/4; Kimi 0/4; MiniMax 0/4; Qwen 1/4; MiMo ≤2/4 (emoji 90 vs 57).
Trampa. L1=0 prueba vocabulario/plantilla, no pesos. Sigue siendo la muerte de MiMo-V3, MiniMax, Hy4, Grok, Seed-as-weights y Composer-from-scratch.
Recorte Ox. Junto con +75 y peaje 296, es el trípode que mata rivales. No es un DNI firmado por Z.ai.
100T / capacidad · la fábrica, no el medidor
En claro. OpenCode dijo «capacidad para 100T tokens/día». Eso es un techo de fábrica, no un contador. Lo observado en OpenRouter el 21 ago fue ~1.7–3.9T. Dos órdenes de magnitud por debajo.
Analogía. Una fábrica dice «podemos hacer 100 millones de zapatillas al día». El sábado vendieron 2 millones. Las dos cifras pueden ser ciertas.
Ejemplo. Dan (@DanDr1s): ~3.85T en un día (OpenRouter+OpenCode) como argumento ByteDance (Doubao 120T+/día). Z.ai tiene data center 1 GW (Tom's Hardware / Bloomberg 21 jul 2026). Pony Alpha ya regaló compute.
Trampa. 100T no identifica el lab: Xiaomi, Tencent, ByteDance y Z.ai pueden soñar esa factura. Las huellas (tokenizer, 1210, encoder) sí eligen el barrio.
Recorte Ox. Mata «no tienen cómputo» y «es un wrapper de salón». No mata GLM vs ByteDance-as-CDN. El CDN aún resuelve Z.ai en Manifold si Z.ai es quien lo reclama.
S
Atención (self-attention) · quién mira a quién en la frase
En claro. Antes de adivinar la siguiente pieza, el modelo mira TODAS las piezas anteriores y decide cuáles importan ahora. «El banco del parque» vs «el banco que da préstamos»: atención elige el sentido.
Analogía. En un grupo de WhatsApp de 40, no lees los 40 mensajes con la misma intensidad. Atención es el resalte: quién dijo qué, hace cuánto, y si importa para tu respuesta.
Ejemplo. Frase de 8 tokens. Atención es una tabla 8×8 de «cuánto mira i a j». Eso crece al CUADRADO con el contexto: por eso 1 millón de tokens es caro, no solo «más memoria».
Trampa. «Tiene 1M de contexto» no significa que atienda igual al token 1 y al 900.000. Hay olvido, hay pérdida en el medio (lost in the middle). El número es el techo del recuadro, no la calidad de la mirada.
Recorte Ox. Ox Alpha publica 1.048.576. Eso es un recuadro enorme. No prueba identidad. Prueba que el lab se atrevió a pagar atención cuadrática (o un truco que la finge) a escala de fábrica.
Transformer · el plano del edificio
En claro. La arquitectura de 2017 que casi todos los LLM usan: bloques de atención + capas que mezclan números, apilados decenas o cientos de veces. No es una marca. Es el plano.
Analogía. Si un LLM es un edificio, el transformer es el plano: mismas plantas, distinta altura, distinto lujo. GPT, Claude, GLM, Gemma: casi todos copian ese plano y cambian los acabados.
Ejemplo. Paper «Attention Is All You Need» (2017). Desde entonces, la pelea no es «¿transformer o no?», es cuántas capas, qué MoE, qué tokenizer, qué datos.
Trampa. Decir «es un transformer» no identifica el lab. Es como decir «es un coche de cuatro ruedas». Las huellas de Ox están en el cuchillo y el peaje, no en el plano genérico.
Recorte Ox. Ox, GLM-5.3, MiMo, MiniMax: todos transformers. Por eso el plano no mata rivales. El diccionario y el encoder de video sí.
Siguiente token / logits · la apuesta de la siguiente pieza
En claro. El modelo no «piensa una frase». Apuesta, pieza a pieza, cuál es el siguiente ID. Logits = puntuaciones crudas de cada pieza posible. Softmax las convierte en porcentajes. Temperatura las aplasta o las estira.
Analogía. Una urna con millones de papeletas. Logits = cuántas papeletas tiene cada palabra. Softmax = porcentajes. Temperatura 0 = siempre gana el que más papeletas tiene. Temperatura alta = a veces sale el raro.
Ejemplo. Tras «El cielo es», «azul» puede tener logit 12.4 y «verde» 7.1. A temp 0 siempre sale azul. A temp 1.2 a veces sale verde. Por eso las huellas de estilo se miden a temp 0: misma urna, misma papeleta ganadora.
Trampa. «Creatividad» no es magia: es temperatura + muestreo. Un modelo no se vuelve más listo a temp 1.5; se vuelve más borracho. Temp 0 tampoco garantiza verdad, solo consistencia.
Recorte Ox. Los testers comparan Ox y GLM-5.3 a temperatura 0. Si las respuestas se parecen (y el cuchillo coincide), es evidencia de familia. No es un DNI: un fine-tune también puede copiar el primer token.
T
BPE / SentencePiece · cómo se decide el cuchillo
En claro. Byte Pair Encoding: el lab mira un montón de texto y fusiona las parejas de bytes más frecuentes hasta tener un diccionario (vocabulario) de ~100k piezas. SentencePiece es una receta parecida, típica en labs chinos.
Analogía. Un carnicero que, tras cortar mil reses, deja de cortar «chuleta» en «chu-le-ta» y guarda un molde «chuleta». El molde es el vocabulario. Dos carnicerías con el mismo molde cortan igual.
Ejemplo. Si GLM y Ox cuentan 8 tokens para «Hello, how are you today?» y Kimi cuenta 9, no es que Kimi sea más listo: su molde partió distinto. El +75 de Ox es el molde GLM más un membrete fijo.
Trampa. Mismo BPE ≠ mismos pesos. Puedes heredar el cuchillo y pintar el motor. Por eso el tokenizer mata rivales de vocabulario (MiMo, MiniMax, Hy4) y no cierra el SKU (5.3 vs 5.3V vs Flash).
Recorte Ox. L1=0 de Zhou dice: mismo molde, mismas rarezas. El membrete +75 es un texto extra, no otro diccionario. Esa es la prueba dura del expediente.
Vocabulario (vocab size) · cuántos moldes tiene el cuchillo
En claro. El número de piezas distintas que el cuchillo sabe cortar. 32k, 100k, 150k… Cada ID es un cajón. Si dos modelos tienen el mismo recuento en textos raros (emoji, CJK, vacío), casi seguro comparten cajonera.
Analogía. Una caja de Lego. 100.000 formas distintas. Si tu amigo construye el mismo perro con las mismas 47 piezas, está usando tu caja, no la de otro fabricante.
Ejemplo. Vector de Zhou [76, 384, 114, 64, 49, 313] idéntico Ox vs GLM-5.3. Eso no es «parecido»: es la misma caja. MiMo 176 de distancia: otra caja.
Trampa. Un vocabulario grande no hace al modelo más culto. Hace el corte más eficiente en algunos idiomas. Lo que identifica es la coincidencia, no el tamaño.
Recorte Ox. Nadie publicó el vocab size de Ox. No hace falta: el vector L1=0 ya dice «misma caja que GLM-5.3».
Chat template · el protocolo de la carta
En claro. Cómo se empaquetan system / user / assistant antes de tokenizar: tokens especiales, roles, fin de turno. Si el template cambia, el recuento cambia. El +75 de Ox es, en la tesis, un system prompt de ~75 tokens encima del template GLM.
Analogía. Un sobre con membrete, sello y «Atentamente». El cuerpo de la carta puede ser tuyo; las 75 palabras de protocolo son del hotel. Si siempre suman 75, el sobre es el mismo.
Ejemplo. KatilaMarriete: OpenRouter y OpenCode Zen dan el mismo +75. Mismo sobre en dos centros comerciales. No es un bug de un pasillo.
Trampa. Si un tester no usa el mismo template (olvida el system, cambia roles), el Δ deja de ser 75 y cree que el cuchillo cambió. La constante solo aparece cuando el experimento es limpio.
Recorte Ox. El +75 no es «Ox es más verboso». Es membrete + template. Por eso hay que restar, no mirar el número absoluto.
U
Latencia P50 / P99 · cuánto tarda en hablar
En claro. P50 = la mediana: la mitad de las peticiones tardan menos, la mitad más. P99 = el 1% peor. OpenRouter publica snapshots (Ox ~3.88s / 26 tok/s un día). Se mueven. No son un DNI.
Analogía. El tiempo de espera en urgencias. La mediana no es el récord ni el infierno de las 4 a.m. Un snapshot de un sábado no es el hospital entero.
Ejemplo. Un tester midió Ox más lento que GLM-5.3 en coding (18.3s vs 6.7s). Eso puede ser cola, thinking tokens, o un SKU distinto. No mata la tesis GLM: un hermano Flash/V puede pensar más.
Trampa. Más lento ≠ más tonto. Un modelo que «piensa» (reasoning) gasta tokens invisibles antes de hablar. Comparar P50 de un stealth gratis (cola) con un API de pago (carril) es trampa.
Recorte Ox. La ficha muestra P50. Lo usamos como dato oficial, no como huella. Identidad se juega en tokenizer y encoder, no en el semáforo del sábado.
Tokens por segundo · qué tan rápido escribe
En claro. Throughput: piezas emitidas por segundo una vez que empezó a hablar. Distinto de latencia (cuánto tarda el primer token). Un modelo «pensante» puede tardar 4s en el primer token y luego vomitar a 80 tok/s.
Analogía. Un camarero que piensa el pedido 20 segundos y luego llega con toda la bandeja. La espera y la velocidad de servir son dos números.
Ejemplo. Snapshot OpenRouter: ~26 tok/s. Testers en coding hablaron de 49–78 tok/s según cola. Los dos pueden ser ciertos: distinta hora, distinto carril.
Trampa. tok/s no identifica el lab. Un CDN de ByteDance sirviendo GLM puede ir más rápido que el API público de z.ai. Velocidad ≠ autor.
Recorte Ox. Sirve para el relato de fábrica (alguien tiene flota) y para no confundir lentitud de thinking con «modelo pequeño». No entra en la rúbrica de identidad.
V
Proveedor vs lab vs router · quién cocina, quién sirve, quién cobra la mesa
En claro. Lab = quien entrenó los pesos (Z.ai, Xiaomi…). Proveedor = quien sirve la API hoy (puede ser el lab o un CDN). Router = OpenRouter / OpenCode Zen: el centro comercial. OpenRouter lo dice: «no somos el dueño».
Analogía. El chef, el camarero, el centro comercial. Si el ticket de error es del restaurante chino del patio, el centro comercial no cocinó el plato. ByteDance-as-CDN sería un camarero gigante, no el chef.
Ejemplo. stealth/ox-alpha = pasillo OpenRouter. x-preview-f-free = pasillo OpenCode Zen. 1210 = sello de caja z.ai. Tres capas. La identidad vive en la caja, no en el pasillo.
Trampa. «OpenRouter lanzó Ox» es titular perezoso. OpenRouter enruta. OpenCode alardea capacidad. El lab se esconde. Culpar al mall por el DNI es el error #1 del foro.
Recorte Ox. Tesis líder: lab Z.ai, proveedor probablemente el mismo stack (error 1210, logs ModelScope). CDN ByteDance: vivo como camarero, no como chef. Anomaly/OpenCode: altavoz.
Herramientas / function calling · el modelo que pide un destornillador
En claro. El LLM no ejecuta código ni busca en la web solo. Pide un JSON («abre este archivo», «corre este test»). El AGENTE (OpenCode, Claude Code, Cursor) ejecuta y le devuelve el resultado. Luego el modelo pide otra herramienta. Eso es el bucle.
Analogía. Un cirujano que no toca el bisturí: dice «incisión aquí». La enfermera corta. El cirujano mira la foto y pide otra cosa. El cerebro es el modelo; las manos son el agente.
Ejemplo. OpenRouter lo vende para «sustained agentic work». DeepSWE mide eso: no un chat, un repo que hay que arreglar con herramientas durante muchos pasos (~117 vs GLM-5.3 ~124 en un reporte).
Trampa. Si el agente es tonto (mal parser, mal sandbox), el modelo parece tonto. Culpar a Ox por un fallo de OpenCode es culpar al cirujano por la enfermera. Y al revés.
Recorte Ox. La ficha promete agentes largos, no un chatbot. Por eso el stealth se prueba en coding loops, no en «escribe un poema». Los benches de 10 tareas no sustituyen DeepSWE de 113.
Tokens de pensamiento · el borrador privado
En claro. Antes de responderte, un modelo «reasoning» escribe un borrador que a veces no ves. Cuesta tokens. GLM-5.3 no deja apagarlo: low / high / max, nunca off. Ox hereda esa palanca.
Analogía. Un examen donde te obligan a hacer el sucio en la hoja de detrás. Puedes pedir sucio corto, medio o largo. No puedes entregar en blanco el sucio.
Ejemplo. Isenberg: OpenCode Zen x-preview-f-free expone thinking low/high/max. Misma palanca que GLM-5.3. Si pudieras poner off y el modelo siguiera igual de listo, no sería este contrato.
Trampa. El borrador no es «conciencia». Es más tokens de predicción, a veces con un reward distinto. Tampoco es gratis: pagas latencia. Un P50 alto puede ser thinking, no cola.
Recorte Ox. La palanca low/high/max es una huella de contrato GLM-5.3, más blanda que el +75 pero más dura que el vibe. Suma. No basta sola.
W
RAG (recuperar y generar) · pegarle un archivador al loro
En claro. El modelo no busca solo. Un sistema le pega trozos de documentos relevantes en el recuadro y le dice «responde con esto». Eso es Retrieval-Augmented Generation. No es magia ni es el stealth.
Analogía. Un estudiante que no se acuerda de la ley. Le pones el artículo encima de la mesa y redacta. El cerebro es el mismo; el archivador es extra.
Ejemplo. Cursor / Claude Code pegan el archivo abierto en el prompt. Eso es RAG casero. No convierte a Ox en un buscador. Si el archivo no está, alucina.
Trampa. «Tiene internet» casi siempre es RAG o una herramienta, no el modelo. La ficha de Ox no promete búsqueda. No le preguntes el partido de ayer como a Google.
Recorte Ox. Este dossier no usa RAG contra Ox: no llamamos a la API. Te enseñamos el patrón. Si más tarde pegas un PDF a Ox, estás haciendo RAG tú, no «Ox sabe tu PDF».
RLHF / post-training · el adiestramiento después de leer internet
En claro. Pretrain = leer internet (base). Post-training = enseñarle a obedecer, a codear, a no insultar. RLHF = humanos (o un juez IA) puntúan respuestas y se giran perillas hacia lo que gusta. GLM-5.3 es post-training sobre el base 5.2: mismo edificio, nuevo adiestramiento.
Analogía. Un niño que leyó toda la biblioteca (pretrain) y luego hace prácticas en un hospital (post-training). El vocabulario ya estaba. El oficio, no.
Ejemplo. Z.ai: «GLM-5.3 uses the same base as 5.2 — every gain comes from post-training». Terminal-Bench 4.6% → 28.3% sin cambiar el cuchillo. Por eso un stealth 6 días después puede ser otro post-train, no otro edificio.
Trampa. Post-training cambia benches y estilo; casi nunca el tokenizer ni el encoder de video. Si Ox comparte cuchillo y peaje, el post-train no es una coartada: es el mecanismo natural de un hermano.
Recorte Ox. Tesis líder: post-train multimodal (cámaras) sobre familia 5.x, no un from-scratch. Composer-from-scratch queda herido porque heredaría demasiado taller z.ai.
Destilación · el alumno que copia al profesor
En claro. Entrenar un modelo pequeño para imitar las respuestas (y a veces los logits) de uno grande. Sale más barato de servir. «Flash» / «Air» a menudo huelen a destilado o a MoE con menos expertos despiertos.
Analogía. Un residente que copia al jefe de servicio. No tiene 40 años de oficio; tiene los atajos. A veces acierta igual. A veces se salta un paso raro.
Ejemplo. Kingbench Ox 87.5 vs GLM-5.3 91.25: hermano, no gemelo. Encaja con destilado o con menos expertos. Flash/~300B es RUMOR, no ficha. No lo conviertas en segunda identidad.
Trampa. Un destilado suele HEREDAR tokenizer y a veces encoder. Por eso destilar no borra las huellas: las explica. «Es un destilado» y «es GLM» pueden ser la misma frase.
Recorte Ox. La tesis Flash/Air es destilación o MoE ligero para regalar 100T. Sigue siendo barrio Z.ai. El SKU exacto espera comunicado.
Cuantización · comprimir los números para que quepan
En claro. Los pesos son números con muchos decimales (fp16, bf16). Cuantizar = guardarlos más gordos y redondos (int8, int4) para que quepan en menos GPU. A veces el modelo se vuelve un poco más torpe. No cambia el cuchillo.
Analogía. Una foto RAW vs un JPEG. La cara sigue siendo la tuya. Ocupa menos. A 4-bit se ven artefactos. El DNI no cambia de nombre.
Ejemplo. Servir 40B activos en int4 cabe en menos chips que en bf16. Eso ayuda a regalar tokens un fin de semana. No explica el +75: el tokenizer vive antes de los pesos.
Trampa. «Va peor, luego no es GLM» es trampa: un GLM cuantizado o destilado va peor y sigue siendo GLM. Mide el cuchillo, no el JPEG.
Recorte Ox. Cuantización es hipótesis de SERVICIO (cómo regalan 100T), no de identidad. Encaja con Flash/Air. No mata ni salva a Z.ai.