Saltar al contenido
ChristopherOx Alpha
Índice
  1. Briefing
  2. Etapa Caso · 1/3

Caso

Todos los candidatos, uno a uno

GLM, Xiaomi, ByteDance, Cursor, Mira, Occidente. Rúbrica del expediente, no un mercado.

  1. Vas a entender
  2. Un candidato a la vez, a favor y en contra.
  3. GLM lidera como hipótesis, no como sentencia.
  4. Una celda «mata» es un instrumento.

Lectura del score. 85 no es «es GLM». Es «si mañana Z.ai lo reclama, nadie se sorprende; si lo reclama Murati, hay que reescribir el expediente».

85% · lidera · Z.ai / Zhipu AI (China)

GLM-5.x multimodal

Ox Alpha es, con alta probabilidad, una variante no publicada de la familia GLM-5 (mismo tokenizer, mismos errores de API, mismo encoder de video, mismo estilo). El GLM-5.3 público es solo texto; Ox Alpha añade imagen y video.

A favor

  • Tokenizer: diferencia constante de +75 tokens vs GLM-5.3 en todos los textos (EN, DE, CN, código, emoji).
  • Códigos de error 1210 / 1214 idénticos a chat.z.ai.
  • Encoder de video con presupuestos de tokens iguales a GLM-5V-Turbo.
  • Caché de prefijos: un tester en pi.dev midió ~97%; el catálogo OpenRouter da ~87% Ox vs ~92% GLM-5.3. Firma de cocina, no DNI.
  • Jailbreaks que sueltan «I'm GLM, a large language model developed by Z.ai».
  • Playbook previo: Pony Alpha (feb 2026) → revelado como GLM-5 (744B MoE).
  • Z.ai acaba de levantar un data center de 1 GW y está estresando chips Huawei con límites enormes.
  • Kingbench 87.5% (2º) vs GLM-5.3 91.25% (1º): hermanos, no gemelos.
  • Mercado Manifold: ~85% Z.ai al 21 ago 2026. Pliny the Liberator: «Ox-alpha is from Zai, GLM-5.X family».
  • 21 ago: @JoshRadDev obtuvo logs de error en chino + cadenas GLM de ModelScope al pasar params inválidos.
  • Tony Zhou: vector tokenizer [76, 384, 114, 64, 49, 313] L1=0 vs GLM-5.3; MiMo 176; MiniMax 172.
  • Replicaciones independientes del +75: aitrackerbot N=25, RocketmanSh 88/106/97/108 vs 13/31/22/33, r/singularity N=6, BohuTANG N=4, KatilaMarriete N=7, Sevi N=6. unclecode 4/4, Sushaanth 11/11, Pritish 17.
  • Video 4 clips: Ox = GLM-5V-Turbo token a token (296/296/884/1064). MiMo 910/910/1364/1134. Qwen 408/408/1288/1156.

En contra

  • GLM-5.3 público es solo texto. Si es GLM, tiene que ser una variante V / Flash / Air no lanzada.
  • Compartir tokenizer no prueba que sean los mismos pesos: alguien pudo fine-tunear GLM.
  • Dylan Fetch: en OpenTTD-Bench 5.2 y 5.3 se parecen tanto que duda de un «GLM-5.4» y apunta a MiMo-V3.
  • 17% de timeouts en un tester; más lento que GLM-5.3 en coding (18.3s vs 6.7s).
  • Nadie de Z.ai lo ha confirmado. Flash/~300B es rumor, no ficha.
  • El SKU (5.3V vs Flash vs Air) sigue abierto. Manifold ‘who’ ~80% Z.ai; ‘name’ GLM-5.3V ~46%.
Analogía, ejemplo, trampa

Analogía. Es como encontrar una huella dactilar, el mismo zapato, la misma voz y el mismo código postal. No es una foto del DNI, pero el detective ya tiene un sospechoso claro.

8% · débil · Xiaomi (China)

MiMo-V3

Xiaomi ya usó el truco stealth: Hunter Alpha y Healer Alpha se revelaron como MiMo-V2-Pro y MiMo-V2-Omni. Ox Alpha encaja con su ficha: 1M de contexto, multimodal, agentes y coding.

A favor

  • Playbook idéntico: stealth gratis → tráfico real → revelación. Nostalgia, no instrumentos.
  • La promesa de 100T tokens/día suena a promoción MiMo anterior.
  • Algunos glitches de tokens «sucios» se parecen más a MiMo que a GLM, según un hilo de Reddit.
  • Dylan Fetch no ve salto 5.2→5.3 y sospecha un lab que aún no ha testeado: Xiaomi.

En contra

  • Tokenizer no coincide con MiMo en las pruebas de 6–25 prompts (diverge; GLM no).
  • Errores de API 1210/1214 son de z.ai, no de Xiaomi.
  • Pritish Yuvraj (ex-Llama/Meta): 17 prompts multilingües tokenizan como GLM, no como MiMo.
  • Manifold: ~6%.
  • Tokenizer L1=176 vs GLM=0 (Zhou). unclecode: mimo-v2.5 2/4, v2.5-pro 0/4; emoji 90 vs 57.
  • Video 2s/30fps/360p: Ox 296 vs MiMo v2.5 910. Audio: MiMo acepta; Ox rechaza como GLM-5V.
  • Pritish 17 prompts: «MiMo didn’t match». Hunter-Alpha-was-MiMo es anti-prior: ya quemaron ese animal.
Analogía, ejemplo, trampa

Analogía. El modus operandi encaja. El cuchillo, el peaje y el audio no.

5% · débil · Tencent (China)

Hy4

Apareció en un hilo de Reddit como candidato, sin pruebas técnicas independientes.

A favor

  • Tencent tiene cómputo y modelos de coding/agentes.
  • Un hilo dedicado en r/opencode lo nombró.
  • Gray-test de Hy4 en Yuanbao el mismo día (20 ago): coincidencia de calendario, no de instrumentos.

En contra

  • Cero fingerprints públicos que lo liguen.
  • No hay historial stealth reciente en OpenRouter comparable.
  • Hy3 contexto 262.144 vs Ox 1.048.576.
  • Hy4 gray-test en Yuanbao el MISMO día (20 ago) es coincidencia de calendario: Tencent lanzó Hy4 en otra puerta, no como animal stealth.
  • Tokenizer no es Hunyuan. L1 vs GLM=0 mata Hy4-as-weights.
Analogía, ejemplo, trampa

Analogía. Es el nombre que alguien gritó en una sala llena. Nadie más lo reconoció.

4% · débil · MiniMax (China)

MiniMax (sin anunciar)

El timing de un modelo no anunciado podría encajar. Circunstancial.

A favor

  • Lab chino con modelos frontier y multimodal.
  • La serie stealth ha sido 4/4 china.

En contra

  • Tokenizer MiniMax diverge en las pruebas públicas.
  • Sin errores de API ni encoder coincidentes.
  • Zhou L1=172 (cuchillo al azar). aitrackerbot: MiniMax M3 no matcheó. unclecode MiniMax-M3 tokenizer 0/4.
  • M3 ya navega con su nombre en OpenRouter. Un gemelo anónimo con vocab GLM no es su playbook.
Analogía, ejemplo, trampa

Analogía. Estaba en la ciudad el día del crimen. Eso no es una prueba.

12% · plausible · Tercero (Cursor, Anomaly, etc.)

Fine-tune de GLM

Alguien pudo tomar pesos GLM, post-entrenarlos y servirlos con otra marca. Cursor ya ha hecho algo parecido. Un empleado de Anomaly usaba un modelo interno de 1M de contexto.

A favor

  • Explica tokenizer GLM + comportamiento no idéntico a 5.3.
  • Kingbench: 87.5% vs 91.25% de GLM-5.3 — parecido, no clon.
  • Más lento que GLM-5.3 en coding: posible stack distinto.

En contra

  • Servir 100T tokens/día gratis exige un hyperscaler, no un fine-tuner pequeño.
  • Errores 1210 y caché 97% apuntan al stack de z.ai, no a un wrapper ajeno.
  • ZCode no está en el top público de OpenRouter (Hermes, Claude Code, pi). La pista de cocina es 1210 + encoder, no el ranking de apps.
  • ByteDance-as-CDN o Cursor-wrapping-GLM siguen resolviendo Z.ai en la pregunta Manifold ‘quién está detrás’, salvo que el wrapper ponga su logo al revelar.
Analogía, ejemplo, trampa

Analogía. Puedes pintar un Ferrari de otro color. El motor, el chasis y el número de serie siguen siendo Ferrari — y aquí el taller también parece el original.

9% · débil · Cursor / Anysphere

Composer 3 (Cursor)

El 21 de agosto @TimMacc dijo que lo único que encaja todas las pistas es Composer 3: GLM tuneado, mucho cómputo, timing correcto. Cursor anunció Composer 3 en junio 2026 como un modelo from-scratch de clase 1.5T. La tesis from-scratch muere con el vocab GLM; sobrevive solo un wrapper de GLM — y eso sigue chocando con 1210 y el encoder 5V.

A favor

  • Cursor ya sirve Composer, históricamente fine-tunes cercanos a GLM/Kimi.
  • Timing: un drop nuevo de Composer + una semana gratis en OpenRouter.
  • Explicaría «GLM por debajo» más RL extra de coding.

En contra

  • Composer 3 se vendió from-scratch 1.5T en Colossus. Un from-scratch no comparte vocab GLM ni encoder 5V-Turbo ni error 1210.
  • Logs en chino + cadenas GLM de ModelScope (Josh rad) no parecen el stack US de Cursor.
  • 1210/1214 y caché 97% son cocina z.ai, no Cursor.
  • Ningún empleado de Cursor ha reclamado Ox Alpha.
  • Grok 4.6 ya salió el 12 ago (500K ctx, 0 emoji/1k). Dos drops frontier anónimos del mismo clúster en 8 días, uno gratis en un IDE rival, es un estirón.
  • Product: SpaceX compró Anysphere. Regalar el flagship en OpenCode (competidor) con teatro ZDR es raro; el canal stealth es ritual chino.
Analogía, ejemplo, trampa

Analogía. Alguien dice que el coche tapado es un Tesla con motor Toyota. Puede ser. El peaje, el error del tablero y la radio siguen siendo Toyota.

6% · débil · Desconocido

Router de varios modelos

Un sistema que cambia de modelo según la tarea explicaría inconsistencias (a veces brillante, a veces timeout).

A favor

  • Tesers reportan comportamiento irregular entre tipos de tarea.
  • 17% de timeouts en un run.

En contra

  • Un router no produce un tokenizer constante +75 frente a UN modelo concreto.
  • El encoder de video fijo no encaja con un cóctel de backends.
Analogía, ejemplo, trampa

Analogía. Si mezclas tres cocineros, el menú cambia. Aquí la receta de tokens es siempre la misma.

2% · descartada · Mira Murati

Inkling (Thinking Machines)

Inkling salió el 15–16 jul 2026 como open-weights multimodal de Thinking Machines Lab. No es stealth, ya tiene nombre, paper y pesos. No es Ox Alpha.

A favor

  • Mira lidera un lab frontier. Inkling es fuerte en agentes y 1M de contexto.

En contra

  • Inkling es PÚBLICO (open-weights). Ox Alpha es anónimo a propósito.
  • Inkling: texto+imagen+audio. Ox Alpha: texto+imagen+video, sin audio (rechaza audio igual que GLM).
  • Arquitectura distinta: Inkling ~975B/41B activos vs GLM-5 ~744B/40B.
  • Tokenizer no es GLM. Nadie serio en X lo liga a Murati.
  • Fechas: Inkling julio; Ox Alpha 20 agosto, canal stealth de OpenRouter usado por labs chinos.
  • El 21 ago Thinking Machines tuiteó Inkling GRATIS en OpenRouter CON NOMBRE. Co-listado. Audio-nativo vs video-nativo. Políticas de datos opuestas (Inkling entrena con traces; ficha Ox dice no).
Analogía, ejemplo, trampa

Analogía. Confundir a Inkling con Ox Alpha es como ver un Ferrari rojo en el concesionario y pensar que el auto tapado del parking es el mismo. Uno ya tiene matrícula.

2% · descartada · Labs occidentales

OpenAI / Anthropic / Grok / Gemini

Algunos lo dijeron en broma («es Gemini 3.5»). Los tokenizers occidentales no coinciden.

A favor

  • Capacidad de 100T/día suena a hyperscaler (Google, Microsoft, xAI).

En contra

  • Tokenizer GPT / Claude / Grok / Gemini divergen fuerte.
  • Mensajes de backend en chino.
  • 4 de 4 stealth previos en este canal fueron labs chinos.
  • OpenRouter lista a xAI aparte (Grok 4.6). No hay motivo para esconderlo como Ox.
  • Grok 4.6 = 500K ctx vs Ox 1.048.576. Estilo Grok ~0 emoji/1k; Ox ~1.3 (casa GLM/Qwen).
  • Canario PRC: algunos testers vieron negativa Tiananmen / Tibet «parte inalienable»; eso es filtro de host PRC, no firma Grok.
Analogía, ejemplo, trampa

Analogía. El acento, el diccionario y la oficina no coinciden. Caso cerrado para Occidente.

6% · débil · ByteDance (China)

ByteDance Seed / Doubao

Dan (@DanDr1s) argumentó capacidad: Ox sirvió ~3.85T en un día (OR+OpenCode). Doubao reclama 120T+/día y ~46% del tráfico cloud AI chino. Video+coding es producto Seed. Huésped US evitaría el boycott. Escape: ByteDance sirviendo un GLM mejorado.

A favor

  • Mejor argumento ECONÓMICO de cualquier rival: 100T/día es redondeo para Volcano, un moonshot para un lab mediano.
  • Seed-2.0 multimodal + Seedance video + Seed-2.0-Code encajan el I/O de Ox (video nativo, agentes).
  • «No es quien piensas»: GLM es el favorito; ByteDance casi no estaba en el mercado.

En contra

  • Tokenizer L1=0 vs GLM-5.3, encoder = GLM-5V-Turbo, error 1210 es código z.ai — no Volcano.
  • Seed-2.0-Code ya tiene SKU público bytedance-seed/* en OpenRouter (problema Inkling: co-listado).
  • Si ByteDance solo alquila GPUs, Manifold «quién está detrás» sigue siendo Z.ai. Si fine-tuneó GLM y lo sirve por stack z.ai, es conspiración sin evidencia.
  • Estilo + DeepSWE steps (~117 vs GLM 124) rastrean GLM, no Doubao consumer.
Analogía, ejemplo, trampa

Analogía. El mejor argumento de factura. El peor de instrumentos. El casero de la GPU no firma el DNI del inquilino.

4% · débil · Anomaly / OpenCode

Anomaly (OpenCode) in-house

OpenCode anunció Ox en primera persona («We have capacity for 100T/day»). Un empleado usaba un modelo interno de 1M. Teoría: fine-tune de GLM con traces de agentes free.

A favor

  • Son el canal. Zen + OpenCode Go. Tráfico real (Ox #4, ~3.6–3.9T, ~79k users en un día).
  • Fine-tune-on-harvested-traces es una historia de lab pequeño coherente tras cuatro drops chinos gratis.

En contra

  • No poseen 100T/día. OpenCode es cliente. Zen es router. 40B-active MoE a 49–78 tok/s es clase hyperscaler. r/opencode: Z.ai levantó el centro 1 GW el mes pasado.
  • Error 1210 / invalid zstd / chat.z.ai 1210/1214 son códigos z.ai, no Anomaly. Un self-host no filtra eso.
  • Tokenizer + encoder = stack GLM sirviendo, no un checkpoint Anomaly con andamio nuevo.
  • ZDR de OpenCode choca con los términos stealth de OpenRouter (el proveedor retiene prompts). Desajuste de reseller, no de first-party.
Analogía, ejemplo, trampa

Analogía. Anomaly es el altavoz. Z.ai es el cantante. El «we» de 100T es lenguaje de mayorista, igual que en los cuatro stealth anteriores.

Matriz de corte

Instrumentos, no vibes. Una celda «mata» no es odio: es una prueba que ese sospechoso no explica.

PruebaGLMMiMoMiniMaxHy4ComposerInklingOccidenteSeed
Tokenizer +75 / L1
L1=0 vs GLM-5.3. MiMo 176, MiniMax 172, resto 148–302. From-scratch no hereda el cuchillo.
Peaje 296
Ox = GLM-5V-Turbo token a token. MiMo 910, Qwen 408. fps-invarianza es común; el presupuesto no.
Audio
Ox rechaza. MiMo v2.5 acepta. Inkling es audio-nativo. Más blando que 296 (pocos dumps crudos).
1210 + Java PaaS
1210 bilingüe screenshot en Ox. com.wd.paas es Zhipu. 1214-en-Ox es claim (Pritish), no foto.
Playbook stealth
4/4 animales 2026 = labs chinos. Xiaomi ya quemó Hunter. Cursor from-scratch no usa este canal para un flagship.
Fábrica 100T
Capacidad, no medidor. ByteDance ya clama 120T/día — mejor camarero. No firma el DNI del chef.

Elige una celda para leer el instrumento.