- Briefing
- Etapa Prueba · 1/3
Prueba
Las huellas que deja un modelo
Nueve pruebas. Las más duras: +75, L1=0 y tokens de video idénticos a GLM-5V-Turbo.
- Vas a entender
- Ver las nueve pruebas una a una.
- Entender por qué +75 es duro.
- No confundir huella con DNI.
A · tokenizer
Prueba del tokenizer (huella del diccionario)
Ox Alpha = GLM-5.3 + 75 en TODOS los textos
Si dos modelos cortan el mismo texto en el mismo número de piezas, usan el mismo diccionario. Un +75 fijo es el «sobre» (system prompt) que OpenRouter añade. Si el diccionario fuera otro, el extra NO sería constante.
Δ(P) = tok_ox(P) − tok_glm(P) = 75 ∀ P ∈ {EN, DE, CN, código, emoji}Versión 15 años. Imagina que dos personas recortan un periódico con las mismas tijeras. Siempre les salen 75 recortes de más a una de ellas, porque esa pone un membrete. Las tijeras son las mismas.
A · l1
Prueba L1 del vector tokenizer
L1=0 vs GLM-5.3; MiMo 176; MiniMax 172
Un vector de conteos sobre las mismas sondas es la firma del diccionario, no del system prompt. L1=0 significa que Ox y GLM-5.3 cortan esas sondas idéntico. MiMo a 176 y MiniMax a 172 no es ruido: es otro cuchillo. Tony Zhou: [76, 384, 114, 64, 49, 313].
L1(v_ox, v_glm) = Σ |v_ox,i − v_glm,i| = 0 · v = [76, 384, 114, 64, 49, 313] · L1(ox, MiMo)=176 · L1(ox, MiniMax)=172
Versión 15 años. Es como comparar las muescas de dos llaves. Ox y GLM entran en la misma cerradura (cero diferencia). MiMo y MiniMax tienen 176 y 172 muescas distintas: otras llaves.
A− · error
Prueba de códigos de error
Errores 1210 y 1214 iguales a chat.z.ai
Cuando una API falla, el servidor suelta un número interno. Ese número es como el sello de la fábrica. 1210 ya se había visto en Z.ai.
P(código 1210 | backend z.ai) ≫ P(código 1210 | backend ajeno)
Versión 15 años. Si el cajero automático te dice «error 12-B» y solo el banco de la esquina usa ese código, ya sabes de quién es el cajero aunque no tenga logo.
A− · video
Prueba del encoder de video
Presupuesto de tokens por frame = GLM-5V-Turbo
Meter un video en un modelo de texto es convertir fotogramas en tokens. Cada lab elige cuántos tokens «cuesta» un segundo de video. Ox Alpha cobra igual que GLM-5V-Turbo.
tokens_video(T, fps) ≈ k_GLM5V · frames(T, fps)
Versión 15 años. Es como el peaje: si cada auto paga exactamente 8 fichas y solo un peaje cobra 8, no es la autopista de al lado (que cobra 5 o 12).
B · cache
Prueba de caché de prefijos
Un tester (pi.dev) midió ~97%; OpenRouter lista ~87% Ox vs ~92% GLM-5.3
Si repites el repo, el servidor reusa cómputo. 97% en una sesión de agente es una firma de cocina, no de marketing. El catálogo OpenRouter da 87%: útil, no único. No lo trates como DNI.
hit_rate(sesión pi.dev)≈0.97 · hit_rate(catálogo OR)≈0.87 ≠ prueba de identidad sola
Versión 15 años. En tu bar de siempre te recuerdan el pedido (97%). En el ranking de TripAdvisor sale 87%. Las dos cifras pueden ser ciertas.
B · jailbreak
Prueba de fuga de identidad
«I'm GLM, a large language model developed by Z.ai»
Los modelos tienen un sistema prompt que dice quiénes son. A veces un jailbreak lo hace vomitar. Es evidencia de comportamiento, más fácil de falsificar que un tokenizer.
evidencia blanda: P(fuga GLM | es GLM) alta, pero P(fuga | wrapper) también > 0
Versión 15 años. Si le quitas la máscara a alguien en carnaval y grita su nombre real, es un pista. Pero también podría estar actuando.
B · audio
Prueba de rechazo de audio
Acepta imagen y video; rechaza audio — igual que GLM visión
Inkling (Mira Murati) acepta audio. MiMo-Omni también. GLM visión clásico no. Ox Alpha se alinea con GLM, no con Inkling.
modalidad(Ox) = {text, image, video} = modalidad(GLM-V) ≠ {text, image, audio}Versión 15 años. No come cacahuetes. El otro primo sí. No es ese primo.
B− · dirty
Prueba del token sucio
Tropieza en el mismo token raro que GLM / Qwen / MiMo
Algunos tokenizers chinos comparten rarezas. Confirma «lab chino», no cuál.
pertenencia a familia tokenizer CJK, no identificador único
Versión 15 años. El acento dice «es de este país». No dice la ciudad.
A− · logs
Prueba de logs en chino / ModelScope
Params inválidos → logs chinos + cadenas GLM de ModelScope
El 21 ago @JoshRadDev mandó parámetros mal y recibió logs de backend en chino más strings que coinciden con otros errores GLM en ModelScope. Difícil de fingir desde un stack US.
P(log CJK + ModelScope GLM | backend z.ai) ≫ P(mismo log | Cursor/OpenAI)
Versión 15 años. El mecánico se le cayó un manual en chino. El taller no está en California.
Laboratorio: corta el texto
Esto no es el vocabulario real de GLM. Es un simulador: dos cuchillos, dos cuentas. En la prueba real, Ox y GLM-5.3 coinciden; Kimi/MiMo/Qwen no.
Por qué
Estilo compacto (familia CJK/GLM, ilustrativo) · 11 piezas
Estilo occidental más partido (ilustrativo) · 14 piezas
Si Ox Alpha usa el cuchillo GLM, su cuenta es 86 = 11 piezas + 75 del membrete. El cuchillo occidental da 14.
Tabla reconstruida · test +75
Patrón publicado (dax / r/singularity / MaxForAI / Davis): cada texto mide exactamente 75 tokens más en Ox que en GLM-5.3.
| Prompt | GLM | Ox | Δ | MiMo | Kimi |
|---|---|---|---|---|---|
| EN Hello, how are you today? | 8 | 83 | 75 | 10 | 9 |
| DE Guten Morgen, wie geht es di | 11 | 86 | 75 | 13 | 14 |
| CN 你好,今天过得怎么样? | 9 | 84 | 75 | 11 | 8 |
| code def fib(n): return n if n<2 | 24 | 99 | 75 | 26 | 28 |
| emoji 🚀🔥💡✨🎯 | 10 | 85 | 75 | 14 | 15 |
| EN The quick brown fox jumps ov | 12 | 87 | 75 | 14 | 13 |
Números ilustrativos del patrón público, no una corrida propia. La constante es el hallazgo.
Corridas publicadas
| Tester | N | Δ | Nota |
|---|---|---|---|
| r/singularity | 6 | 75 | EN/DE/CN/código/emoji. Kimi/Qwen/MiMo/MiniMax divergen. Ambas rutas Ox idénticas. |
| @aitrackerbot | 25 | 75 | Primera tabla pública. MiniMax M3 no matcheó. |
| @RocketmanSh | 4 | 75 | Pares crudos 88/106/97/108 vs 13/31/22/33. También error 1210/1214. |
| @unclecode / modelprint | 4 | same-vocab | GLM tokenizer 4/4. Kimi 0/4, MiniMax 0/4, Qwen 1/4, MiMo ≤2/4 (emoji 90 vs 57). |
| @pritish_yuvi | 17 | same-vocab | Multilingüe/código/emoji exactamente como GLM-5. «MiMo didn’t match.» |
| @BohuTANG | 4 | 75 | EN/CN/código/random. «MiMo 完全不同». |
| @KatilaMarriete | 7 | 75 | OpenRouter Ox ≡ OpenCode Zen; ambos +75 vs GLM-5.3. El 75 es wrapper de ruta. |
| @evverin | 6 | 75 | Seis tests multilingual. Offset exacto 75. |
| @sushsrinivasan | 11 | same-vocab | Ox = GLM 11/11. Ningún otro lab pasa de 4/11. DeepSeek dígitos 98 vs GLM 29. |
| @filicroval | 12 | same-vocab | Mismos números. Tokenizer compartido. |
| @TonyJZhou | 6 | same-vocab | Vector [76, 384, 114, 64, 49, 313] = glm-5.3. L1=0. MiMo 176. MiniMax 172. |
| @MaxForAI | 25 | 75 | Recap chino del test de aitrackerbot. No es una cuenta original. |
| @thdxr (dax) | 0 | 75 | Sin tabla. No independiente. Officechai le atribuyó por error el N=25. |
Pares crudos de RocketmanSh: siempre 75 de más. Independiente = tabla original, no recap.
- 88 − 13 = 75
- 106 − 31 = 75
- 97 − 22 = 75
- 108 − 33 = 75