Saltar al contenido
ChristopherOx Alpha
Índice
  1. Briefing
  2. Etapa Prueba · 1/3

Prueba

Las huellas que deja un modelo

Nueve pruebas. Las más duras: +75, L1=0 y tokens de video idénticos a GLM-5V-Turbo.

  1. Vas a entender
  2. Ver las nueve pruebas una a una.
  3. Entender por qué +75 es duro.
  4. No confundir huella con DNI.

A · tokenizer

Prueba del tokenizer (huella del diccionario)

Ox Alpha = GLM-5.3 + 75 en TODOS los textos

Si dos modelos cortan el mismo texto en el mismo número de piezas, usan el mismo diccionario. Un +75 fijo es el «sobre» (system prompt) que OpenRouter añade. Si el diccionario fuera otro, el extra NO sería constante.

Δ(P) = tok_ox(P) − tok_glm(P) = 75  ∀ P ∈ {EN, DE, CN, código, emoji}

Versión 15 años. Imagina que dos personas recortan un periódico con las mismas tijeras. Siempre les salen 75 recortes de más a una de ellas, porque esa pone un membrete. Las tijeras son las mismas.

A · l1

Prueba L1 del vector tokenizer

L1=0 vs GLM-5.3; MiMo 176; MiniMax 172

Un vector de conteos sobre las mismas sondas es la firma del diccionario, no del system prompt. L1=0 significa que Ox y GLM-5.3 cortan esas sondas idéntico. MiMo a 176 y MiniMax a 172 no es ruido: es otro cuchillo. Tony Zhou: [76, 384, 114, 64, 49, 313].

L1(v_ox, v_glm) = Σ |v_ox,i − v_glm,i| = 0 · v = [76, 384, 114, 64, 49, 313] · L1(ox, MiMo)=176 · L1(ox, MiniMax)=172

Versión 15 años. Es como comparar las muescas de dos llaves. Ox y GLM entran en la misma cerradura (cero diferencia). MiMo y MiniMax tienen 176 y 172 muescas distintas: otras llaves.

A− · error

Prueba de códigos de error

Errores 1210 y 1214 iguales a chat.z.ai

Cuando una API falla, el servidor suelta un número interno. Ese número es como el sello de la fábrica. 1210 ya se había visto en Z.ai.

P(código 1210 | backend z.ai) ≫ P(código 1210 | backend ajeno)

Versión 15 años. Si el cajero automático te dice «error 12-B» y solo el banco de la esquina usa ese código, ya sabes de quién es el cajero aunque no tenga logo.

A− · video

Prueba del encoder de video

Presupuesto de tokens por frame = GLM-5V-Turbo

Meter un video en un modelo de texto es convertir fotogramas en tokens. Cada lab elige cuántos tokens «cuesta» un segundo de video. Ox Alpha cobra igual que GLM-5V-Turbo.

tokens_video(T, fps) ≈ k_GLM5V · frames(T, fps)

Versión 15 años. Es como el peaje: si cada auto paga exactamente 8 fichas y solo un peaje cobra 8, no es la autopista de al lado (que cobra 5 o 12).

B · cache

Prueba de caché de prefijos

Un tester (pi.dev) midió ~97%; OpenRouter lista ~87% Ox vs ~92% GLM-5.3

Si repites el repo, el servidor reusa cómputo. 97% en una sesión de agente es una firma de cocina, no de marketing. El catálogo OpenRouter da 87%: útil, no único. No lo trates como DNI.

hit_rate(sesión pi.dev)≈0.97 · hit_rate(catálogo OR)≈0.87  ≠  prueba de identidad sola

Versión 15 años. En tu bar de siempre te recuerdan el pedido (97%). En el ranking de TripAdvisor sale 87%. Las dos cifras pueden ser ciertas.

B · jailbreak

Prueba de fuga de identidad

«I'm GLM, a large language model developed by Z.ai»

Los modelos tienen un sistema prompt que dice quiénes son. A veces un jailbreak lo hace vomitar. Es evidencia de comportamiento, más fácil de falsificar que un tokenizer.

evidencia blanda: P(fuga GLM | es GLM) alta, pero P(fuga | wrapper) también > 0

Versión 15 años. Si le quitas la máscara a alguien en carnaval y grita su nombre real, es un pista. Pero también podría estar actuando.

B · audio

Prueba de rechazo de audio

Acepta imagen y video; rechaza audio — igual que GLM visión

Inkling (Mira Murati) acepta audio. MiMo-Omni también. GLM visión clásico no. Ox Alpha se alinea con GLM, no con Inkling.

modalidad(Ox) = {text, image, video} = modalidad(GLM-V) ≠ {text, image, audio}

Versión 15 años. No come cacahuetes. El otro primo sí. No es ese primo.

B− · dirty

Prueba del token sucio

Tropieza en el mismo token raro que GLM / Qwen / MiMo

Algunos tokenizers chinos comparten rarezas. Confirma «lab chino», no cuál.

pertenencia a familia tokenizer CJK, no identificador único

Versión 15 años. El acento dice «es de este país». No dice la ciudad.

A− · logs

Prueba de logs en chino / ModelScope

Params inválidos → logs chinos + cadenas GLM de ModelScope

El 21 ago @JoshRadDev mandó parámetros mal y recibió logs de backend en chino más strings que coinciden con otros errores GLM en ModelScope. Difícil de fingir desde un stack US.

P(log CJK + ModelScope GLM | backend z.ai) ≫ P(mismo log | Cursor/OpenAI)

Versión 15 años. El mecánico se le cayó un manual en chino. El taller no está en California.

Laboratorio: corta el texto

Esto no es el vocabulario real de GLM. Es un simulador: dos cuchillos, dos cuentas. En la prueba real, Ox y GLM-5.3 coinciden; Kimi/MiMo/Qwen no.

Antes de tocar

Si el cuchillo fuera el mismo y hubiera un membrete, ¿Δ qué hace?

Elige una. Luego mueve el control y compara.

Por qué

Fija. Un wrapper suma un extra constante. Si Δ baila, el cuchillo no es el mismo.
Simulador de dos cuchillos sobre el mismo texto. La prueba real es la constante +75, no este vocabulario.. Simulador de dos cuchillos sobre el mismo texto. La prueba real es la constante +75, no este vocabulario.

Estilo compacto (familia CJK/GLM, ilustrativo) · 11 piezas

Hola,¿cómoestáshoy?

Estilo occidental más partido (ilustrativo) · 14 piezas

Hola,¿cómoestáshoy?

Si Ox Alpha usa el cuchillo GLM, su cuenta es 86 = 11 piezas + 75 del membrete. El cuchillo occidental da 14.

Tabla reconstruida · test +75

Patrón publicado (dax / r/singularity / MaxForAI / Davis): cada texto mide exactamente 75 tokens más en Ox que en GLM-5.3.

PromptGLMOxΔMiMoKimi
EN
Hello, how are you today?
88375109
DE
Guten Morgen, wie geht es di
1186751314
CN
你好,今天过得怎么样?
98475118
code
def fib(n): return n if n<2
2499752628
emoji
🚀🔥💡✨🎯
1085751415
EN
The quick brown fox jumps ov
1287751413

Números ilustrativos del patrón público, no una corrida propia. La constante es el hallazgo.

Corridas publicadas

TesterNΔNota
r/singularity675EN/DE/CN/código/emoji. Kimi/Qwen/MiMo/MiniMax divergen. Ambas rutas Ox idénticas.
@aitrackerbot2575Primera tabla pública. MiniMax M3 no matcheó.
@RocketmanSh475Pares crudos 88/106/97/108 vs 13/31/22/33. También error 1210/1214.
@unclecode / modelprint4same-vocabGLM tokenizer 4/4. Kimi 0/4, MiniMax 0/4, Qwen 1/4, MiMo ≤2/4 (emoji 90 vs 57).
@pritish_yuvi17same-vocabMultilingüe/código/emoji exactamente como GLM-5. «MiMo didn’t match.»
@BohuTANG475EN/CN/código/random. «MiMo 完全不同».
@KatilaMarriete775OpenRouter Ox ≡ OpenCode Zen; ambos +75 vs GLM-5.3. El 75 es wrapper de ruta.
@evverin675Seis tests multilingual. Offset exacto 75.
@sushsrinivasan11same-vocabOx = GLM 11/11. Ningún otro lab pasa de 4/11. DeepSeek dígitos 98 vs GLM 29.
@filicroval12same-vocabMismos números. Tokenizer compartido.
@TonyJZhou6same-vocabVector [76, 384, 114, 64, 49, 313] = glm-5.3. L1=0. MiMo 176. MiniMax 172.
@MaxForAI2575Recap chino del test de aitrackerbot. No es una cuenta original.
@thdxr (dax)075Sin tabla. No independiente. Officechai le atribuyó por error el N=25.

Pares crudos de RocketmanSh: siempre 75 de más. Independiente = tabla original, no recap.

  • 8813 = 75
  • 10631 = 75
  • 9722 = 75
  • 10833 = 75

L1

z-ai/glm-5.3
0
Xiaomi MiMo
176
MiniMax M3
172
otras familias
148–302