Todas las publicaciones
publicadodossier inmersivoriesgo medio

INTELIGENCIA ARTIFICIAL · DOSSIER INTERACTIVO

Cuando la inteligencia se abarata: la economía real detrás de los tokens

Una entrevista propone medir la IA como barriles de petróleo. Aquí ponemos la metáfora a prueba: precios comparables, calidad no comparable, coste por resultado y privacidad más allá de una etiqueta.

Empezar desde ceroVer mapa de aprendizaje
Read in EnglishMismo registro factual

El 14 de julio de 2026, Chamath Palihapitiya llevó a CNBC una imagen memorable: pensar en 1 millón de tokens como un «barril de inteligencia». Si dos proveedores entregan algo parecido y uno cobra una fracción, la competencia debería comprimir precios. La intuición es potente porque convierte una factura abstracta en una pregunta cotidiana: ¿estamos comprando capacidad útil o pagando una prima que nuestra tarea no necesita? Pero también es peligrosa si se toma literalmente. Un token no contiene una cantidad fija de inteligencia, los tokenizadores no cuentan igual y una tarifa de entrada no puede mezclarse sin más con una tarifa de salida.

Este dossier conserva la tesis de la entrevista, pero no hereda sus conclusiones. Contrastamos cinco listas oficiales vigentes al 2026-07-17, reconstruimos una carga común de 1M de entrada y 0.2M de salida y hacemos visible cada supuesto. El resultado muestra una dispersión grande de costes, aunque distinta de las cifras pronunciadas al aire. Esa diferencia no invalida la pregunta económica; demuestra por qué una comparación seria necesita modelo exacto, proporción de tokens, caché, contexto, herramientas y fecha de corte.

La segunda mitad cambia de unidad. En lugar de preguntar cuánto cuesta un millón de tokens, pregunta cuánto cuesta producir un resultado aceptado. Ahí aparecen llamadas repetidas, reintentos, revisión humana, latencia, herramientas, errores y privacidad. El laboratorio no predice tu factura y el gráfico no clasifica calidad. Son instrumentos para pensar con disciplina: definir la tarea, medirla en tu propia distribución y comprar la capacidad mínima que mantenga el riesgo dentro de límites explícitos.

01 · EMPEZAR POR LA TESIS

Una metáfora útil que no debe convertirse en unidad

La entrevista comienza con una preocupación empresarial: varias compañías de modelos crecen con rapidez y alguien, en algún punto de la cadena, debe convertir ese gasto en beneficios. Palihapitiya condensa la tensión en una comparación con el petróleo. Si 1 millón de tokens fuera un barril de inteligencia, los compradores deberían buscar el barril más barato que mueva su «motor» lo bastante bien. La metáfora hace visible la presión competitiva y obliga a preguntar quién captura valor cuando la capacidad se difunde.

El problema aparece al tratar el barril como mercancía homogénea. Un barril real tiene una unidad física y calidades especificadas; un millón de tokens solo cuenta fragmentos procesados. El mismo documento puede producir recuentos distintos en tokenizadores diferentes. La entrada, la salida, el razonamiento, el audio, las imágenes y las herramientas tienen tarifas separadas. Incluso dentro de un proveedor, el contexto largo, la prioridad o un lote pueden cambiar el precio. El nombre de la unidad permanece mientras el producto económico cambia.

Hay otra diferencia más profunda: los tokens son insumo, no resultado. Un modelo puede necesitar menos llamadas para resolver una tarea difícil, producir una respuesta que requiere menos revisión o evitar un error caro. Otro puede ser muy barato por llamada y fallar justo donde el flujo necesita precisión. Sin una definición de éxito, el comprador solo ve el numerador de la factura y pierde el denominador que da sentido a la compra.

Por eso este artículo convierte la afirmación en una secuencia de preguntas verificables. ¿Qué modelo exacto? ¿Qué proporción de entrada y salida? ¿Qué fecha y modalidad de servicio? ¿Cuántas iteraciones por tarea? ¿Qué calidad se acepta? ¿Qué ocurre con los datos? La tesis deja de ser «el precio tendrá que caer» y se vuelve más útil: cuando modelos diferentes compiten por la misma tarea, el valor se desplaza hacia quien demuestre el menor coste total dentro del riesgo permitido.

02 · CONSTRUIR LAS UNIDADES

Qué compra realmente una tarifa de API

Antes de comparar proveedores conviene dibujar la cadena de facturación. Una solicitud lleva instrucciones, contexto y datos como entrada. El modelo genera salida y, según el producto, también consume razonamiento interno. Si llama una herramienta, el resultado regresa como nuevo contexto y puede activar otra vuelta. Una interfaz de agente añade memoria, búsqueda, ejecución, almacenamiento y observabilidad. La cifra publicada por millón de tokens cubre solo partes específicas de esa cadena.

La separación entre entrada y salida importa porque sus precios suelen ser asimétricos. Una aplicación de clasificación puede leer mucho y responder poco; un generador de informes puede producir una salida larga; un agente puede alternar ambas durante varias rondas. Cambiar una proporción modifica la factura y, en algunos casos, el orden relativo entre proveedores. Por eso la comparación inicial de este dossier conserva una proporción visible de 5:1 y permite explorar otras sin llamarlas promedios del mercado.

La unidad final debe pertenecer al trabajo, no a la infraestructura. En soporte puede ser un caso resuelto sin reapertura; en extracción, un registro correcto; en programación, un cambio que pasa pruebas y revisión; en investigación, una afirmación trazable que sobrevive a la contraprueba. Solo entonces el coste del modelo puede dividirse por resultados aceptados y compararse con revisión, latencia o daño esperado.

01

Token facturable

Mide volumen procesado bajo reglas del proveedor; no contiene una medida fija de capacidad.

02

Llamada

Agrupa entrada y salida de una interacción, pero un trabajo puede necesitar varias.

03

Tarea

Describe el trabajo que el sistema intenta completar para una persona o proceso.

04

Resultado aceptado

Supera criterios definidos de utilidad, calidad, seguridad y evidencia.

05

Error escapado

Fallo que atraviesa controles y genera retrabajo, daño o exposición.

06

Valor

Beneficio atribuible al resultado después de todos los costes y riesgos relevantes.

03 · NORMALIZAR EL PRECIO

Cinco listas oficiales bajo la misma carga

Para probar la metáfora usamos modelos con precios públicos y nombres exactos: GPT-5.6 Sol, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5 y DeepSeek V4 Pro. La vista inicial factura 1M de entrada y 0.2M de salida, sin caché ni herramientas. Con las tarifas observadas al 2026-07-17, los totales derivados son $11.00, $4.00, $3.30, $3.20 y $0.609. La dispersión es real y suficientemente grande para justificar evaluación económica.

La comparación también muestra por qué una sola cifra puede inducir a error. Claude Sonnet 5 tiene una tarifa promocional con fecha de término. Grok 4.5 cambia de tarifa al cruzar el umbral de contexto largo. DeepSeek V4 Pro diferencia cache hit y cache miss. Google incluye razonamiento dentro de la salida y cobra herramientas de grounding aparte. OpenAI separa modalidades de procesamiento, caché y herramientas. Un «barril» puede omitir justo el componente que domina tu factura.

Usa los botones para cambiar la proporción de salida. Observa qué parte de cada barra corresponde a entrada y cuál a salida. Este movimiento no simula usuarios, no estima demanda y no predice calidad. Solo responde una pregunta estrecha: si enviáramos este volumen exacto bajo estas reglas de lista, ¿cuál sería el cargo base? La estrechez es una virtud porque impide que el gráfico afirme más de lo que los datos sostienen.

El paso responsable siguiente no es elegir la barra corta. Es llevar dos o tres candidatos a una evaluación del flujo real, medir resultados aceptados y registrar las funciones que cambian el contrato. El precio público sirve para formar una hipótesis; la telemetría propia decide si la hipótesis sobrevive.

PRECIOS OBSERVADOS · CARGA DERIVADA

La frontera de precios: misma carga, facturas distintas

Misma cantidad de tokens, cinco listas de precios. Esto normaliza volumen; no convierte los modelos en productos equivalentes.

entradasalida
No es un ranking de calidad

No incorpora caché, contexto largo, herramientas, descuentos, impuestos, latencia, fiabilidad, privacidad ni tasa de éxito.

Fórmulaentrada × tarifa de entrada + salida × tarifa de salidaCorte de precios: 2026-07-17
Abrir tabla equivalente, supuestos y límites
Supuestos
  • La vista inicial usa 1M de tokens de entrada y 0.2M de salida con las tarifas Standard o equivalentes publicadas el 2026-07-17.
  • DeepSeek V4 Pro usa entrada cache miss y Claude Sonnet 5 usa la tarifa promocional vigente hasta el 31 de agosto de 2026.
  • Las otras cargas solo cambian la proporción entrada/salida; no representan una distribución observada de producción.
Límites
  • No compara calidad, latencia, disponibilidad, seguridad, privacidad, tokenización ni tasa de éxito.
  • Excluye caché, contexto largo, lotes, prioridad, herramientas, grounding, impuestos, descuentos y contratos privados.
  • Los precios y modelos cambian; la fecha de corte es parte inseparable de la visualización.
ProveedorModeloEntrada / 1MSalida / 1Mtotal · 1M entrada · 0.2M salida
OpenAIGPT-5.6 Sol$5.00$30.00$11.00
AnthropicClaude Sonnet 5$2.00$10.00$4.00
GoogleGemini 3.5 Flash$1.50$9.00$3.30
xAIGrok 4.5$2.00$6.00$3.20
DeepSeekDeepSeek V4 Pro$0.435$0.87$0.609
Comparar precios de lista vigentes con una carga explícita y enseñar por qué el volumen normalizado no equivale a calidad normalizada.

04 · MEDIR CAPACIDAD

Convergencia no significa equivalencia

La entrevista sostiene que nuevos modelos llegan a una fracción del precio y conservan gran parte de la calidad. Hay evidencia de convergencia agregada: en marzo de 2026, Anthropic 1503, xAI 1495, Google 1494 y OpenAI 1481 estaban separados por 22 puntos en Arena Elo. Eso cambia el poder de negociación y hace más plausible sustituir modelos en tareas comunes. No demuestra, sin embargo, que cada modelo sea 80% o 95% tan bueno en cualquier trabajo.

Un leaderboard comprime muchas interacciones en un número. La compresión es útil para orientación general y peligrosa para decisiones locales. Arena refleja preferencias humanas dentro de una plataforma; un benchmark de programación refleja repositorios y criterios concretos; una prueba de razonamiento puede contener preguntas inválidas; una evaluación estática puede ser entrenada o adaptada. NIST distingue entre exactitud dentro del benchmark y exactitud generalizada porque saltar de una a otra exige supuestos que a menudo permanecen ocultos.

La IA también es irregular. Un sistema puede resolver matemáticas avanzadas y fallar en una instrucción trivial, producir código excelente y exponer un secreto, o resumir bien en inglés y perder matices en español. La media oculta colas de riesgo. Por eso una evaluación de compra necesita casos normales, casos límite, ataques, datos sensibles, entradas largas y fallos de herramientas. También necesita repetición: una demostración brillante no estima una tasa de error.

La pregunta práctica es «¿suficientemente bueno para qué, con qué control y a qué coste de fallo?». Un modelo económico puede dominar en clasificación de bajo riesgo y quedar descartado para una revisión de seguridad; un modelo premium puede justificar su prima si reduce escalamiento humano o evita un error material. La calidad relevante no vive en un nombre de marca: vive en una distribución de tareas, un umbral y una medición reproducible.

01

Representatividad

Los casos deben parecerse al trabajo, idiomas, datos y errores que llegarán a producción.

02

Criterio previo

Define qué cuenta como correcto antes de mirar qué modelo ganó.

03

Repetición

Mide variabilidad y no confíes en una sola salida favorable.

04

Colas de riesgo

Incluye casos raros cuyo daño supera el ahorro medio.

05

Sistema completo

Evalúa herramientas, recuperación, permisos y revisión, no solo texto aislado.

06

Deriva

Versiona modelo, prompt, datos y fecha para detectar cambios posteriores.

05 · VER EL SISTEMA

El precio del modelo ocupa una sola capa

La obsesión por tokens aparece cuando una organización mide lo que el proveedor factura en lugar de lo que el usuario obtiene. La pila interactiva corrige el punto de vista. Comienza en demanda: alguien necesita un resultado con cierta frecuencia. La orquestación decide contexto, llamadas y reintentos. El modelo aporta capacidad. La operación conecta datos y herramientas. El aseguramiento detecta fallos. Solo al final aparece un resultado aceptado.

Cada capa puede dominar el coste por razones distintas. En un clasificador masivo, la factura API puede importar mucho. En un proceso regulado, la revisión humana puede superarla. En un agente, las llamadas de herramientas, el contexto repetido y las recuperaciones fallidas pueden multiplicar tokens. En una aplicación de baja latencia, la capacidad reservada o el precio de prioridad puede ser más importante que la tarifa Standard. Reducir una capa sin observar las demás desplaza el problema.

La vista 3D no codifica magnitudes; organiza dependencias. Selecciona una capa y lee su pregunta de control, métrica mínima y fallo típico. Después cambia a 2D para comprobar que la información no depende del efecto visual. El flujo también es un circuito: los errores del resultado deben volver a la evaluación, la evaluación debe modificar orquestación o selección de modelo, y la nueva versión debe medirse otra vez.

Esta estructura explica por qué una guerra de precios API puede coexistir con gasto total creciente. Si la capacidad más barata desbloquea más tareas o agentes más largos, el volumen puede expandirse. La empresa que solo registra tokens verá adopción; la empresa que registra coste por resultado podrá distinguir expansión útil de consumo sin convergencia.

MODELO 3D ILUSTRATIVO · NO A ESCALA

La pila de valor: del token al resultado

Gira conceptualmente la economía de un sistema: el precio del modelo es una capa, no el producto completo.

Abrir tabla equivalente, supuestos y límites
Supuestos
  • Las seis capas son una taxonomía editorial para razonar, no una arquitectura obligatoria.
  • El orden representa dependencias conceptuales: la demanda activa el flujo y el resultado retroalimenta la evaluación.
  • El grosor, color y separación 3D no codifican magnitudes cuantitativas.
Límites
  • No representa todos los componentes técnicos, contractuales o regulatorios de un sistema de producción.
  • Una capa puede ejecutarse en varios proveedores y una métrica aislada puede inducir comportamientos no deseados.
  • La vista 3D es ilustrativa; la vista 2D y la tabla preservan la misma información.
CapaPreguntaMétrica mínima
Demanda¿Qué resultado necesita alguien?Tareas útiles / mes
Orquestación¿Cuántas vueltas necesita?Llamadas y tokens / tarea
Modelo¿Qué capacidad mínima funciona?USD API / tarea
Operación¿Qué servicios sostienen el flujo?USD y p95 / flujo
Aseguramiento¿Cómo detectamos errores?Minutos y errores escapados
Resultado¿Se resolvió el trabajo?USD / resultado aceptado
Mostrar que el modelo es una capa dentro de un sistema con demanda, orquestación, operación, aseguramiento y resultados medibles.

06 · CALCULAR EL FLUJO

Del precio unitario al coste por resultado aceptado

El laboratorio empieza con 10,000 tareas mensuales. Cada tarea hace 2 llamadas, cada llamada usa 5,000 tokens de entrada y 1,000 de salida, y un 10% de reintentos aumenta el número facturable. La organización acepta el 90% de los resultados y revisa cada tarea durante 3 minutos a $30 por hora. Estos valores son un escenario pedagógico, no una estadística empresarial. Su propósito es mostrar la fórmula y permitir que la rompas.

Primero mueve tareas o llamadas. El coste API crece linealmente porque multiplica volumen. Después aumenta reintentos y observa que una tasa pequeña afecta todas las llamadas. Cambia el modelo para aislar la diferencia de tarifa, pero no interpretes la comparación como sustitución: el laboratorio mantiene artificialmente la misma aceptación. En una decisión real, cada candidato necesita su tasa medida y quizá diferentes minutos de revisión.

La revisión humana revela un punto que el precio por token oculta. Si un modelo más capaz cuesta más API pero reduce errores, escalamiento o minutos de inspección, puede producir un resultado más barato. También ocurre lo contrario: una capa de revisión obligatoria puede dominar tanto que optimizar centavos de inferencia apenas mueve el total. La interfaz muestra el peso de la API para que la discusión se concentre en la variable material.

El resultado clave es el cociente entre coste operativo y resultados aceptados. Aun así, no es ROI. Faltan herramientas, almacenamiento, red, soporte, implementación, impuestos, descuentos, ingresos y coste de errores escapados. Usa el campo de reflexión para escribir las métricas que medirías antes de migrar. Si no puedes nombrarlas, todavía no tienes una comparación de valor; solo una comparación de tarifa.

ESCENARIO · NO ES UNA COTIZACIÓN

Laboratorio de coste por resultado aceptado

Cambia una variable cada vez. El laboratorio separa la factura del modelo del coste de revisar y conseguir resultados aceptados.

Modelo y tarifa
Carga mensual
22,000 llamadas facturables
Calidad y revisión

Misma carga, solo factura API

Mantiene tokens y llamadas; no supone la misma calidad ni tasa de aceptación entre modelos.

  1. OpenAIGPT-5.6 Sol$1,210.00
  2. AnthropicClaude Sonnet 5$440.00
  3. GoogleGemini 3.5 Flash$363.00
  4. xAIGrok 4.5$352.00
  5. DeepSeekDeepSeek V4 Pro$66.99
Este campo permanece en tu navegador; no se guarda ni se envía.
Fórmulagasto = llamadas × tokens × tarifa + revisión humana
Abrir fórmulas, tabla equivalente, supuestos y límites
Supuestos
  • El usuario define tareas, llamadas, tokens, reintentos, aceptación y revisión; el escenario inicial es pedagógico, no una media empresarial.
  • La revisión humana se modela como minutos por tarea multiplicados por un coste horario cargado.
  • La comparación de proveedores conserva exactamente la misma carga y la misma tasa de aceptación solo para aislar la factura API.
Límites
  • No incluye herramientas, almacenamiento, recuperación, red, observabilidad, soporte, impuestos ni descuentos.
  • La tasa de aceptación debe medirse con evaluaciones propias; mantenerla fija entre modelos no implica equivalencia.
  • No predice ROI, ingresos, productividad o errores de una organización real.
VariableValor inicialPapel en la fórmula
Tareas10,000 / mesMultiplica consumo y revisión
Llamadas2 / tareaMultiplica tokens
Entrada5,000 / llamadaSe factura a tarifa de entrada
Salida1,000 / llamadaSe factura a tarifa de salida
Reintentos10%Aumenta llamadas facturables
Aceptación90%Define resultados aceptados
Revisión3 min a $30/hAñade coste humano
Coste por resultado aceptado$1.80 / resultado$16,210 ÷ 9,000 resultados aceptados
Escenario actual: entradas y resultados
MétricaValorUnidad y base
Modelo seleccionadoOpenAI · GPT-5.6 SolSRC-303
Tarifa de entrada$5.00USD / 1M tokens de entrada
Tarifa de salida$30.00USD / 1M tokens de salida
Tareas por mes10,000tareas / mes
Llamadas por tarea2llamadas / tarea
Tokens de entrada por llamada5,000tokens / llamada
Tokens de salida por llamada1,000tokens / llamada
Reintentos adicionales10%% adicional sobre llamadas base
Resultados aceptados90%% de tareas aceptadas
Revisión humana por tarea3min / tarea
Coste horario del revisor$30.00USD / hora
llamadas facturables22,000llamadas facturables / mes
Factura del modelo$1,210.00USD / mes
Revisión humana$15,000.00USD / mes
Coste operativo del escenario$16,210.00USD / mes
Resultados aceptados9,000resultados aceptados / mes
Coste por resultado aceptado$1.80USD / resultado aceptado
Convertir tarifas por token en una economía de tarea que haga visibles volumen, iteraciones, reintentos, revisión humana y tasa de aceptación.

07 · SEGUIR LOS DATOS

ZDR no cabe en una casilla de sí o no

La entrevista acierta al desconfiar de una lectura superficial de Zero Data Retention, pero su ejemplo del botón de «me gusta» mezcla posibilidades sin distinguir productos. La documentación actual permite una explicación más precisa. OpenAI, Anthropic y Google describen controles para clientes de API o servicios pagados, pero la cobertura depende de elegibilidad, contrato, organización, endpoint, modelo, función y configuración. No debe extrapolarse automáticamente a una interfaz de consumo.

Hay que separar entrenamiento de retención. «No usamos tu contenido para entrenar por defecto» limita un propósito. ZDR busca evitar que prompts y respuestas queden almacenados en reposo después de la respuesta bajo condiciones cubiertas. Un proveedor puede ofrecer la primera restricción sin que todas sus funciones cumplan la segunda. Archivos, lotes, sesiones persistentes, ejecución, caché, feedback o monitoreo de abuso pueden tener ciclos distintos.

También existe estado de aplicación. Un sistema de respuestas puede guardar conversaciones si se lo pides; una API de archivos debe conservar el archivo para usarlo; un agente administrado necesita una sesión; una herramienta externa recibe su propia porción de datos. ZDR del modelo no borra copias en tu base de datos, observabilidad, proxy, proveedor de búsqueda o sistema de tickets. La frontera de privacidad atraviesa el flujo completo.

Los metadatos merecen una columna separada. Identificadores de cuenta, facturación, uso, latencia, errores, filtros de seguridad o direcciones de red pueden procesarse para operar el servicio aunque el contenido esté bajo controles más estrictos. Eso no vuelve inútil ZDR: lo convierte en un control concreto dentro de una arquitectura. La verificación correcta registra qué dato, quién lo procesa, dónde, con qué propósito, cuánto tiempo y bajo qué excepción.

Antes de enviar secretos, información personal o datos regulados, el equipo debe revisar contrato y configuración aplicables, minimizar contenido, aislar credenciales, limitar herramientas, definir borrado y probar logs. Este dossier es educativo y no sustituye revisión legal, seguridad o cumplimiento. Su recomendación más segura es metodológica: no confíes en el nombre del control; verifica el camino de cada dato.

01

Entrenamiento

¿El contenido puede usarse para mejorar modelos y cuál es el valor por defecto?

02

Retención de contenido

¿Prompts y respuestas se guardan, por cuánto tiempo y bajo qué excepciones?

03

Estado de aplicación

¿Archivos, conversaciones, lotes, caché o sesiones persisten para funcionar?

04

Metadatos

¿Qué datos de uso, seguridad, facturación y red se procesan aparte del contenido?

05

Terceros

¿Qué herramientas, nubes o integraciones reciben datos y con qué condiciones?

06

Tu infraestructura

¿Qué copias dejan proxies, logs, bases, colas, evaluaciones y sistemas de soporte?

08 · COMPRAR CON EVIDENCIA

Un proceso que sobrevive a la próxima bajada de precios

Los nombres de modelos y tarifas de este artículo quedarán obsoletos. Un buen proceso no. Empieza describiendo una tarea con entradas, salidas, volumen, usuarios y daño posible. Construye un conjunto de casos que incluya idioma, datos largos, errores de herramientas y situaciones raras. Define criterios antes de ejecutar: exactitud, formato, evidencia, seguridad, latencia y cuándo debe escalar a una persona.

Después ejecuta varios candidatos con configuración versionada. Registra tokens por modalidad, llamadas, herramientas, tiempo, errores, aceptación y revisión. Calcula coste por resultado aceptado y segmenta por dificultad; una media puede ocultar que el modelo económico falla en el segmento más valioso. Para tareas heterogéneas, prueba enrutamiento: un modelo barato resuelve lo rutinario y un modelo premium recibe casos difíciles o de alto riesgo.

Añade límites operativos. Presupuestos por tarea, máximos de salida, topes de iteración, timeouts, caché controlada y alertas evitan que una mejora de capacidad se convierta en consumo abierto. Repite la evaluación cuando cambian modelo, prompt, herramientas, datos o política. La fecha y el identificador exacto son parte del resultado, no detalles administrativos.

Finalmente, trata privacidad y continuidad como criterios de compra. Verifica contrato, región, retención, exportación, borrado, dependencia de funciones propietarias y plan de salida. La opción más barata por token puede salir cara si bloquea migración, carece de capacidad reservada o obliga a rehacer controles. La opción premium puede ser injustificable si no demuestra mejora en el denominador.

01

1 · Definir

Tarea, usuario, volumen, dato sensible y coste del error.

02

2 · Muestrear

Casos normales, difíciles, raros, adversariales y multilingües.

03

3 · Aceptar

Criterios previos de calidad, seguridad, latencia y escalamiento.

04

4 · Medir

Resultados, tokens, llamadas, herramientas, revisión y variabilidad.

05

5 · Calcular

Coste total por resultado aceptado y por segmento de riesgo.

06

6 · Controlar

Presupuestos, límites, observabilidad, permisos y alertas.

07

7 · Revalidar

Nueva prueba ante cualquier cambio de modelo, datos o flujo.

09 · VOLVER A LA ENTREVISTA

Qué queda en pie después de contrastar la tesis

La intuición central sobre presión de precios queda en pie. Existen diferencias amplias de lista y la convergencia agregada hace que más compradores puedan probar alternativas. El valor de una marca de modelo no puede descansar solo en haber llegado primero. Debe sostenerse con calidad medible, fiabilidad, funciones, distribución, seguridad, soporte o una economía total superior. La pregunta «¿por qué pagar más?» es saludable cuando obliga al proveedor a demostrar el denominador.

La cifra concreta del «barril» no queda en pie como comparación universal. Los precios oficiales actuales dependen de modelo, entrada, salida, tokenizador y condiciones. Una mezcla sin fórmula visible no puede auditarse. Tampoco queda demostrada la afirmación de que los modelos económicos conserven 80% o 95% de calidad para la mayoría de usos. Arena ofrece una señal de convergencia, no una tasa universal de sustitución.

La advertencia sobre gasto empresarial es posible, no observada en la entrevista. Una organización puede descubrir consumo no gobernado, pero también puede negociar capacidad, usar suscripciones, obtener descuentos o generar beneficios que superen el coste. El escenario correcto no es predecir sorpresas de resultados corporativos; es instalar telemetría antes de que la factura crezca: presupuesto, coste por tarea, reintentos, revisión y valor aceptado.

La tesis sobre hardware y memoria pertenece a inversión. El AI Index documenta gasto de cómputo creciente y la infraestructura puede seguir siendo escasa, pero eso no determina márgenes, múltiplos o rentabilidad de una empresa específica. Este artículo no recomienda valores ni valida que un segmento supere al mercado. Separar demanda física de retorno financiero evita que una explicación técnica se convierta en consejo implícito.

La observación sobre privacidad sí merece atención, con mejor taxonomía. ZDR es real y útil dentro de su cobertura; no es una capa mágica que controla consumidores, herramientas y copias externas. La conclusión más robusta de la entrevista no es que toda IA se vuelva una mercancía. Es que, cuando baja el coste de capacidad, la ventaja se mueve hacia diseñar, medir y gobernar el sistema que convierte esa capacidad en resultados confiables.

COMPROBAR TRANSFERENCIA

¿Puedes tomar la decisión sin la metáfora?

Responde por razonamiento. Cada explicación señala la distinción que importa en producción.

0/4Progreso0 respuestas correctas
01¿Qué describe directamente un precio por millón de tokens?
02¿Cuál es el uso legítimo del gráfico de precios?
03¿Qué denominador mejora una decisión de compra?
04¿Qué debe acompañar una promesa ZDR?
Tu respuesta permanece local en el navegador y no se guarda ni se envía.0/480

Trazabilidad

Registro de evidencia

14afirmaciones registradas
CLM-301Chamath Palihapitiya propone llamar a 1 millón de tokens un «barril de inteligencia» y sostiene que la diferencia de precios tendrá que racionalizarse.directo

Localizador: Entrevista, 01:42–02:45

Incertidumbre: La analogía es retórica: un token no es una unidad estable de inteligencia y diferentes tokenizadores producen cantidades distintas para el mismo texto.

CLM-302GPT-5.6 Sol, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5 y DeepSeek V4 Pro publican tarifas separadas para entrada y salida, con reglas adicionales para caché, contexto, herramientas o lotes.triangulado

Localizador: Tablas oficiales de precios de texto y notas de facturación de cada proveedor

Incertidumbre: Son precios de lista fechados, no cotizaciones contractuales; la disponibilidad, los descuentos y las reglas pueden cambiar.

CLM-303Con 1 millón de tokens de entrada y 0.2 millones de salida, sin caché ni herramientas, el coste de lista calculado es $11.00, $4.00, $3.30, $3.20 y $0.609, respectivamente.derivado

Localizador: Derivación reproducible: precio de entrada × 1 + precio de salida × 0.2; tarifa cache miss para DeepSeek V4 Pro y tarifa promocional vigente de Claude Sonnet 5

Incertidumbre: La comparación normaliza volumen, no calidad, latencia, fiabilidad, seguridad, tokenización, disponibilidad ni coste total de una tarea.

CLM-304Un precio por token no mide la calidad de una tarea: la evaluación requiere declarar el objetivo de medición, los casos, los supuestos y la incertidumbre.triangulado

Localizador: NIST AI 800-3, resumen y contribuciones; AI Index 2026, hallazgos 5, 7, 8 y 9

Incertidumbre: Ningún conjunto finito elimina el riesgo de deriva o de fallos fuera de distribución.

CLM-305En marzo de 2026, Anthropic 1503, xAI 1495, Google 1494 y OpenAI 1481 estaban separados por 22 puntos en Arena Elo.directo

Localizador: AI Index 2026 Technical Performance, hallazgo 2

Incertidumbre: Arena agrega preferencias humanas y su ranking puede reflejar adaptación a la plataforma; no es una evaluación de cada flujo empresarial.

CLM-306La convergencia agregada aumenta la presión competitiva, pero no demuestra que un modelo barato sea intercambiable con uno premium en una tarea concreta.derivado

Localizador: Inferencia a partir de la proximidad Arena y de los límites estadísticos de generalizar benchmarks

Incertidumbre: La sustituibilidad solo puede estimarse con casos representativos, criterios de aceptación y costes de error del sistema real.

CLM-307El coste facturable de un agente puede incluir tokens de entrada, salida y razonamiento, lecturas o escrituras de caché, llamadas a herramientas y múltiples iteraciones.triangulado

Localizador: Documentación oficial de precios, caché, herramientas y facturación de agentes

Incertidumbre: Cada proveedor contabiliza modalidades y herramientas de manera diferente; la factura real debe reconciliarse con telemetría propia.

CLM-308Reducir el precio por token no garantiza reducir el gasto total si el volumen, el contexto repetido, las iteraciones o la tasa de reintentos crecen más rápido.derivado

Localizador: Identidad aritmética reproducible del simulador: gasto = unidades facturables × tarifa; la dirección depende de ambos factores

Incertidumbre: Describe una condición matemática, no afirma que todas las empresas estén aumentando el consumo ni predice sus resultados.

CLM-309Zero Data Retention es una propiedad contractual, organizacional, de endpoint y de función; no equivale por sí sola a ausencia de metadatos, estado de aplicación o terceros.triangulado

Localizador: OpenAI, tabla de elegibilidad ZDR; Anthropic, What ZDR does not cover y Feature eligibility; Gemini, achieving zero data retention

Incertidumbre: Los contratos y configuraciones concretos prevalecen sobre la documentación general y pueden cambiar por región, producto o cuenta.

CLM-310No usar contenido para entrenamiento y no conservar contenido después de la respuesta son controles distintos; un servicio puede ofrecer uno sin garantizar automáticamente el otro.triangulado

Localizador: Comparación de las secciones sobre restricción de entrenamiento, retención estándar y ZDR de los tres proveedores

Incertidumbre: La taxonomía del artículo simplifica contratos complejos y no constituye asesoría legal o de cumplimiento.

CLM-311La compra racional de IA optimiza coste por resultado aceptado, no tokens consumidos ni una posición aislada en un leaderboard.derivado

Localizador: Inferencia editorial basada en la distinción de NIST entre exactitud de benchmark y exactitud generalizada

Incertidumbre: El resultado aceptado debe definirse por organización e incluir calidad, seguridad, latencia, revisión humana y coste de error.

CLM-312La entrevista plantea que el hardware y la memoria seguirán beneficiándose de la escasez, pero eso es una tesis de inversión y no una conclusión demostrada por los precios API.disputado

Localizador: Entrevista, 03:59–05:31; AI Index Economy, sección 4.2 y Figura 4.2.20

Incertidumbre: La demanda de cómputo puede crecer mientras márgenes, múltiplos y retornos de empresas específicas caen; este artículo no recomienda valores.

CLM-313La entrevista de CNBC Squawk Box fue emitida el 14 de julio de 2026 y presenta a Palihapitiya como fundador y CEO de Social Capital, CEO de 8090 y anfitrión de All-In.directo

Localizador: Video y transcripción, 00:01–00:54

Incertidumbre: La ficha identifica el contexto de la entrevista; no implica respaldo editorial a sus empresas o inversiones.

CLM-314La comparación visual usa una carga de referencia de 1M de entrada y 0.2M de salida, una proporción ilustrativa 5:1 que no describe todas las aplicaciones.derivado

Localizador: Supuesto explícito de VIS-301 y función de cálculo documentada en el simulador

Incertidumbre: Cambiar la proporción puede alterar el orden de costes porque las tarifas de entrada y salida difieren entre proveedores.

Bibliografía operativa

Fuentes y límites

13fuentes registradas
  1. SRC-301
    artefacto internoEvidencia interna · no disponible públicamente

    All-In podcast host Chamath Palihapitiya on the current state of AI — supplied transcript

    Transcripción de la entrevista de CNBC proporcionada por el usuario · 2026-07-17

    Localizador: Transcripción completa con marcas 00:01–13:18; bytes preservados y manifiestos bajo content/intake/economics-of-cheap-intelligence

    Huella de integridad: sha256-682881672216509ee1142c4e40163c3ccc3f6c8b9901ed944e09c0aa5f964c48

    Es una transcripción automática que termina a mitad de frase; conserva las opiniones del entrevistado, pero no valida sus cifras ni sus predicciones.
  2. SRC-302
    fuente primaria

    All-In podcast host Chamath Palihapitiya on the current state of AI

    CNBC Squawk Box · 2026-07-17

    Localizador: Video del 14 de julio de 2026; segmentos 01:42–03:59, 05:31–08:12 y 12:13–13:18

    La entrevista expresa la tesis y las analogías del invitado; sus precios mezclan modelos, proporciones de entrada/salida y posibles supuestos no declarados.
  3. SRC-303
    fuente primaria

    Models — OpenAI API

    OpenAI · 2026-07-17

    Localizador: Sección Frontier models: GPT-5.6 Sol, Terra y Luna; precios de entrada y salida por MTok

    Precios de lista que pueden cambiar; no incluyen herramientas, prioridad, lotes, caché, impuestos, descuentos ni contratos privados.
  4. SRC-304
    fuente primaria

    Precios — Claude Platform Docs

    Anthropic · 2026-07-17

    Localizador: Tabla de precios de modelos, filas Claude Sonnet 5 y Claude Sonnet 4.6; secciones de caché, lotes y herramientas

    La tarifa de Claude Sonnet 5 usada en el artículo es promocional hasta el 31 de agosto de 2026; la tokenización también difiere entre generaciones.
  5. SRC-305
    fuente primaria

    Gemini Developer API pricing

    Google AI for Developers · 2026-07-17

    Localizador: Secciones Gemini 3.5 Flash y Gemini 3.1 Flash-Lite; tablas Standard, Batch y Context caching

    La salida incluye tokens de razonamiento; herramientas y grounding se cobran por separado y los modelos Preview pueden cambiar.
  6. SRC-306
    fuente primaria

    Pricing — xAI Docs

    xAI Corp. · 2026-07-17

    Localizador: Text API, tabla Prices per 1M tokens, fila grok-4.5; secciones de herramientas, lotes y prioridad

    La tarifa cambia para contexto largo; las herramientas del servidor añaden cargos y la disponibilidad depende de la cuenta.
  7. SRC-307
    fuente primaria

    Models & Pricing — DeepSeek API Docs

    DeepSeek · 2026-07-17

    Localizador: Model Details: deepseek-v4-flash y deepseek-v4-pro; precios de cache hit, cache miss y salida

    El artículo usa la tarifa cache miss de V4 Pro; el proveedor advierte que puede ajustar precios y sus métricas no hacen equivalentes los modelos.
  8. SRC-308
    fuente secundaria

    Technical Performance — 2026 AI Index Report

    Stanford Institute for Human-Centered AI · 2026-07-17

    Localizador: Hallazgos 2, 5, 7, 8 y 9: convergencia Arena, fragilidad de benchmarks e inteligencia irregular

    Es una síntesis de evaluaciones heterogéneas; Arena Elo refleja preferencias agregadas y no garantiza rendimiento, seguridad o coste en una tarea empresarial.
  9. SRC-309
    fuente primaria

    Expanding the AI Evaluation Toolbox with Statistical Models — NIST AI 800-3

    National Institute of Standards and Technology · 2026-07-17

    Localizador: Resumen y contribuciones: exactitud en benchmark, exactitud generalizada, supuestos e incertidumbre

    El marco mejora la interpretación estadística, pero no prescribe un benchmark, proveedor o umbral universal para cada negocio.
  10. SRC-310
    fuente primaria

    Data controls in the OpenAI platform

    OpenAI · 2026-07-17

    Localizador: Secciones Modified Abuse Monitoring y Zero Data Retention; tabla de elegibilidad y estado de aplicación

    La elegibilidad exige aprobación y algunas capacidades conservan estado de aplicación incluso con ZDR; los contratos vigentes son la fuente final.
  11. SRC-311
    fuente primaria

    API and data retention — Claude Platform Docs

    Anthropic · 2026-07-17

    Localizador: Secciones How Anthropic approaches data retention, Zero data retention, What ZDR does not cover y Feature eligibility

    ZDR se habilita por organización y no cubre todas las funciones, productos de consumo, interfaces o integraciones; algunos modelos exigen retención.
  12. SRC-312
    fuente primaria

    Zero data retention in the Gemini Developer API

    Google AI for Developers · 2026-07-17

    Localizador: Secciones Training restriction y Customer data retention and achieving zero data retention

    Los servicios pagados restringen entrenamiento, pero lograr ZDR requiere configuraciones y evitar funciones con retención; también permanecen datos operativos.
  13. SRC-313
    fuente secundaria

    Economy — 2026 AI Index Report

    Stanford Institute for Human-Centered AI · 2026-07-17

    Localizador: Sección 4.2 Investment and Infrastructure, Figura 4.2.20, página 190 del PDF

    El gasto anual de cómputo es una estimación de Epoch AI y aproxima capacidad alquilada; no demuestra rentabilidad futura de laboratorios o fabricantes.

Cierre

La inteligencia no viene en barriles: viene en sistemas que transforman datos, energía, software y juicio humano en decisiones. Los precios bajarán, subirán o cambiarán de forma; el método permanece. Declara la tarea, normaliza la carga, evalúa tu distribución, calcula el coste por resultado aceptado y sigue cada dato. Entonces una tarifa deja de ser una promesa de valor y se convierte en un componente que puedes auditar.

© Christopher sobre el texto, la estructura, el código y las visualizaciones originales. Las fuentes, citas, marcas e imágenes de terceros conservan sus propios derechos.

Estado editorial: publicado. Esta versión corresponde a un release aprobado.