INTELIGENCIA ARTIFICIAL · DOSSIER INTERACTIVO
Cuando la inteligencia se abarata: la economía real detrás de los tokens
Una entrevista propone medir la IA como barriles de petróleo. Aquí ponemos la metáfora a prueba: precios comparables, calidad no comparable, coste por resultado y privacidad más allá de una etiqueta.
El 14 de julio de 2026, Chamath Palihapitiya llevó a CNBC una imagen memorable: pensar en 1 millón de tokens como un «barril de inteligencia». Si dos proveedores entregan algo parecido y uno cobra una fracción, la competencia debería comprimir precios. La intuición es potente porque convierte una factura abstracta en una pregunta cotidiana: ¿estamos comprando capacidad útil o pagando una prima que nuestra tarea no necesita? Pero también es peligrosa si se toma literalmente. Un token no contiene una cantidad fija de inteligencia, los tokenizadores no cuentan igual y una tarifa de entrada no puede mezclarse sin más con una tarifa de salida.
Este dossier conserva la tesis de la entrevista, pero no hereda sus conclusiones. Contrastamos cinco listas oficiales vigentes al 2026-07-17, reconstruimos una carga común de 1M de entrada y 0.2M de salida y hacemos visible cada supuesto. El resultado muestra una dispersión grande de costes, aunque distinta de las cifras pronunciadas al aire. Esa diferencia no invalida la pregunta económica; demuestra por qué una comparación seria necesita modelo exacto, proporción de tokens, caché, contexto, herramientas y fecha de corte.
La segunda mitad cambia de unidad. En lugar de preguntar cuánto cuesta un millón de tokens, pregunta cuánto cuesta producir un resultado aceptado. Ahí aparecen llamadas repetidas, reintentos, revisión humana, latencia, herramientas, errores y privacidad. El laboratorio no predice tu factura y el gráfico no clasifica calidad. Son instrumentos para pensar con disciplina: definir la tarea, medirla en tu propia distribución y comprar la capacidad mínima que mantenga el riesgo dentro de límites explícitos.
01 · EMPEZAR POR LA TESIS
Una metáfora útil que no debe convertirse en unidad
La entrevista comienza con una preocupación empresarial: varias compañías de modelos crecen con rapidez y alguien, en algún punto de la cadena, debe convertir ese gasto en beneficios. Palihapitiya condensa la tensión en una comparación con el petróleo. Si 1 millón de tokens fuera un barril de inteligencia, los compradores deberían buscar el barril más barato que mueva su «motor» lo bastante bien. La metáfora hace visible la presión competitiva y obliga a preguntar quién captura valor cuando la capacidad se difunde.
El problema aparece al tratar el barril como mercancía homogénea. Un barril real tiene una unidad física y calidades especificadas; un millón de tokens solo cuenta fragmentos procesados. El mismo documento puede producir recuentos distintos en tokenizadores diferentes. La entrada, la salida, el razonamiento, el audio, las imágenes y las herramientas tienen tarifas separadas. Incluso dentro de un proveedor, el contexto largo, la prioridad o un lote pueden cambiar el precio. El nombre de la unidad permanece mientras el producto económico cambia.
Hay otra diferencia más profunda: los tokens son insumo, no resultado. Un modelo puede necesitar menos llamadas para resolver una tarea difícil, producir una respuesta que requiere menos revisión o evitar un error caro. Otro puede ser muy barato por llamada y fallar justo donde el flujo necesita precisión. Sin una definición de éxito, el comprador solo ve el numerador de la factura y pierde el denominador que da sentido a la compra.
Por eso este artículo convierte la afirmación en una secuencia de preguntas verificables. ¿Qué modelo exacto? ¿Qué proporción de entrada y salida? ¿Qué fecha y modalidad de servicio? ¿Cuántas iteraciones por tarea? ¿Qué calidad se acepta? ¿Qué ocurre con los datos? La tesis deja de ser «el precio tendrá que caer» y se vuelve más útil: cuando modelos diferentes compiten por la misma tarea, el valor se desplaza hacia quien demuestre el menor coste total dentro del riesgo permitido.
02 · CONSTRUIR LAS UNIDADES
Qué compra realmente una tarifa de API
Antes de comparar proveedores conviene dibujar la cadena de facturación. Una solicitud lleva instrucciones, contexto y datos como entrada. El modelo genera salida y, según el producto, también consume razonamiento interno. Si llama una herramienta, el resultado regresa como nuevo contexto y puede activar otra vuelta. Una interfaz de agente añade memoria, búsqueda, ejecución, almacenamiento y observabilidad. La cifra publicada por millón de tokens cubre solo partes específicas de esa cadena.
La separación entre entrada y salida importa porque sus precios suelen ser asimétricos. Una aplicación de clasificación puede leer mucho y responder poco; un generador de informes puede producir una salida larga; un agente puede alternar ambas durante varias rondas. Cambiar una proporción modifica la factura y, en algunos casos, el orden relativo entre proveedores. Por eso la comparación inicial de este dossier conserva una proporción visible de 5:1 y permite explorar otras sin llamarlas promedios del mercado.
La unidad final debe pertenecer al trabajo, no a la infraestructura. En soporte puede ser un caso resuelto sin reapertura; en extracción, un registro correcto; en programación, un cambio que pasa pruebas y revisión; en investigación, una afirmación trazable que sobrevive a la contraprueba. Solo entonces el coste del modelo puede dividirse por resultados aceptados y compararse con revisión, latencia o daño esperado.
Token facturable
Mide volumen procesado bajo reglas del proveedor; no contiene una medida fija de capacidad.
Llamada
Agrupa entrada y salida de una interacción, pero un trabajo puede necesitar varias.
Tarea
Describe el trabajo que el sistema intenta completar para una persona o proceso.
Resultado aceptado
Supera criterios definidos de utilidad, calidad, seguridad y evidencia.
Error escapado
Fallo que atraviesa controles y genera retrabajo, daño o exposición.
Valor
Beneficio atribuible al resultado después de todos los costes y riesgos relevantes.
03 · NORMALIZAR EL PRECIO
Cinco listas oficiales bajo la misma carga
Para probar la metáfora usamos modelos con precios públicos y nombres exactos: GPT-5.6 Sol, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5 y DeepSeek V4 Pro. La vista inicial factura 1M de entrada y 0.2M de salida, sin caché ni herramientas. Con las tarifas observadas al 2026-07-17, los totales derivados son $11.00, $4.00, $3.30, $3.20 y $0.609. La dispersión es real y suficientemente grande para justificar evaluación económica.
La comparación también muestra por qué una sola cifra puede inducir a error. Claude Sonnet 5 tiene una tarifa promocional con fecha de término. Grok 4.5 cambia de tarifa al cruzar el umbral de contexto largo. DeepSeek V4 Pro diferencia cache hit y cache miss. Google incluye razonamiento dentro de la salida y cobra herramientas de grounding aparte. OpenAI separa modalidades de procesamiento, caché y herramientas. Un «barril» puede omitir justo el componente que domina tu factura.
Usa los botones para cambiar la proporción de salida. Observa qué parte de cada barra corresponde a entrada y cuál a salida. Este movimiento no simula usuarios, no estima demanda y no predice calidad. Solo responde una pregunta estrecha: si enviáramos este volumen exacto bajo estas reglas de lista, ¿cuál sería el cargo base? La estrechez es una virtud porque impide que el gráfico afirme más de lo que los datos sostienen.
El paso responsable siguiente no es elegir la barra corta. Es llevar dos o tres candidatos a una evaluación del flujo real, medir resultados aceptados y registrar las funciones que cambian el contrato. El precio público sirve para formar una hipótesis; la telemetría propia decide si la hipótesis sobrevive.
La frontera de precios: misma carga, facturas distintas
Misma cantidad de tokens, cinco listas de precios. Esto normaliza volumen; no convierte los modelos en productos equivalentes.
No incorpora caché, contexto largo, herramientas, descuentos, impuestos, latencia, fiabilidad, privacidad ni tasa de éxito.
entrada × tarifa de entrada + salida × tarifa de salidaCorte de precios: 2026-07-17Abrir tabla equivalente, supuestos y límites
- La vista inicial usa 1M de tokens de entrada y 0.2M de salida con las tarifas Standard o equivalentes publicadas el 2026-07-17.
- DeepSeek V4 Pro usa entrada cache miss y Claude Sonnet 5 usa la tarifa promocional vigente hasta el 31 de agosto de 2026.
- Las otras cargas solo cambian la proporción entrada/salida; no representan una distribución observada de producción.
- No compara calidad, latencia, disponibilidad, seguridad, privacidad, tokenización ni tasa de éxito.
- Excluye caché, contexto largo, lotes, prioridad, herramientas, grounding, impuestos, descuentos y contratos privados.
- Los precios y modelos cambian; la fecha de corte es parte inseparable de la visualización.
| Proveedor | Modelo | Entrada / 1M | Salida / 1M | total · 1M entrada · 0.2M salida |
|---|---|---|---|---|
| OpenAI | GPT-5.6 Sol | $5.00 | $30.00 | $11.00 |
| Anthropic | Claude Sonnet 5 | $2.00 | $10.00 | $4.00 |
| Gemini 3.5 Flash | $1.50 | $9.00 | $3.30 | |
| xAI | Grok 4.5 | $2.00 | $6.00 | $3.20 |
| DeepSeek | DeepSeek V4 Pro | $0.435 | $0.87 | $0.609 |
04 · MEDIR CAPACIDAD
Convergencia no significa equivalencia
La entrevista sostiene que nuevos modelos llegan a una fracción del precio y conservan gran parte de la calidad. Hay evidencia de convergencia agregada: en marzo de 2026, Anthropic 1503, xAI 1495, Google 1494 y OpenAI 1481 estaban separados por 22 puntos en Arena Elo. Eso cambia el poder de negociación y hace más plausible sustituir modelos en tareas comunes. No demuestra, sin embargo, que cada modelo sea 80% o 95% tan bueno en cualquier trabajo.
Un leaderboard comprime muchas interacciones en un número. La compresión es útil para orientación general y peligrosa para decisiones locales. Arena refleja preferencias humanas dentro de una plataforma; un benchmark de programación refleja repositorios y criterios concretos; una prueba de razonamiento puede contener preguntas inválidas; una evaluación estática puede ser entrenada o adaptada. NIST distingue entre exactitud dentro del benchmark y exactitud generalizada porque saltar de una a otra exige supuestos que a menudo permanecen ocultos.
La IA también es irregular. Un sistema puede resolver matemáticas avanzadas y fallar en una instrucción trivial, producir código excelente y exponer un secreto, o resumir bien en inglés y perder matices en español. La media oculta colas de riesgo. Por eso una evaluación de compra necesita casos normales, casos límite, ataques, datos sensibles, entradas largas y fallos de herramientas. También necesita repetición: una demostración brillante no estima una tasa de error.
La pregunta práctica es «¿suficientemente bueno para qué, con qué control y a qué coste de fallo?». Un modelo económico puede dominar en clasificación de bajo riesgo y quedar descartado para una revisión de seguridad; un modelo premium puede justificar su prima si reduce escalamiento humano o evita un error material. La calidad relevante no vive en un nombre de marca: vive en una distribución de tareas, un umbral y una medición reproducible.
Representatividad
Los casos deben parecerse al trabajo, idiomas, datos y errores que llegarán a producción.
Criterio previo
Define qué cuenta como correcto antes de mirar qué modelo ganó.
Repetición
Mide variabilidad y no confíes en una sola salida favorable.
Colas de riesgo
Incluye casos raros cuyo daño supera el ahorro medio.
Sistema completo
Evalúa herramientas, recuperación, permisos y revisión, no solo texto aislado.
Deriva
Versiona modelo, prompt, datos y fecha para detectar cambios posteriores.
05 · VER EL SISTEMA
El precio del modelo ocupa una sola capa
La obsesión por tokens aparece cuando una organización mide lo que el proveedor factura en lugar de lo que el usuario obtiene. La pila interactiva corrige el punto de vista. Comienza en demanda: alguien necesita un resultado con cierta frecuencia. La orquestación decide contexto, llamadas y reintentos. El modelo aporta capacidad. La operación conecta datos y herramientas. El aseguramiento detecta fallos. Solo al final aparece un resultado aceptado.
Cada capa puede dominar el coste por razones distintas. En un clasificador masivo, la factura API puede importar mucho. En un proceso regulado, la revisión humana puede superarla. En un agente, las llamadas de herramientas, el contexto repetido y las recuperaciones fallidas pueden multiplicar tokens. En una aplicación de baja latencia, la capacidad reservada o el precio de prioridad puede ser más importante que la tarifa Standard. Reducir una capa sin observar las demás desplaza el problema.
La vista 3D no codifica magnitudes; organiza dependencias. Selecciona una capa y lee su pregunta de control, métrica mínima y fallo típico. Después cambia a 2D para comprobar que la información no depende del efecto visual. El flujo también es un circuito: los errores del resultado deben volver a la evaluación, la evaluación debe modificar orquestación o selección de modelo, y la nueva versión debe medirse otra vez.
Esta estructura explica por qué una guerra de precios API puede coexistir con gasto total creciente. Si la capacidad más barata desbloquea más tareas o agentes más largos, el volumen puede expandirse. La empresa que solo registra tokens verá adopción; la empresa que registra coste por resultado podrá distinguir expansión útil de consumo sin convergencia.
La pila de valor: del token al resultado
Gira conceptualmente la economía de un sistema: el precio del modelo es una capa, no el producto completo.
Abrir tabla equivalente, supuestos y límites
- Las seis capas son una taxonomía editorial para razonar, no una arquitectura obligatoria.
- El orden representa dependencias conceptuales: la demanda activa el flujo y el resultado retroalimenta la evaluación.
- El grosor, color y separación 3D no codifican magnitudes cuantitativas.
- No representa todos los componentes técnicos, contractuales o regulatorios de un sistema de producción.
- Una capa puede ejecutarse en varios proveedores y una métrica aislada puede inducir comportamientos no deseados.
- La vista 3D es ilustrativa; la vista 2D y la tabla preservan la misma información.
| Capa | Pregunta | Métrica mínima |
|---|---|---|
| Demanda | ¿Qué resultado necesita alguien? | Tareas útiles / mes |
| Orquestación | ¿Cuántas vueltas necesita? | Llamadas y tokens / tarea |
| Modelo | ¿Qué capacidad mínima funciona? | USD API / tarea |
| Operación | ¿Qué servicios sostienen el flujo? | USD y p95 / flujo |
| Aseguramiento | ¿Cómo detectamos errores? | Minutos y errores escapados |
| Resultado | ¿Se resolvió el trabajo? | USD / resultado aceptado |
06 · CALCULAR EL FLUJO
Del precio unitario al coste por resultado aceptado
El laboratorio empieza con 10,000 tareas mensuales. Cada tarea hace 2 llamadas, cada llamada usa 5,000 tokens de entrada y 1,000 de salida, y un 10% de reintentos aumenta el número facturable. La organización acepta el 90% de los resultados y revisa cada tarea durante 3 minutos a $30 por hora. Estos valores son un escenario pedagógico, no una estadística empresarial. Su propósito es mostrar la fórmula y permitir que la rompas.
Primero mueve tareas o llamadas. El coste API crece linealmente porque multiplica volumen. Después aumenta reintentos y observa que una tasa pequeña afecta todas las llamadas. Cambia el modelo para aislar la diferencia de tarifa, pero no interpretes la comparación como sustitución: el laboratorio mantiene artificialmente la misma aceptación. En una decisión real, cada candidato necesita su tasa medida y quizá diferentes minutos de revisión.
La revisión humana revela un punto que el precio por token oculta. Si un modelo más capaz cuesta más API pero reduce errores, escalamiento o minutos de inspección, puede producir un resultado más barato. También ocurre lo contrario: una capa de revisión obligatoria puede dominar tanto que optimizar centavos de inferencia apenas mueve el total. La interfaz muestra el peso de la API para que la discusión se concentre en la variable material.
El resultado clave es el cociente entre coste operativo y resultados aceptados. Aun así, no es ROI. Faltan herramientas, almacenamiento, red, soporte, implementación, impuestos, descuentos, ingresos y coste de errores escapados. Usa el campo de reflexión para escribir las métricas que medirías antes de migrar. Si no puedes nombrarlas, todavía no tienes una comparación de valor; solo una comparación de tarifa.
Laboratorio de coste por resultado aceptado
Cambia una variable cada vez. El laboratorio separa la factura del modelo del coste de revisar y conseguir resultados aceptados.
Misma carga, solo factura API
Mantiene tokens y llamadas; no supone la misma calidad ni tasa de aceptación entre modelos.
- OpenAIGPT-5.6 Sol$1,210.00
- AnthropicClaude Sonnet 5$440.00
- GoogleGemini 3.5 Flash$363.00
- xAIGrok 4.5$352.00
- DeepSeekDeepSeek V4 Pro$66.99
gasto = llamadas × tokens × tarifa + revisión humanaAbrir fórmulas, tabla equivalente, supuestos y límites
- El usuario define tareas, llamadas, tokens, reintentos, aceptación y revisión; el escenario inicial es pedagógico, no una media empresarial.
- La revisión humana se modela como minutos por tarea multiplicados por un coste horario cargado.
- La comparación de proveedores conserva exactamente la misma carga y la misma tasa de aceptación solo para aislar la factura API.
- No incluye herramientas, almacenamiento, recuperación, red, observabilidad, soporte, impuestos ni descuentos.
- La tasa de aceptación debe medirse con evaluaciones propias; mantenerla fija entre modelos no implica equivalencia.
- No predice ROI, ingresos, productividad o errores de una organización real.
| Variable | Valor inicial | Papel en la fórmula |
|---|---|---|
| Tareas | 10,000 / mes | Multiplica consumo y revisión |
| Llamadas | 2 / tarea | Multiplica tokens |
| Entrada | 5,000 / llamada | Se factura a tarifa de entrada |
| Salida | 1,000 / llamada | Se factura a tarifa de salida |
| Reintentos | 10% | Aumenta llamadas facturables |
| Aceptación | 90% | Define resultados aceptados |
| Revisión | 3 min a $30/h | Añade coste humano |
| Coste por resultado aceptado | $1.80 / resultado | $16,210 ÷ 9,000 resultados aceptados |
| Métrica | Valor | Unidad y base |
|---|---|---|
| Modelo seleccionado | OpenAI · GPT-5.6 Sol | SRC-303 |
| Tarifa de entrada | $5.00 | USD / 1M tokens de entrada |
| Tarifa de salida | $30.00 | USD / 1M tokens de salida |
| Tareas por mes | 10,000 | tareas / mes |
| Llamadas por tarea | 2 | llamadas / tarea |
| Tokens de entrada por llamada | 5,000 | tokens / llamada |
| Tokens de salida por llamada | 1,000 | tokens / llamada |
| Reintentos adicionales | 10% | % adicional sobre llamadas base |
| Resultados aceptados | 90% | % de tareas aceptadas |
| Revisión humana por tarea | 3 | min / tarea |
| Coste horario del revisor | $30.00 | USD / hora |
| llamadas facturables | 22,000 | llamadas facturables / mes |
| Factura del modelo | $1,210.00 | USD / mes |
| Revisión humana | $15,000.00 | USD / mes |
| Coste operativo del escenario | $16,210.00 | USD / mes |
| Resultados aceptados | 9,000 | resultados aceptados / mes |
| Coste por resultado aceptado | $1.80 | USD / resultado aceptado |
07 · SEGUIR LOS DATOS
ZDR no cabe en una casilla de sí o no
La entrevista acierta al desconfiar de una lectura superficial de Zero Data Retention, pero su ejemplo del botón de «me gusta» mezcla posibilidades sin distinguir productos. La documentación actual permite una explicación más precisa. OpenAI, Anthropic y Google describen controles para clientes de API o servicios pagados, pero la cobertura depende de elegibilidad, contrato, organización, endpoint, modelo, función y configuración. No debe extrapolarse automáticamente a una interfaz de consumo.
Hay que separar entrenamiento de retención. «No usamos tu contenido para entrenar por defecto» limita un propósito. ZDR busca evitar que prompts y respuestas queden almacenados en reposo después de la respuesta bajo condiciones cubiertas. Un proveedor puede ofrecer la primera restricción sin que todas sus funciones cumplan la segunda. Archivos, lotes, sesiones persistentes, ejecución, caché, feedback o monitoreo de abuso pueden tener ciclos distintos.
También existe estado de aplicación. Un sistema de respuestas puede guardar conversaciones si se lo pides; una API de archivos debe conservar el archivo para usarlo; un agente administrado necesita una sesión; una herramienta externa recibe su propia porción de datos. ZDR del modelo no borra copias en tu base de datos, observabilidad, proxy, proveedor de búsqueda o sistema de tickets. La frontera de privacidad atraviesa el flujo completo.
Los metadatos merecen una columna separada. Identificadores de cuenta, facturación, uso, latencia, errores, filtros de seguridad o direcciones de red pueden procesarse para operar el servicio aunque el contenido esté bajo controles más estrictos. Eso no vuelve inútil ZDR: lo convierte en un control concreto dentro de una arquitectura. La verificación correcta registra qué dato, quién lo procesa, dónde, con qué propósito, cuánto tiempo y bajo qué excepción.
Antes de enviar secretos, información personal o datos regulados, el equipo debe revisar contrato y configuración aplicables, minimizar contenido, aislar credenciales, limitar herramientas, definir borrado y probar logs. Este dossier es educativo y no sustituye revisión legal, seguridad o cumplimiento. Su recomendación más segura es metodológica: no confíes en el nombre del control; verifica el camino de cada dato.
Entrenamiento
¿El contenido puede usarse para mejorar modelos y cuál es el valor por defecto?
Retención de contenido
¿Prompts y respuestas se guardan, por cuánto tiempo y bajo qué excepciones?
Estado de aplicación
¿Archivos, conversaciones, lotes, caché o sesiones persisten para funcionar?
Metadatos
¿Qué datos de uso, seguridad, facturación y red se procesan aparte del contenido?
Terceros
¿Qué herramientas, nubes o integraciones reciben datos y con qué condiciones?
Tu infraestructura
¿Qué copias dejan proxies, logs, bases, colas, evaluaciones y sistemas de soporte?
08 · COMPRAR CON EVIDENCIA
Un proceso que sobrevive a la próxima bajada de precios
Los nombres de modelos y tarifas de este artículo quedarán obsoletos. Un buen proceso no. Empieza describiendo una tarea con entradas, salidas, volumen, usuarios y daño posible. Construye un conjunto de casos que incluya idioma, datos largos, errores de herramientas y situaciones raras. Define criterios antes de ejecutar: exactitud, formato, evidencia, seguridad, latencia y cuándo debe escalar a una persona.
Después ejecuta varios candidatos con configuración versionada. Registra tokens por modalidad, llamadas, herramientas, tiempo, errores, aceptación y revisión. Calcula coste por resultado aceptado y segmenta por dificultad; una media puede ocultar que el modelo económico falla en el segmento más valioso. Para tareas heterogéneas, prueba enrutamiento: un modelo barato resuelve lo rutinario y un modelo premium recibe casos difíciles o de alto riesgo.
Añade límites operativos. Presupuestos por tarea, máximos de salida, topes de iteración, timeouts, caché controlada y alertas evitan que una mejora de capacidad se convierta en consumo abierto. Repite la evaluación cuando cambian modelo, prompt, herramientas, datos o política. La fecha y el identificador exacto son parte del resultado, no detalles administrativos.
Finalmente, trata privacidad y continuidad como criterios de compra. Verifica contrato, región, retención, exportación, borrado, dependencia de funciones propietarias y plan de salida. La opción más barata por token puede salir cara si bloquea migración, carece de capacidad reservada o obliga a rehacer controles. La opción premium puede ser injustificable si no demuestra mejora en el denominador.
1 · Definir
Tarea, usuario, volumen, dato sensible y coste del error.
2 · Muestrear
Casos normales, difíciles, raros, adversariales y multilingües.
3 · Aceptar
Criterios previos de calidad, seguridad, latencia y escalamiento.
4 · Medir
Resultados, tokens, llamadas, herramientas, revisión y variabilidad.
5 · Calcular
Coste total por resultado aceptado y por segmento de riesgo.
6 · Controlar
Presupuestos, límites, observabilidad, permisos y alertas.
7 · Revalidar
Nueva prueba ante cualquier cambio de modelo, datos o flujo.
09 · VOLVER A LA ENTREVISTA
Qué queda en pie después de contrastar la tesis
La intuición central sobre presión de precios queda en pie. Existen diferencias amplias de lista y la convergencia agregada hace que más compradores puedan probar alternativas. El valor de una marca de modelo no puede descansar solo en haber llegado primero. Debe sostenerse con calidad medible, fiabilidad, funciones, distribución, seguridad, soporte o una economía total superior. La pregunta «¿por qué pagar más?» es saludable cuando obliga al proveedor a demostrar el denominador.
La cifra concreta del «barril» no queda en pie como comparación universal. Los precios oficiales actuales dependen de modelo, entrada, salida, tokenizador y condiciones. Una mezcla sin fórmula visible no puede auditarse. Tampoco queda demostrada la afirmación de que los modelos económicos conserven 80% o 95% de calidad para la mayoría de usos. Arena ofrece una señal de convergencia, no una tasa universal de sustitución.
La advertencia sobre gasto empresarial es posible, no observada en la entrevista. Una organización puede descubrir consumo no gobernado, pero también puede negociar capacidad, usar suscripciones, obtener descuentos o generar beneficios que superen el coste. El escenario correcto no es predecir sorpresas de resultados corporativos; es instalar telemetría antes de que la factura crezca: presupuesto, coste por tarea, reintentos, revisión y valor aceptado.
La tesis sobre hardware y memoria pertenece a inversión. El AI Index documenta gasto de cómputo creciente y la infraestructura puede seguir siendo escasa, pero eso no determina márgenes, múltiplos o rentabilidad de una empresa específica. Este artículo no recomienda valores ni valida que un segmento supere al mercado. Separar demanda física de retorno financiero evita que una explicación técnica se convierta en consejo implícito.
La observación sobre privacidad sí merece atención, con mejor taxonomía. ZDR es real y útil dentro de su cobertura; no es una capa mágica que controla consumidores, herramientas y copias externas. La conclusión más robusta de la entrevista no es que toda IA se vuelva una mercancía. Es que, cuando baja el coste de capacidad, la ventaja se mueve hacia diseñar, medir y gobernar el sistema que convierte esa capacidad en resultados confiables.
COMPROBAR TRANSFERENCIA
¿Puedes tomar la decisión sin la metáfora?
Responde por razonamiento. Cada explicación señala la distinción que importa en producción.
Trazabilidad
Registro de evidencia
CLM-301Chamath Palihapitiya propone llamar a 1 millón de tokens un «barril de inteligencia» y sostiene que la diferencia de precios tendrá que racionalizarse.directo
CLM-302GPT-5.6 Sol, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5 y DeepSeek V4 Pro publican tarifas separadas para entrada y salida, con reglas adicionales para caché, contexto, herramientas o lotes.triangulado
CLM-303Con 1 millón de tokens de entrada y 0.2 millones de salida, sin caché ni herramientas, el coste de lista calculado es $11.00, $4.00, $3.30, $3.20 y $0.609, respectivamente.derivado
Localizador: Derivación reproducible: precio de entrada × 1 + precio de salida × 0.2; tarifa cache miss para DeepSeek V4 Pro y tarifa promocional vigente de Claude Sonnet 5
Incertidumbre: La comparación normaliza volumen, no calidad, latencia, fiabilidad, seguridad, tokenización, disponibilidad ni coste total de una tarea.
CLM-304Un precio por token no mide la calidad de una tarea: la evaluación requiere declarar el objetivo de medición, los casos, los supuestos y la incertidumbre.triangulado
CLM-305En marzo de 2026, Anthropic 1503, xAI 1495, Google 1494 y OpenAI 1481 estaban separados por 22 puntos en Arena Elo.directo
Localizador: AI Index 2026 Technical Performance, hallazgo 2
Incertidumbre: Arena agrega preferencias humanas y su ranking puede reflejar adaptación a la plataforma; no es una evaluación de cada flujo empresarial.
Fuentes y límites: SRC-308
CLM-306La convergencia agregada aumenta la presión competitiva, pero no demuestra que un modelo barato sea intercambiable con uno premium en una tarea concreta.derivado
CLM-307El coste facturable de un agente puede incluir tokens de entrada, salida y razonamiento, lecturas o escrituras de caché, llamadas a herramientas y múltiples iteraciones.triangulado
CLM-308Reducir el precio por token no garantiza reducir el gasto total si el volumen, el contexto repetido, las iteraciones o la tasa de reintentos crecen más rápido.derivado
Localizador: Identidad aritmética reproducible del simulador: gasto = unidades facturables × tarifa; la dirección depende de ambos factores
Incertidumbre: Describe una condición matemática, no afirma que todas las empresas estén aumentando el consumo ni predice sus resultados.
CLM-309Zero Data Retention es una propiedad contractual, organizacional, de endpoint y de función; no equivale por sí sola a ausencia de metadatos, estado de aplicación o terceros.triangulado
Localizador: OpenAI, tabla de elegibilidad ZDR; Anthropic, What ZDR does not cover y Feature eligibility; Gemini, achieving zero data retention
Incertidumbre: Los contratos y configuraciones concretos prevalecen sobre la documentación general y pueden cambiar por región, producto o cuenta.
CLM-310No usar contenido para entrenamiento y no conservar contenido después de la respuesta son controles distintos; un servicio puede ofrecer uno sin garantizar automáticamente el otro.triangulado
CLM-311La compra racional de IA optimiza coste por resultado aceptado, no tokens consumidos ni una posición aislada en un leaderboard.derivado
CLM-312La entrevista plantea que el hardware y la memoria seguirán beneficiándose de la escasez, pero eso es una tesis de inversión y no una conclusión demostrada por los precios API.disputado
CLM-313La entrevista de CNBC Squawk Box fue emitida el 14 de julio de 2026 y presenta a Palihapitiya como fundador y CEO de Social Capital, CEO de 8090 y anfitrión de All-In.directo
CLM-314La comparación visual usa una carga de referencia de 1M de entrada y 0.2M de salida, una proporción ilustrativa 5:1 que no describe todas las aplicaciones.derivado
Bibliografía operativa
Fuentes y límites
- SRC-301artefacto internoEvidencia interna · no disponible públicamente
All-In podcast host Chamath Palihapitiya on the current state of AI — supplied transcript
Transcripción de la entrevista de CNBC proporcionada por el usuario · 2026-07-17
Localizador: Transcripción completa con marcas 00:01–13:18; bytes preservados y manifiestos bajo content/intake/economics-of-cheap-intelligence
Huella de integridad:
Es una transcripción automática que termina a mitad de frase; conserva las opiniones del entrevistado, pero no valida sus cifras ni sus predicciones.sha256-682881672216509ee1142c4e40163c3ccc3f6c8b9901ed944e09c0aa5f964c48 - SRC-302fuente primaria
All-In podcast host Chamath Palihapitiya on the current state of AI
CNBC Squawk Box · 2026-07-17
Localizador: Video del 14 de julio de 2026; segmentos 01:42–03:59, 05:31–08:12 y 12:13–13:18
La entrevista expresa la tesis y las analogías del invitado; sus precios mezclan modelos, proporciones de entrada/salida y posibles supuestos no declarados. - SRC-303fuente primaria
Models — OpenAI API
OpenAI · 2026-07-17
Localizador: Sección Frontier models: GPT-5.6 Sol, Terra y Luna; precios de entrada y salida por MTok
Precios de lista que pueden cambiar; no incluyen herramientas, prioridad, lotes, caché, impuestos, descuentos ni contratos privados. - SRC-304fuente primaria
Precios — Claude Platform Docs
Anthropic · 2026-07-17
Localizador: Tabla de precios de modelos, filas Claude Sonnet 5 y Claude Sonnet 4.6; secciones de caché, lotes y herramientas
La tarifa de Claude Sonnet 5 usada en el artículo es promocional hasta el 31 de agosto de 2026; la tokenización también difiere entre generaciones. - SRC-305fuente primaria
Gemini Developer API pricing
Google AI for Developers · 2026-07-17
Localizador: Secciones Gemini 3.5 Flash y Gemini 3.1 Flash-Lite; tablas Standard, Batch y Context caching
La salida incluye tokens de razonamiento; herramientas y grounding se cobran por separado y los modelos Preview pueden cambiar. - SRC-306fuente primaria
Pricing — xAI Docs
xAI Corp. · 2026-07-17
Localizador: Text API, tabla Prices per 1M tokens, fila grok-4.5; secciones de herramientas, lotes y prioridad
La tarifa cambia para contexto largo; las herramientas del servidor añaden cargos y la disponibilidad depende de la cuenta. - SRC-307fuente primaria
Models & Pricing — DeepSeek API Docs
DeepSeek · 2026-07-17
Localizador: Model Details: deepseek-v4-flash y deepseek-v4-pro; precios de cache hit, cache miss y salida
El artículo usa la tarifa cache miss de V4 Pro; el proveedor advierte que puede ajustar precios y sus métricas no hacen equivalentes los modelos. - SRC-308fuente secundaria
Technical Performance — 2026 AI Index Report
Stanford Institute for Human-Centered AI · 2026-07-17
Localizador: Hallazgos 2, 5, 7, 8 y 9: convergencia Arena, fragilidad de benchmarks e inteligencia irregular
Es una síntesis de evaluaciones heterogéneas; Arena Elo refleja preferencias agregadas y no garantiza rendimiento, seguridad o coste en una tarea empresarial. - SRC-309fuente primaria
Expanding the AI Evaluation Toolbox with Statistical Models — NIST AI 800-3
National Institute of Standards and Technology · 2026-07-17
Localizador: Resumen y contribuciones: exactitud en benchmark, exactitud generalizada, supuestos e incertidumbre
El marco mejora la interpretación estadística, pero no prescribe un benchmark, proveedor o umbral universal para cada negocio. - SRC-310fuente primaria
Data controls in the OpenAI platform
OpenAI · 2026-07-17
Localizador: Secciones Modified Abuse Monitoring y Zero Data Retention; tabla de elegibilidad y estado de aplicación
La elegibilidad exige aprobación y algunas capacidades conservan estado de aplicación incluso con ZDR; los contratos vigentes son la fuente final. - SRC-311fuente primaria
API and data retention — Claude Platform Docs
Anthropic · 2026-07-17
Localizador: Secciones How Anthropic approaches data retention, Zero data retention, What ZDR does not cover y Feature eligibility
ZDR se habilita por organización y no cubre todas las funciones, productos de consumo, interfaces o integraciones; algunos modelos exigen retención. - SRC-312fuente primaria
Zero data retention in the Gemini Developer API
Google AI for Developers · 2026-07-17
Localizador: Secciones Training restriction y Customer data retention and achieving zero data retention
Los servicios pagados restringen entrenamiento, pero lograr ZDR requiere configuraciones y evitar funciones con retención; también permanecen datos operativos. - SRC-313fuente secundaria
Economy — 2026 AI Index Report
Stanford Institute for Human-Centered AI · 2026-07-17
Localizador: Sección 4.2 Investment and Infrastructure, Figura 4.2.20, página 190 del PDF
El gasto anual de cómputo es una estimación de Epoch AI y aproxima capacidad alquilada; no demuestra rentabilidad futura de laboratorios o fabricantes.