Saltar al contenido

Cómputo de IA

¿Dónde debería ejecutarse su inferencia?

Un Mac que ya posee genera tokens al precio de la electricidad. Un nodo GPU los genera más rápido de lo que jamás lo hará un Mac. Una API en la nube los genera mejores que cualquiera de los dos. La pregunta no es cuál sale más barato. Es cuál de los tres descarta su carga de trabajo.

Precios comprobados por última vez el 2026-08-06. Los precios del hardware y de los tokens se verificaron el 2026-08-06 y cambian rápido. Apple subió los precios de toda la gama Mac el 2026-06-25, el Mac Studio M3 Ultra un 32,5 %, otros modelos en cantidades distintas, y retiró dos niveles de memoria del Mac Studio a principios de año; Anthropic sube Sonnet 5 un 50 % el 2026-09-01; el alquiler reservado de H100 subió alrededor de un 40 % desde su mínimo de octubre de 2025.

Su parque

El hardware ya está pagado. Uno de los datos de abajo es puro criterio, y lo dice.

Un equipo por persona; el Mac de cada usuario hace el trabajo enrutable de ese usuario.

El rendimiento sale de la referencia publicada a nivel de chip; el capex está hundido y nunca se cobra.

Qué hace la gente con la IA

28.000 tokens de salida por persona y día, derivados, no observados.

Parte enrutable en el dispositivo25 %

Su criterio, no un hecho: nadie publica esta cifra. Enrutable: clasificación, extracción, resumen de un documento conocido, anonimización, autocompletado. No enrutable: razonamiento frontier, análisis de contexto largo, programación agéntica.

Las tareas enrutables corresponden a un nivel barato; desplazar con ellas un precio frontier inflaría el ahorro.

Tasa de aciertos de la caché de prompts50 %

El trabajo enrutable repetitivo se cachea bien; una tasa más alta reduce la factura de API desplazada, así que es la dirección conservadora.


Ciclo de renovación

Gartner sitúa los portátiles de empresa en 3,7 años de media (2024, referido de segunda mano); los dispositivos se sustituyen a ese ritmo exista o no la IA.

El único coste de hardware recurrente de esta historia: el margen de memoria que elige en una compra que iba a ocurrir de todos modos.

El parque que ya posee

Enrutar 25 % de este trabajo en el dispositivo desplaza 11.594 US$ de gasto de API al año, sobre hardware que se compró de todos modos.

500 × MacBook Air 13" M4 (16 GB): dispositivo típico del parque · capex hundido, renovado cada 4 años en cualquier caso · la parte enrutable de 25 % es su criterio, no una medición.

Gasto de API desplazado

11.594 US$/año

frente a pagar Claude Haiku 4.5 por todo

Coste en el dispositivo

≈ 0 US$

suelo: el consumo en inferencia no está medido en este dispositivo, así que no se inventa ninguna línea de electricidad

Diferencia del ciclo de renovación

4 US$/dispositivo/mes

MacBook Air M5: 16 → 24 GB amortizado a 4 años

¿Aguanta cada equipo?

  • La parte enrutable son 7 mil tokens por persona y día, es decir unos 13 minutos de inferencia al rendimiento efectivo de 9,2 tok/s de este equipo. El techo aceptado aquí son 2 horas al día (25 % de uso sobre una jornada de 8 horas), porque los portátiles reducen frecuencia bajo carga sostenida.

  • La velocidad efectiva queda por debajo del streaming de chat cómodo (15 tok/s) una vez pagada la lectura del prompt: vale para trabajo de fondo (clasificación, anonimización, resumen), no para una ventana de chat que alguien mira. La lista enrutable es trabajo de fondo a propósito.

  • Lo que esto no es: un clúster de servicio. Los runtimes de Apple no agrupan en batch a usuarios simultáneos y un portátil sin ventilador pierde ~55 % de la potencia de su package tras 20 minutos de carga sostenida (Notebookcheck, M4 Air). Cada Mac carga con su propio usuario, nada más.

La factura anual, de tres formas

  • Todos los tokens en Claude Haiku 4.546.375 US$/año

    La base de no hacer nada.

  • Híbrido: 25 % en el dispositivo, el resto en la API34.781 US$/año

    El tramo en dispositivo se valora en un suelo no medido de 0 US$; la cifra real está por encima, en lo que resulte costar la electricidad.

  • Asistente por usuario para todo el mundo (M365 Copilot)180.000 US$/año

    30 US$/usuario/mes de catálogo, un producto distinto con un techo distinto, mostrado para dar escala.

La pregunta de la renovación

Especificar MacBook Air M5: 16 → 24 GB en la próxima renovación cuesta 4 US$/dispositivo/mes en un ciclo de 4 años, frente a 30 US$/usuario/mes por una licencia de Copilot (26 US$/mes menos). No son sustitutos: la RAM compra margen para el trabajo enrutable en el dispositivo, la licencia compra un asistente frontier. Lo que importa es la escala: todo el coste de hardware de esta historia es menor que una sola licencia por usuario.

Lo que este modelo no va a afirmar

Cada uno de estos puntos es una conclusión que las pruebas no respaldaban, y cada uno se afirma habitualmente en otros sitios.

  • Los Mac sustituyen a las API de LLM en la nube a gran escala.

    No lo hacen. Ningún caso de estudio publicado que identifique a una empresa, sobre un parque de Mac que sustituya a las API de LLM en la nube, superó la verificación. El único caso de proveedor encontrado especifica un «Mac Studio M4 Ultra», un chip que Apple nunca ha comercializado.

  • La gobernanza de la IA y la inferencia local son el mismo argumento.

    Jamf AI Governance controla las herramientas de IA en la nube que se ejecutan en Mac. Ni exige ni demuestra inferencia local. Confundirlas es la forma más rápida de perder una revisión de compras.

  • La regulación obliga a la inferencia en el dispositivo.

    Ningún regulador que hayamos encontrado lo exige. El factor forzador real más cercano es que la HHS OCR trata a los proveedores de LLM que manejan datos de salud (PHI) como «business associates», por lo que hace falta un BAA; la inferencia local evita ese trámite contractual.

  • El modelo en el dispositivo de Apple puede sustituir una licencia de asistente corporativo.

    El modelo de fundación de Apple en el dispositivo tiene unos 3.000 millones de parámetros y una ventana de contexto de 8.192 tokens. Private Cloud Compute amplía el contexto a 32k. Ninguno de los dos sustituye a Copilot.

  • Comprar un nodo 8x H100 es una compra sensata en 2026.

    Un H100 en propiedad al 100 % de carga produce tokens a unos 0,165 US$ por millón. Blackwell alquilado los produce a unos 0,081 US$ por millón. El H100 va dos generaciones por detrás de la frontera comercializada.

Cifras que no pudimos documentar

  • Tokens consumidos por trabajador del conocimiento y día

    No existe ningún dato publicado creíble. Los proveedores publican importes, licencias y tasas de crecimiento. Los valores por defecto de aquí se derivan del gasto por usuario publicado por Anthropic dividido entre un precio de modelo declarado, y se etiquetan como derivados allí donde aparecen.

  • Coste de administración de sistemas por equipo y año

    No existe ninguna cifra con fuente para un parque de Mac ni para un nodo GPU. El campo arranca en 0 US$ para que la omisión sea visible en lugar de silenciosa.

  • El valor monetario del riesgo de privacidad, residencia o cumplimiento

    Ninguno es defendible, así que la privacidad retira opciones en lugar de ponerles precio. La única excepción es el recargo de residencia en EE. UU. de Anthropic, de 1,1x sobre todas las categorías de tokens, el único precio publicado de una garantía de residencia que hemos encontrado.

  • Precios de las API de modelos open-weight (Together, Fireworks, Groq, DeepInfra)

    No investigados, y este es el comparador ausente más importante: la inferencia open-weight alojada es la referencia correcta para «¿nos lo alojamos nosotros?». Comparar en su lugar contra una API frontier favorece a la opción local.

  • Valor residual del hardware de Apple

    No investigado. El hardware local se amortiza a cero, lo que subestima el caso del Mac en lugar de favorecerlo.

  • Referencias de concurrencia para un modelo de 70B o más en cualquier Mac

    No existe ninguna con un tamaño de batch superior a uno. El rendimiento agregado se supone plano sobre la base de una medición de un modelo 9B en cuatro backends, donde MLX, llama.cpp y Ollama se mantuvieron sin cambios de una a cuatro peticiones simultáneas. Un modelo de 0,6B en un M4 Max sí escaló 3,7x de 1 a 16, así que la hipótesis de planitud procede del modelo mayor, y uno lo bastante pequeño puede comportarse de otro modo.

Cómo leer una referencia de Mac

Un hardware idéntico ejecutando un modelo idéntico varía 3× en tasa de tokens dependiendo únicamente del runtime: MLX 130, llama.cpp 89, Ollama 44 tokens/s en una comparación medida. Una cifra sin un probador con nombre, versión de runtime, cuantización, longitud de contexto y tamaño de batch no puede comprobarse y debe darse por fabricada. Un grupo de sitios publica ahora mismo tablas de aspecto preciso para un «Mac Studio M5 Max» y un «M4 Ultra», ninguno de los cuales ha comercializado Apple jamás. Cada referencia de esta página nombra a su probador, su runtime, su cuantización y su tamaño de batch, y enlaza su fuente. Cuando una fuente no reveló la longitud de contexto, la fila lo dice en lugar de inventarla, y cuando una fuente no pudo recuperarse, la referencia se eliminó en lugar de citarse.

Compilado el 2026-08-06 a partir de páginas de precios de proveedores, referencias independientes publicadas, estadísticas eléctricas de la EIA, datos de colocation de CBRE y la encuesta de centros de datos del Uptime Institute. Cada cifra lleva una fuente, una derivación declarada o el reconocimiento de que falta. Dos convenciones no son ninguna de las tres cosas: un año laboral de 250 días y una amortización a tres años del hardware local. Ambas escalan todas las cifras anuales de esta página y ambas son decisiones, no hallazgos.

De dónde sale cada cifra

Las 53 cifras que esta página puede usar, cada una con un enlace y una etiqueta que dice qué clase de prueba es. La especificación de un fabricante y la medición real de alguien no son lo mismo, así que nunca se muestran como si lo fueran. Última comprobación el 2026-08-06.

Precio de catálogo
El precio de catálogo publicado. La mayoría de los compradores negocia por debajo.
Medido
Un tercero lo midió y publicó su método.
Medido una vez
Una sola parte lo midió. Nadie lo ha replicado todavía.
Precio de distribuidor
El precio de un distribuidor, porque el fabricante no publica ninguno.
Hipótesis nuestra
Una convención que elegimos, no un hallazgo. Cámbiela si la suya es distinta.
Estadística oficial
Una serie estadística pública u oficial.
Tarifa de alquiler
Una tarifa de alquiler por hora publicada.
Cálculo nuestro
Nuestro propio cálculo sobre datos con fuente. Se muestra la operación.

Valide sus cifras con un experto en parques Apple

30 minutos con un consultor Apple: hipótesis puestas a prueba, riesgos de despliegue sobre el mapa y los siguientes pasos en la mano. Gratis y sin discurso comercial.