Cómputo de IA
¿Dónde debería ejecutarse su inferencia?
Un Mac que ya posee genera tokens al precio de la electricidad. Un nodo GPU los genera más rápido de lo que jamás lo hará un Mac. Una API en la nube los genera mejores que cualquiera de los dos. La pregunta no es cuál sale más barato. Es cuál de los tres descarta su carga de trabajo.
Precios comprobados por última vez el 2026-08-06. Los precios del hardware y de los tokens se verificaron el 2026-08-06 y cambian rápido. Apple subió los precios de toda la gama Mac el 2026-06-25, el Mac Studio M3 Ultra un 32,5 %, otros modelos en cantidades distintas, y retiró dos niveles de memoria del Mac Studio a principios de año; Anthropic sube Sonnet 5 un 50 % el 2026-09-01; el alquiler reservado de H100 subió alrededor de un 40 % desde su mínimo de octubre de 2025.
Su parque
El hardware ya está pagado. Uno de los datos de abajo es puro criterio, y lo dice.
Un equipo por persona; el Mac de cada usuario hace el trabajo enrutable de ese usuario.
El rendimiento sale de la referencia publicada a nivel de chip; el capex está hundido y nunca se cobra.
28.000 tokens de salida por persona y día, derivados, no observados.
Su criterio, no un hecho: nadie publica esta cifra. Enrutable: clasificación, extracción, resumen de un documento conocido, anonimización, autocompletado. No enrutable: razonamiento frontier, análisis de contexto largo, programación agéntica.
Las tareas enrutables corresponden a un nivel barato; desplazar con ellas un precio frontier inflaría el ahorro.
El trabajo enrutable repetitivo se cachea bien; una tasa más alta reduce la factura de API desplazada, así que es la dirección conservadora.
Gartner sitúa los portátiles de empresa en 3,7 años de media (2024, referido de segunda mano); los dispositivos se sustituyen a ese ritmo exista o no la IA.
El único coste de hardware recurrente de esta historia: el margen de memoria que elige en una compra que iba a ocurrir de todos modos.
El parque que ya posee
Enrutar 25 % de este trabajo en el dispositivo desplaza 11.594 US$ de gasto de API al año, sobre hardware que se compró de todos modos.
500 × MacBook Air 13" M4 (16 GB): dispositivo típico del parque · capex hundido, renovado cada 4 años en cualquier caso · la parte enrutable de 25 % es su criterio, no una medición.
Gasto de API desplazado
11.594 US$/año
frente a pagar Claude Haiku 4.5 por todo
Coste en el dispositivo
≈ 0 US$
suelo: el consumo en inferencia no está medido en este dispositivo, así que no se inventa ninguna línea de electricidad
Diferencia del ciclo de renovación
4 US$/dispositivo/mes
MacBook Air M5: 16 → 24 GB amortizado a 4 años
¿Aguanta cada equipo?
La parte enrutable son 7 mil tokens por persona y día, es decir unos 13 minutos de inferencia al rendimiento efectivo de 9,2 tok/s de este equipo. El techo aceptado aquí son 2 horas al día (25 % de uso sobre una jornada de 8 horas), porque los portátiles reducen frecuencia bajo carga sostenida.
La velocidad efectiva queda por debajo del streaming de chat cómodo (15 tok/s) una vez pagada la lectura del prompt: vale para trabajo de fondo (clasificación, anonimización, resumen), no para una ventana de chat que alguien mira. La lista enrutable es trabajo de fondo a propósito.
Lo que esto no es: un clúster de servicio. Los runtimes de Apple no agrupan en batch a usuarios simultáneos y un portátil sin ventilador pierde ~55 % de la potencia de su package tras 20 minutos de carga sostenida (Notebookcheck, M4 Air). Cada Mac carga con su propio usuario, nada más.
La factura anual, de tres formas
- Todos los tokens en Claude Haiku 4.546.375 US$/año
La base de no hacer nada.
- Híbrido: 25 % en el dispositivo, el resto en la API34.781 US$/año
El tramo en dispositivo se valora en un suelo no medido de 0 US$; la cifra real está por encima, en lo que resulte costar la electricidad.
- Asistente por usuario para todo el mundo (M365 Copilot)180.000 US$/año
30 US$/usuario/mes de catálogo, un producto distinto con un techo distinto, mostrado para dar escala.
La pregunta de la renovación
Especificar MacBook Air M5: 16 → 24 GB en la próxima renovación cuesta 4 US$/dispositivo/mes en un ciclo de 4 años, frente a 30 US$/usuario/mes por una licencia de Copilot (26 US$/mes menos). No son sustitutos: la RAM compra margen para el trabajo enrutable en el dispositivo, la licencia compra un asistente frontier. Lo que importa es la escala: todo el coste de hardware de esta historia es menor que una sola licencia por usuario.
Su carga de trabajo
Tres de estos datos no tienen ningún valor por defecto publicado. Cuando se ofrece uno, se indica de dónde sale.
170.000 tokens de salida por persona y día. Derivado, no observado: nadie publica tokens por trabajador, así que esto es la documentación de Anthropic Claude Code (215 US$ al mes, caso típico) dividido por un precio de modelo indicado.
Dos mediciones primarias discrepan en un factor de 4×: 15:1 sobre 100 billones de tokens de OpenRouter, 69,7:1 en una traza de producción de Microsoft. Este es el mando que decide si el hardware local aguanta, porque cada token generado espera primero a que se lea el prompt.
La entrada cacheada cuesta una décima parte de la entrada fresca. Más palanca sobre la factura que la elección del modelo.
No los usuarios totales, sino cuántos están a mitad de una petición en el mismo instante. Esto limita antes que el volumen en todas las opciones locales.
Solo equipos pedibles en agosto de 2026. Los Mac Studio de 512 GB y 256 GB se retiraron este año; un M5 Ultra no existe.
Solo clases con una referencia publicada en este equipo. Un par que nadie ha medido no se modeliza.
Cuando una fuente publicó más de una longitud de contexto, se usa la medición más cercana: el mismo equipo y el mismo modelo pasan de 1325 tok/s de procesado de prompt y 87,9 de generación con 4k, a 2537 y 64,5 con 32k.
La misma clase de modelo que ejecutaría en local, alquilada por token. Esta es la prueba honesta de «¿nos lo alojamos nosotros?», y la que la mayoría de las comparaciones se salta.
A qué velocidad llegan los tokens de cada usuario en GPU. Exigir 91 en lugar de 53 cuesta 4,8× el rendimiento sobre el mismo silicio: lo rápido que se siente y lo que cuesta son el mismo mando.
Se aplica como veto, no como sobreprecio. No existe ningún valor monetario defendible de la privacidad, así que no se inventa ninguno.
No existe ninguna cifra con fuente ni para un parque de Mac ni para un nodo GPU, así que esto arranca en 0 US$, un cero explícito que usted acepta, no un cero silencioso.
Cómo funciona esta página
Cuatro pasos, en este orden. La respuesta suele decidirse en el paso dos, antes siquiera de llegar al coste.
1. Quién pregunta, y cuánto
Cuántas personas usan IA, para qué la usan y cuántas están a mitad de una petición en el mismo instante. Esto último importa más que el total, y es la cifra que la mayoría de las comparaciones deja fuera.
2. ¿Puede el equipo hacerlo realmente?
Dos comprobaciones, ambas antes de hablar de dinero. ¿Cabe el modelo físicamente en la memoria del equipo? Y una vez en marcha, ¿sigue siendo lo bastante rápido para leerlo con comodidad cuando todo el mundo lo usa a la vez?
3. Lo que cuesta cada opción
Cinco formas de comprar lo mismo, una API en la nube, una licencia por persona, hardware en los escritorios, GPU alquiladas o un servidor GPU en propiedad, todas reducidas a una sola cifra: lo que cuesta un millón de palabras generadas.
4. Lo que no tiene permitido hacer
Si sus datos no pueden ir a un tercero, algunas opciones no son caras, no están disponibles. Esas se retiran antes de poner precio a nada, porque una norma no es una línea de factura.
Tres palabras que conviene conocer
- Tokens: la unidad en la que se factura todo
- Aproximadamente tres cuartos de una palabra. Un millón de tokens de salida son unas 750.000 palabras, una novela decente, o unas pocas semanas de uso de IA de una persona muy activa.
- Leer y escribir: dos velocidades distintas
- Un modelo lee su pregunta antes de escribir una respuesta, y ambas cosas ocurren a velocidades muy distintas. La mayoría de las comparaciones cita solo la velocidad de escritura, y por eso el hardware local parece casi el doble de capaz de lo que es. (Los términos técnicos son prefill y decode.)
- Al mismo tiempo: lo que separa a un Mac de una GPU
- Una tarjeta gráfica atiende a muchas personas a la vez y se vuelve más eficiente al hacerlo. Un Mac no: su velocidad total se mantiene más o menos igual haya quien haya esperando, así que se la reparten. Cuatro personas en un mismo Mac reciben una cuarta parte cada una. Esa única diferencia decide la mayoría de estas comparaciones.
Con estos datos
API en la nube: gpt-oss-120B hosted (median provider)
2869 US$ al año · 2,70 US$ por millón de tokens de salida · le sigue Capacidad H100 alquilada con 5060 US$ (1,8×)
Nadie ha medido el consumo de este equipo bajo inferencia, así que su línea de energía falta en lugar de ser cero. La cifra de arriba es un suelo.
Poseer el nodo GPU solo gana al alquiler por encima de 64 % de utilización sostenida, mantenida durante años. Esta demanda usa 12,7 % de lo que el parque podría producir. Con estas cifras, alquile.
Ordenado por coste anual entre las opciones que superan las barreras de memoria, concurrencia, viabilidad y privacidad.
Las dos barreras
Ambas se evalúan antes que el coste, y ambas deciden la respuesta por sí solas con frecuencia.
1. ¿Cabe el modelo en la memoria?
Cabe con 30,8 GB de margen.
2. ¿Sigue siendo legible en el pico?
El rendimiento agregado de Apple se mantiene plano a medida que se añaden usuarios, medido en MLX, llama.cpp y Ollama, todos sin cambios de una a cuatro peticiones simultáneas. Los usuarios se reparten la producción de un equipo en lugar de tener cada uno la suya. Un equipo sostiene a 2 usuarios por encima del suelo, así que sostener 5 exige 3; esa es la cantidad con precio más abajo, no una descalificación.
Por qué la segunda cifra es menor que la primera
Cada token generado espera a que primero se lea el prompt, así que la velocidad que importa es 1 / (R / prefill + 1 / decode). Con 15 a 1 en este equipo, leer el prompt consume 50 % de su tiempo, de modo que citar solo la velocidad de decode sobreestimaría la capacidad en 2,0×. El procesado del prompt está limitado por cómputo y es donde Apple silicon es estructuralmente más débil: sobre el mismo MoE de 120B, un DGX Spark hace el prefill más rápido de lo que decodifica en relación con el hardware de Apple, y por eso una carga con muchos prompts puede favorecer a un equipo que parece más lento en la tasa de tokens de portada.
Referencia: 87,9 tok/s en decode, 1325 tok/s en prefill · batch 1 · mlx_lm · 4096 de contexto · hardware-corner M5 Max local LLM benchmarks
Coste de un millón de tokens de salida
1062,5 M tokens de salida + 15,9 mil M de entrada al añoLas barras son logarítmicas: la dispersión aquí abarca cuatro órdenes de magnitud y una escala lineal la ocultaría.
- API en la nube: gpt-oss-120B alojado (mediana de proveedores)2,70 US$2869 US$/año
0,14 US$ de entrada / 0,6 US$ de salida por millón
- Por usuario: Microsoft 365 Copilot8,47 US$9000 US$/año
30 US$/usuario/mes x 25 personas
- MacBook Pro 16" M5 Max (128 GB, configuración máxima) x 412,74 US$13.532 US$/año
4 equipos a lo largo de 3 años a 10.149 US$ cada uno · energía no medida en este equipo, así que esto es un suelo
- Capacidad H100 alquilada4,76 US$5060 US$/año
1 GPU reservada 2000 horas al año a 2,53 US$/h, paga por tenerlas disponibles y no solo mientras generan · su concurrencia llena 18 % del batch que podrían ejecutar
- Nodo 8x H100 en propiedad107 US$114.177 US$/año
Amortización, energía y colocation; esta demanda usa 12,7 % de lo que el parque puede producir
Punto de equilibrio frente a gpt-oss-120B alojado (mediana de proveedores)
Esta API ya cuesta menos por token que ejecutar el modelo en local. No hay nada que amortizar.
Comprar o alquilar las GPU
64 %de utilización sostenida
Por debajo de esto, gana alquilar. Poseer un nodo H100 también tiene que superar una segunda barrera que hoy no supera: el Blackwell alquilado produce tokens por aproximadamente la mitad de lo que cuesta un H100 en propiedad a carga perfecta, aunque el suministro de Blackwell se describe como extremadamente limitado, de modo que esa tarifa puede no ser alcanzable en volumen.
Lo que este modelo no va a afirmar
Cada uno de estos puntos es una conclusión que las pruebas no respaldaban, y cada uno se afirma habitualmente en otros sitios.
Los Mac sustituyen a las API de LLM en la nube a gran escala.
No lo hacen. Ningún caso de estudio publicado que identifique a una empresa, sobre un parque de Mac que sustituya a las API de LLM en la nube, superó la verificación. El único caso de proveedor encontrado especifica un «Mac Studio M4 Ultra», un chip que Apple nunca ha comercializado.
La gobernanza de la IA y la inferencia local son el mismo argumento.
Jamf AI Governance controla las herramientas de IA en la nube que se ejecutan en Mac. Ni exige ni demuestra inferencia local. Confundirlas es la forma más rápida de perder una revisión de compras.
La regulación obliga a la inferencia en el dispositivo.
Ningún regulador que hayamos encontrado lo exige. El factor forzador real más cercano es que la HHS OCR trata a los proveedores de LLM que manejan datos de salud (PHI) como «business associates», por lo que hace falta un BAA; la inferencia local evita ese trámite contractual.
El modelo en el dispositivo de Apple puede sustituir una licencia de asistente corporativo.
El modelo de fundación de Apple en el dispositivo tiene unos 3.000 millones de parámetros y una ventana de contexto de 8.192 tokens. Private Cloud Compute amplía el contexto a 32k. Ninguno de los dos sustituye a Copilot.
Comprar un nodo 8x H100 es una compra sensata en 2026.
Un H100 en propiedad al 100 % de carga produce tokens a unos 0,165 US$ por millón. Blackwell alquilado los produce a unos 0,081 US$ por millón. El H100 va dos generaciones por detrás de la frontera comercializada.
Cifras que no pudimos documentar
Tokens consumidos por trabajador del conocimiento y día
No existe ningún dato publicado creíble. Los proveedores publican importes, licencias y tasas de crecimiento. Los valores por defecto de aquí se derivan del gasto por usuario publicado por Anthropic dividido entre un precio de modelo declarado, y se etiquetan como derivados allí donde aparecen.
Coste de administración de sistemas por equipo y año
No existe ninguna cifra con fuente para un parque de Mac ni para un nodo GPU. El campo arranca en 0 US$ para que la omisión sea visible en lugar de silenciosa.
El valor monetario del riesgo de privacidad, residencia o cumplimiento
Ninguno es defendible, así que la privacidad retira opciones en lugar de ponerles precio. La única excepción es el recargo de residencia en EE. UU. de Anthropic, de 1,1x sobre todas las categorías de tokens, el único precio publicado de una garantía de residencia que hemos encontrado.
Precios de las API de modelos open-weight (Together, Fireworks, Groq, DeepInfra)
No investigados, y este es el comparador ausente más importante: la inferencia open-weight alojada es la referencia correcta para «¿nos lo alojamos nosotros?». Comparar en su lugar contra una API frontier favorece a la opción local.
Valor residual del hardware de Apple
No investigado. El hardware local se amortiza a cero, lo que subestima el caso del Mac en lugar de favorecerlo.
Referencias de concurrencia para un modelo de 70B o más en cualquier Mac
No existe ninguna con un tamaño de batch superior a uno. El rendimiento agregado se supone plano sobre la base de una medición de un modelo 9B en cuatro backends, donde MLX, llama.cpp y Ollama se mantuvieron sin cambios de una a cuatro peticiones simultáneas. Un modelo de 0,6B en un M4 Max sí escaló 3,7x de 1 a 16, así que la hipótesis de planitud procede del modelo mayor, y uno lo bastante pequeño puede comportarse de otro modo.
Cómo leer una referencia de Mac
Un hardware idéntico ejecutando un modelo idéntico varía 3× en tasa de tokens dependiendo únicamente del runtime: MLX 130, llama.cpp 89, Ollama 44 tokens/s en una comparación medida. Una cifra sin un probador con nombre, versión de runtime, cuantización, longitud de contexto y tamaño de batch no puede comprobarse y debe darse por fabricada. Un grupo de sitios publica ahora mismo tablas de aspecto preciso para un «Mac Studio M5 Max» y un «M4 Ultra», ninguno de los cuales ha comercializado Apple jamás. Cada referencia de esta página nombra a su probador, su runtime, su cuantización y su tamaño de batch, y enlaza su fuente. Cuando una fuente no reveló la longitud de contexto, la fila lo dice en lugar de inventarla, y cuando una fuente no pudo recuperarse, la referencia se eliminó en lugar de citarse.
Compilado el 2026-08-06 a partir de páginas de precios de proveedores, referencias independientes publicadas, estadísticas eléctricas de la EIA, datos de colocation de CBRE y la encuesta de centros de datos del Uptime Institute. Cada cifra lleva una fuente, una derivación declarada o el reconocimiento de que falta. Dos convenciones no son ninguna de las tres cosas: un año laboral de 250 días y una amortización a tres años del hardware local. Ambas escalan todas las cifras anuales de esta página y ambas son decisiones, no hallazgos.
De dónde sale cada cifra
Las 53 cifras que esta página puede usar, cada una con un enlace y una etiqueta que dice qué clase de prueba es. La especificación de un fabricante y la medición real de alguien no son lo mismo, así que nunca se muestran como si lo fueran. Última comprobación el 2026-08-06.
- Precio de catálogo
- El precio de catálogo publicado. La mayoría de los compradores negocia por debajo.
- Medido
- Un tercero lo midió y publicó su método.
- Medido una vez
- Una sola parte lo midió. Nadie lo ha replicado todavía.
- Precio de distribuidor
- El precio de un distribuidor, porque el fabricante no publica ninguno.
- Hipótesis nuestra
- Una convención que elegimos, no un hallazgo. Cámbiela si la suya es distinta.
- Estadística oficial
- Una serie estadística pública u oficial.
- Tarifa de alquiler
- Una tarifa de alquiler por hora publicada.
- Cálculo nuestro
- Nuestro propio cálculo sobre datos con fuente. Se muestra la operación.
Valide sus cifras con un experto en parques Apple
30 minutos con un consultor Apple: hipótesis puestas a prueba, riesgos de despliegue sobre el mapa y los siguientes pasos en la mano. Gratis y sin discurso comercial.