Calcul IA
Où faire tourner votre inférence ?
Un Mac que vous possédez déjà produit des tokens au prix de l’électricité. Un nœud GPU en produit plus vite que n’importe quel Mac ne le fera jamais. Une API cloud en produit de meilleurs que les deux. La question n’est pas de savoir lequel coûte le moins cher. C’est de savoir lequel des trois votre charge de travail disqualifie.
Prix vérifiés pour la dernière fois le 2026-08-06. Les prix du matériel et des tokens ont été vérifiés le 2026-08-06 et évoluent vite. Apple a relevé ses prix sur toute la gamme Mac le 2026-06-25, le Mac Studio M3 Ultra de 32,5 %, les autres modèles de montants différents, et a retiré deux paliers de mémoire du Mac Studio plus tôt dans l’année ; Anthropic relève Sonnet 5 de 50 % le 2026-09-01 ; la location réservée de H100 a augmenté d’environ 40 % par rapport à son point bas d’octobre 2025.
Votre parc
Le matériel est déjà payé. Un des paramètres ci-dessous relève du pur jugement, et il le dit.
Une machine par personne ; le Mac de chaque utilisateur traite le travail routable de cet utilisateur.
Le débit vient du benchmark publié au niveau de la puce ; le capex est irrécupérable et n’est jamais facturé.
28 000 tokens de sortie par personne et par jour, dérivés et non observés.
Votre jugement, pas un fait : personne ne publie ce chiffre. Routable : classification, extraction, résumé d’un document connu, caviardage, autocomplétion. Non routable : raisonnement frontier, analyse à contexte long, codage agentique.
Les tâches routables relèvent d’un palier bon marché ; déplacer un prix frontier avec elles gonflerait l’économie.
Le travail routable répétitif se met bien en cache ; un taux plus élevé réduit la facture d’API déplacée, c’est donc le sens conservateur.
Gartner situe les ordinateurs portables d’entreprise à 3,7 ans en moyenne (2024, rapporté de seconde main) ; les appareils sont remplacés à ce rythme, que l’IA existe ou non.
Le seul coût matériel récurrent de cette histoire : la marge mémoire que vous choisissez lors d’un achat qui avait lieu de toute façon.
Le parc que vous possédez déjà
Router 25 % de ce travail sur l’appareil déplace 11 594 $US de dépenses d’API par an, sur du matériel acheté de toute façon.
500 × MacBook Air 13″ M4 (16 Go) : appareil type du parc · capex irrécupérable, renouvelé tous les 4 ans quoi qu’il arrive · la part routable de 25 % relève de votre jugement, pas d’une mesure.
Dépenses d’API déplacées
11 594 $US/an
contre payer Claude Haiku 4.5 pour la totalité
Coût sur l’appareil
≈ 0 $US
plancher : la consommation en inférence n’est pas mesurée sur cet appareil, aucune ligne d’électricité n’est donc inventée
Écart de cycle de renouvellement
4 $US/appareil/mois
MacBook Air M5 : 16 → 24 Go amorti sur 4 ans
Chaque machine suit-elle ?
La part routable représente 7 k tokens par personne et par jour, soit environ 13 minutes d’inférence au débit effectif de 9,2 tok/s de cette machine. Le plafond accepté ici est de 2 heures par jour (25 % de charge sur une journée de 8 heures), parce que les portables brident leur fréquence sous charge soutenue.
Le débit effectif est sous le streaming de chat confortable (15 tok/s) une fois la lecture du prompt payée : correct pour du travail de fond (classification, caviardage, résumé), inadapté à une fenêtre de chat que quelqu’un regarde. La liste routable est du travail de fond, délibérément.
Ce que ce n’est pas : un cluster de service. Les runtimes Apple ne regroupent pas les utilisateurs simultanés en batch et un portable sans ventilateur perd ~55 % de la puissance de son package après 20 minutes de charge soutenue (Notebookcheck, M4 Air). Chaque Mac porte son propre utilisateur, rien de plus.
La facture annuelle, de trois façons
- Tous les tokens sur Claude Haiku 4.546 375 $US/an
Le scénario de référence : ne rien faire.
- Hybride : 25 % sur l’appareil, le reste sur l’API34 781 $US/an
Le volet sur l’appareil est chiffré à un plancher non mesuré de 0 $US ; le vrai chiffre est au-dessus, de ce que l’électricité se révélera coûter.
- Assistant par utilisateur pour tout le monde (M365 Copilot)180 000 $US/an
30 $US/utilisateur/mois au prix catalogue, un produit différent avec un plafond différent, montré pour l’échelle.
La question du renouvellement
Spécifier MacBook Air M5 : 16 → 24 Go au prochain renouvellement coûte 4 $US/appareil/mois sur un cycle de 4 ans, contre 30 $US/utilisateur/mois pour un siège Copilot (26 $US/mois de moins). Ce ne sont pas des substituts : la RAM achète de la marge pour le travail routable sur l’appareil, le siège achète un assistant frontier. Le propos est l’échelle : tout le coût matériel de cette histoire est inférieur à une seule licence par utilisateur.
Votre charge de travail
Trois de ces paramètres n’ont aucune valeur par défaut publiée. Lorsqu’une valeur est proposée, elle dit d’où elle vient.
170 000 tokens de sortie par personne et par jour. Dérivé, non observé : personne ne publie de tokens par travailleur, il s’agit donc de la documentation Anthropic Claude Code (215 $US par mois, cas typique) divisé par un prix de modèle indiqué.
Deux mesures primaires divergent d’un facteur 4× : 15 : 1 sur 100 000 milliards de tokens OpenRouter, 69,7 : 1 dans une trace de production Microsoft. C’est le curseur qui décide si le matériel local suit, parce que chaque token produit attend d’abord que le prompt soit lu.
L’entrée mise en cache coûte un dixième de l’entrée fraîche. Un levier plus fort sur la facture que le choix du modèle.
Pas le nombre total d’utilisateurs, mais combien sont en cours de requête au même moment. C’est cette contrainte qui bloque avant le volume sur toutes les options locales.
Uniquement des machines commandables en août 2026. Les Mac Studio 512 Go et 256 Go ont été retirés cette année ; un M5 Ultra n’existe pas.
Uniquement les classes disposant d’un benchmark publié sur cette machine. Un couple que personne n’a mesuré n’est pas modélisé.
Lorsqu’une source a publié plusieurs longueurs de contexte, la mesure la plus proche est retenue : la même machine et le même modèle passent de 1 325 tok/s de traitement du prompt et 87,9 de génération à 4k, à 2 537 et 64,5 à 32k.
La même classe de modèle que celle que vous feriez tourner en local, louée au token. C’est le test honnête du « faut-il héberger nous-mêmes », et celui que la plupart des comparaisons évitent.
À quelle vitesse arrivent les tokens de chaque utilisateur sur GPU. Exiger 91 au lieu de 53 coûte 4,8× le débit sur un silicium identique : la vitesse ressentie et le coût sont le même curseur.
Appliquée comme un veto, pas comme une prime. Aucune valeur monétaire défendable de la confidentialité n’existe, aucune n’est donc inventée.
Aucun chiffre sourcé n’existe pour un parc de Mac ni pour un nœud GPU ; ce champ démarre donc à 0 $US, un zéro explicite que vous acceptez, pas un zéro silencieux.
Comment fonctionne cette page
Quatre étapes, dans cet ordre. La réponse se décide généralement à l’étape deux, avant même d’arriver au coût.
1. Qui demande, et combien
Combien de personnes utilisent l’IA, pour quoi, et combien sont en cours de requête au même moment. Ce dernier chiffre compte plus que le total, et c’est celui que la plupart des comparaisons omettent.
2. La machine en est-elle vraiment capable ?
Deux vérifications, toutes deux avant qu’il soit question d’argent. Le modèle tient-il physiquement dans la mémoire de la machine ? Et une fois lancé, reste-t-il assez rapide pour être lu confortablement quand tout le monde s’en sert en même temps ?
3. Ce que coûte chaque option
Cinq façons d’acheter la même chose, une API cloud, une licence par personne, du matériel sur les bureaux, des GPU loués ou un serveur GPU qui vous appartient, toutes ramenées à un seul chiffre : ce que coûte un million de mots produits.
4. Ce que vous n’avez pas le droit de faire
Si vos données ne peuvent pas partir chez un tiers, certaines options ne sont pas chères, elles sont indisponibles. Celles-là sont retirées avant tout chiffrage, parce qu’une règle n’est pas une ligne de facture.
Trois mots à connaître
- Tokens : l’unité dans laquelle tout est facturé
- Environ trois quarts d’un mot. Un million de tokens de sortie, c’est à peu près 750 000 mots, un roman correct, ou quelques semaines d’usage de l’IA pour une personne très active.
- Lire et écrire : deux vitesses différentes
- Un modèle lit votre question avant d’écrire une réponse, et les deux se produisent à des vitesses très différentes. La plupart des comparaisons ne citent que la vitesse d’écriture, ce qui fait paraître le matériel local environ deux fois plus capable qu’il ne l’est. (Les termes techniques sont prefill et decode.)
- En même temps : ce qui sépare un Mac d’un GPU
- Une carte graphique sert plusieurs personnes à la fois et devient plus efficace en le faisant. Un Mac non : sa vitesse totale reste à peu près la même quel que soit le nombre de personnes en attente, elles se la partagent donc. Quatre personnes sur un même Mac obtiennent chacune un quart. Cette seule différence décide la plupart de ces comparaisons.
Avec ces paramètres
API cloud : gpt-oss-120B hosted (median provider)
2 869 $US par an · 2,70 $US par million de tokens de sortie · vient ensuite Capacité H100 louée à 5 060 $US (1,8×)
Personne n’a mesuré la consommation de cette machine en inférence, sa ligne énergie est donc absente plutôt que nulle. Le chiffre ci-dessus est un plancher.
Posséder le nœud GPU ne bat la location qu’au-delà de 64 % d’utilisation soutenue, tenue pendant des années. Cette demande utilise 12,7 % de ce que le parc pourrait produire. Avec ces chiffres, louez.
Classement au coût annuel parmi les options qui passent les verrous de mémoire, de simultanéité, de faisabilité et de confidentialité.
Les deux verrous
Les deux sont évalués avant le coût, et les deux décident régulièrement la réponse à eux seuls.
1. Le modèle tient-il en mémoire ?
Tient avec 30,8 Go de marge.
2. Reste-t-il lisible en pointe ?
Le débit agrégé d’Apple reste plat à mesure que des utilisateurs s’ajoutent, mesuré sur MLX, llama.cpp et Ollama, tous inchangés d’une à quatre requêtes simultanées. Les utilisateurs se partagent donc la production d’une machine au lieu d’avoir chacun la sienne. Une machine porte 2 utilisateurs au-dessus du plancher ; en tenir 5 en demande donc 3, c’est la quantité chiffrée plus bas, pas une disqualification.
Pourquoi le second chiffre est plus bas que le premier
Chaque token produit attend d’abord que le prompt soit lu ; le débit qui compte est donc 1 / (R / prefill + 1 / decode). À 15 pour 1 sur cette machine, la lecture du prompt consomme 50 % de son temps ; citer le seul débit de decode surestimerait donc la capacité d’un facteur 2,0×. Le traitement du prompt est limité par le calcul, et c’est là qu’Apple silicon est structurellement le plus faible : sur le même MoE de 120B, un DGX Spark fait son prefill plus vite qu’il ne décode, relativement au matériel Apple, ce qui explique qu’une charge riche en prompts puisse favoriser une machine qui paraît plus lente sur le débit de tokens affiché.
Benchmark : 87,9 tok/s en decode, 1 325 tok/s en prefill · batch 1 · mlx_lm · 4 096 de contexte · hardware-corner M5 Max local LLM benchmarks
Coût d’un million de tokens de sortie
1,1 Md tokens de sortie + 15,9 Md tokens d’entrée par anLes barres sont logarithmiques : l’écart couvre ici quatre ordres de grandeur et une échelle linéaire le masquerait.
- API cloud : gpt-oss-120B hébergé (médiane des fournisseurs)2,70 $US2 869 $US/an
0,14 $US en entrée / 0,6 $US en sortie par million
- Par utilisateur : Microsoft 365 Copilot8,47 $US9 000 $US/an
30 $US/utilisateur/mois x 25 personnes
- MacBook Pro 16″ M5 Max (128 Go, configuration maximale) x 412,74 $US13 532 $US/an
4 machines sur 3 ans à 10 149 $US pièce · énergie non mesurée sur cette machine, ce chiffre est donc un plancher
- Capacité H100 louée4,76 $US5 060 $US/an
1 GPU retenu 2 000 heures par an à 2,53 $US/h, vous payez leur disponibilité et pas seulement leur production · votre simultanéité remplit 18 % du batch qu’ils pourraient traiter
- Nœud 8x H100 en propre107 $US114 177 $US/an
Amortissement, énergie et colocation ; cette demande utilise 12,7 % de ce que le parc peut produire
Seuil de rentabilité face à gpt-oss-120B hébergé (médiane des fournisseurs)
Cette API coûte déjà moins par token que faire tourner le modèle en local. Il n’y a rien à amortir.
Acheter ou louer les GPU
64 %d’utilisation soutenue
En dessous, la location l’emporte. Posséder un nœud H100 doit aussi franchir une seconde barre qu’il échoue aujourd’hui : du Blackwell loué produit les tokens pour environ la moitié du coût d’un H100 en propre à charge parfaite, même si l’approvisionnement en Blackwell est décrit comme extrêmement limité, de sorte que ce tarif peut ne pas être obtenable en volume.
Ce que ce modèle refuse d’affirmer
Chacun de ces points est une conclusion que les preuves n’étayaient pas, et chacun est pourtant affirmé couramment ailleurs.
Les Mac remplacent les API LLM cloud à grande échelle.
Non. Aucune étude de cas publiée nommant une entreprise, sur un parc de Mac remplaçant des API LLM cloud, n’a survécu à la vérification. La seule étude de cas éditeur trouvée précise un « Mac Studio M4 Ultra », une puce qu’Apple n’a jamais commercialisée.
La gouvernance de l’IA et l’inférence locale sont le même argument.
Jamf AI Governance encadre les outils d’IA cloud qui tournent sur des Mac. Cela n’exige ni ne prouve une inférence locale. Confondre les deux est le moyen le plus rapide de perdre une revue d’achat.
La réglementation impose l’inférence sur l’appareil.
Aucun régulateur trouvé ne l’exige. Le déclencheur réel le plus proche est que le HHS OCR traite les fournisseurs de LLM manipulant des données de santé (PHI) comme des « business associates », ce qui impose un BAA ; l’inférence locale contourne cet exercice contractuel.
Le modèle sur appareil d’Apple peut remplacer un poste d’assistant d’entreprise.
Le modèle de fondation Apple sur appareil compte environ 3 milliards de paramètres, avec une fenêtre de contexte de 8 192 tokens. Private Cloud Compute porte le contexte à 32k. Ni l’un ni l’autre n’est un substitut à Copilot.
Acheter un nœud 8x H100 est un achat sensé en 2026.
Un H100 en propre à 100 % de charge produit des tokens à environ 0,165 $US le million. Du Blackwell loué en produit à environ 0,081 $US le million. Le H100 a deux générations de retard sur la frontière commercialisée.
Chiffres que nous n’avons pas pu sourcer
Tokens consommés par travailleur du savoir et par jour
Aucune donnée publiée crédible n’existe. Les éditeurs publient des montants, des sièges et des taux de croissance. Les valeurs par défaut retenues ici sont dérivées de la dépense par utilisateur publiée par Anthropic, divisée par un prix de modèle indiqué, et sont signalées comme dérivées partout où elles apparaissent.
Coût d’administration système par machine et par an
Aucun chiffre sourcé n’existe pour un parc de Mac ni pour un nœud GPU. Le champ démarre à 0 $US pour que l’omission soit visible plutôt que silencieuse.
La valeur monétaire du risque de confidentialité, de résidence ou de conformité
Aucune n’est défendable ; la confidentialité retire donc des options au lieu de les valoriser. Seule exception : la surcharge de résidence américaine d’Anthropic, de 1,1x sur chaque catégorie de tokens, le seul prix publié pour une garantie de résidence que nous ayons trouvé.
Prix des API de modèles open-weight (Together, Fireworks, Groq, DeepInfra)
Non étudiés, et c’est le comparateur manquant le plus important : l’inférence open-weight hébergée est la bonne référence pour « faut-il héberger nous-mêmes ». Comparer plutôt à une API frontier favorise l’option locale.
Valeur résiduelle du matériel Apple
Non étudiée. Le matériel local est amorti à zéro, ce qui sous-estime le dossier Mac plutôt que de le flatter.
Benchmarks de simultanéité pour un modèle de 70B ou plus sur un Mac
Il n’en existe aucun au-delà d’un batch de un. Le débit agrégé est supposé plat sur la foi d’une mesure sur un modèle 9B avec quatre backends, où MLX, llama.cpp et Ollama étaient tous inchangés d’une à quatre requêtes simultanées. Un modèle 0,6B sur un M4 Max a bien monté d’un facteur 3,7 de 1 à 16 ; l’hypothèse de platitude est donc tirée du plus gros modèle, et un modèle assez petit peut se comporter autrement.
Comment lire un benchmark Mac
Un matériel identique faisant tourner un modèle identique varie d’un facteur 3× sur le débit de tokens selon le seul runtime : MLX 130, llama.cpp 89, Ollama 44 tokens/s sur une comparaison mesurée. Un chiffre sans testeur nommé, sans version de runtime, sans quantification, sans longueur de contexte et sans taille de batch ne peut pas être vérifié et doit être présumé fabriqué. Un ensemble de sites publie actuellement des tableaux d’apparence précise pour un « Mac Studio M5 Max » et un « M4 Ultra », dont aucun n’a jamais été commercialisé par Apple. Chaque benchmark de cette page nomme son testeur, son runtime, sa quantification et sa taille de batch, et renvoie à sa source. Là où une source n’a pas communiqué la longueur de contexte, la ligne le dit plutôt que de l’inventer, et là où une source n’a pas pu être récupérée, le benchmark a été retiré plutôt que cité.
Compilé le 2026-08-06 à partir des pages tarifaires des éditeurs, de benchmarks indépendants publiés, des statistiques d’électricité de l’EIA, des données de colocation CBRE et de l’enquête Uptime Institute sur les centres de données. Chaque chiffre porte une source, une dérivation explicite, ou l’aveu qu’il manque. Deux conventions ne sont ni l’un ni l’autre : une année de travail de 250 jours et un amortissement sur trois ans pour le matériel local. Toutes deux mettent à l’échelle chaque chiffre annuel de cette page, et toutes deux sont des choix, pas des constats.
D’où vient chaque chiffre
L’ensemble des 53 chiffres que cette page peut utiliser, chacun avec un lien et une étiquette indiquant la nature de la preuve. La spécification d’un constructeur et la mesure réelle de quelqu’un ne sont pas la même chose, elles ne sont donc jamais présentées comme si elles l’étaient. Dernière vérification le 2026-08-06.
- Prix catalogue
- Le prix catalogue publié. La plupart des acheteurs négocient en dessous.
- Mesuré
- Un tiers l’a mesuré et a publié sa méthode.
- Mesuré une fois
- Une seule partie l’a mesuré. Personne ne l’a encore répliqué.
- Prix revendeur
- Un prix revendeur, parce que le constructeur n’en publie pas.
- Notre hypothèse
- Une convention que nous avons choisie, pas un constat. Changez-la si la vôtre diffère.
- Statistique officielle
- Une série statistique publique ou officielle.
- Tarif de location
- Un tarif de location horaire publié.
- Notre calcul
- Notre propre calcul sur des données sourcées. Le détail est montré.
Validez vos chiffres avec un expert du parc Apple
30 minutes avec un consultant Apple : hypothèses passées au crible, risques de déploiement cartographiés, prochaines étapes en main. Gratuit, sans argumentaire commercial.