Aller au contenu

Calcul IA

Où faire tourner votre inférence ?

Un Mac que vous possédez déjà produit des tokens au prix de l’électricité. Un nœud GPU en produit plus vite que n’importe quel Mac ne le fera jamais. Une API cloud en produit de meilleurs que les deux. La question n’est pas de savoir lequel coûte le moins cher. C’est de savoir lequel des trois votre charge de travail disqualifie.

Prix vérifiés pour la dernière fois le 2026-08-06. Les prix du matériel et des tokens ont été vérifiés le 2026-08-06 et évoluent vite. Apple a relevé ses prix sur toute la gamme Mac le 2026-06-25, le Mac Studio M3 Ultra de 32,5 %, les autres modèles de montants différents, et a retiré deux paliers de mémoire du Mac Studio plus tôt dans l’année ; Anthropic relève Sonnet 5 de 50 % le 2026-09-01 ; la location réservée de H100 a augmenté d’environ 40 % par rapport à son point bas d’octobre 2025.

Votre parc

Le matériel est déjà payé. Un des paramètres ci-dessous relève du pur jugement, et il le dit.

Une machine par personne ; le Mac de chaque utilisateur traite le travail routable de cet utilisateur.

Le débit vient du benchmark publié au niveau de la puce ; le capex est irrécupérable et n’est jamais facturé.

Ce que les gens font avec l’IA

28 000 tokens de sortie par personne et par jour, dérivés et non observés.

Part routable sur l’appareil25 %

Votre jugement, pas un fait : personne ne publie ce chiffre. Routable : classification, extraction, résumé d’un document connu, caviardage, autocomplétion. Non routable : raisonnement frontier, analyse à contexte long, codage agentique.

Les tâches routables relèvent d’un palier bon marché ; déplacer un prix frontier avec elles gonflerait l’économie.

Taux de succès du cache de prompts50 %

Le travail routable répétitif se met bien en cache ; un taux plus élevé réduit la facture d’API déplacée, c’est donc le sens conservateur.


Cycle de renouvellement

Gartner situe les ordinateurs portables d’entreprise à 3,7 ans en moyenne (2024, rapporté de seconde main) ; les appareils sont remplacés à ce rythme, que l’IA existe ou non.

Le seul coût matériel récurrent de cette histoire : la marge mémoire que vous choisissez lors d’un achat qui avait lieu de toute façon.

Le parc que vous possédez déjà

Router 25 % de ce travail sur l’appareil déplace 11 594 $US de dépenses d’API par an, sur du matériel acheté de toute façon.

500 × MacBook Air 13″ M4 (16 Go) : appareil type du parc · capex irrécupérable, renouvelé tous les 4 ans quoi qu’il arrive · la part routable de 25 % relève de votre jugement, pas d’une mesure.

Dépenses d’API déplacées

11 594 $US/an

contre payer Claude Haiku 4.5 pour la totalité

Coût sur l’appareil

≈ 0 $US

plancher : la consommation en inférence n’est pas mesurée sur cet appareil, aucune ligne d’électricité n’est donc inventée

Écart de cycle de renouvellement

4 $US/appareil/mois

MacBook Air M5 : 16 → 24 Go amorti sur 4 ans

Chaque machine suit-elle ?

  • La part routable représente 7 k tokens par personne et par jour, soit environ 13 minutes d’inférence au débit effectif de 9,2 tok/s de cette machine. Le plafond accepté ici est de 2 heures par jour (25 % de charge sur une journée de 8 heures), parce que les portables brident leur fréquence sous charge soutenue.

  • Le débit effectif est sous le streaming de chat confortable (15 tok/s) une fois la lecture du prompt payée : correct pour du travail de fond (classification, caviardage, résumé), inadapté à une fenêtre de chat que quelqu’un regarde. La liste routable est du travail de fond, délibérément.

  • Ce que ce n’est pas : un cluster de service. Les runtimes Apple ne regroupent pas les utilisateurs simultanés en batch et un portable sans ventilateur perd ~55 % de la puissance de son package après 20 minutes de charge soutenue (Notebookcheck, M4 Air). Chaque Mac porte son propre utilisateur, rien de plus.

La facture annuelle, de trois façons

  • Tous les tokens sur Claude Haiku 4.546 375 $US/an

    Le scénario de référence : ne rien faire.

  • Hybride : 25 % sur l’appareil, le reste sur l’API34 781 $US/an

    Le volet sur l’appareil est chiffré à un plancher non mesuré de 0 $US ; le vrai chiffre est au-dessus, de ce que l’électricité se révélera coûter.

  • Assistant par utilisateur pour tout le monde (M365 Copilot)180 000 $US/an

    30 $US/utilisateur/mois au prix catalogue, un produit différent avec un plafond différent, montré pour l’échelle.

La question du renouvellement

Spécifier MacBook Air M5 : 16 → 24 Go au prochain renouvellement coûte 4 $US/appareil/mois sur un cycle de 4 ans, contre 30 $US/utilisateur/mois pour un siège Copilot (26 $US/mois de moins). Ce ne sont pas des substituts : la RAM achète de la marge pour le travail routable sur l’appareil, le siège achète un assistant frontier. Le propos est l’échelle : tout le coût matériel de cette histoire est inférieur à une seule licence par utilisateur.

Ce que ce modèle refuse d’affirmer

Chacun de ces points est une conclusion que les preuves n’étayaient pas, et chacun est pourtant affirmé couramment ailleurs.

  • Les Mac remplacent les API LLM cloud à grande échelle.

    Non. Aucune étude de cas publiée nommant une entreprise, sur un parc de Mac remplaçant des API LLM cloud, n’a survécu à la vérification. La seule étude de cas éditeur trouvée précise un « Mac Studio M4 Ultra », une puce qu’Apple n’a jamais commercialisée.

  • La gouvernance de l’IA et l’inférence locale sont le même argument.

    Jamf AI Governance encadre les outils d’IA cloud qui tournent sur des Mac. Cela n’exige ni ne prouve une inférence locale. Confondre les deux est le moyen le plus rapide de perdre une revue d’achat.

  • La réglementation impose l’inférence sur l’appareil.

    Aucun régulateur trouvé ne l’exige. Le déclencheur réel le plus proche est que le HHS OCR traite les fournisseurs de LLM manipulant des données de santé (PHI) comme des « business associates », ce qui impose un BAA ; l’inférence locale contourne cet exercice contractuel.

  • Le modèle sur appareil d’Apple peut remplacer un poste d’assistant d’entreprise.

    Le modèle de fondation Apple sur appareil compte environ 3 milliards de paramètres, avec une fenêtre de contexte de 8 192 tokens. Private Cloud Compute porte le contexte à 32k. Ni l’un ni l’autre n’est un substitut à Copilot.

  • Acheter un nœud 8x H100 est un achat sensé en 2026.

    Un H100 en propre à 100 % de charge produit des tokens à environ 0,165 $US le million. Du Blackwell loué en produit à environ 0,081 $US le million. Le H100 a deux générations de retard sur la frontière commercialisée.

Chiffres que nous n’avons pas pu sourcer

  • Tokens consommés par travailleur du savoir et par jour

    Aucune donnée publiée crédible n’existe. Les éditeurs publient des montants, des sièges et des taux de croissance. Les valeurs par défaut retenues ici sont dérivées de la dépense par utilisateur publiée par Anthropic, divisée par un prix de modèle indiqué, et sont signalées comme dérivées partout où elles apparaissent.

  • Coût d’administration système par machine et par an

    Aucun chiffre sourcé n’existe pour un parc de Mac ni pour un nœud GPU. Le champ démarre à 0 $US pour que l’omission soit visible plutôt que silencieuse.

  • La valeur monétaire du risque de confidentialité, de résidence ou de conformité

    Aucune n’est défendable ; la confidentialité retire donc des options au lieu de les valoriser. Seule exception : la surcharge de résidence américaine d’Anthropic, de 1,1x sur chaque catégorie de tokens, le seul prix publié pour une garantie de résidence que nous ayons trouvé.

  • Prix des API de modèles open-weight (Together, Fireworks, Groq, DeepInfra)

    Non étudiés, et c’est le comparateur manquant le plus important : l’inférence open-weight hébergée est la bonne référence pour « faut-il héberger nous-mêmes ». Comparer plutôt à une API frontier favorise l’option locale.

  • Valeur résiduelle du matériel Apple

    Non étudiée. Le matériel local est amorti à zéro, ce qui sous-estime le dossier Mac plutôt que de le flatter.

  • Benchmarks de simultanéité pour un modèle de 70B ou plus sur un Mac

    Il n’en existe aucun au-delà d’un batch de un. Le débit agrégé est supposé plat sur la foi d’une mesure sur un modèle 9B avec quatre backends, où MLX, llama.cpp et Ollama étaient tous inchangés d’une à quatre requêtes simultanées. Un modèle 0,6B sur un M4 Max a bien monté d’un facteur 3,7 de 1 à 16 ; l’hypothèse de platitude est donc tirée du plus gros modèle, et un modèle assez petit peut se comporter autrement.

Comment lire un benchmark Mac

Un matériel identique faisant tourner un modèle identique varie d’un facteur 3× sur le débit de tokens selon le seul runtime : MLX 130, llama.cpp 89, Ollama 44 tokens/s sur une comparaison mesurée. Un chiffre sans testeur nommé, sans version de runtime, sans quantification, sans longueur de contexte et sans taille de batch ne peut pas être vérifié et doit être présumé fabriqué. Un ensemble de sites publie actuellement des tableaux d’apparence précise pour un « Mac Studio M5 Max » et un « M4 Ultra », dont aucun n’a jamais été commercialisé par Apple. Chaque benchmark de cette page nomme son testeur, son runtime, sa quantification et sa taille de batch, et renvoie à sa source. Là où une source n’a pas communiqué la longueur de contexte, la ligne le dit plutôt que de l’inventer, et là où une source n’a pas pu être récupérée, le benchmark a été retiré plutôt que cité.

Compilé le 2026-08-06 à partir des pages tarifaires des éditeurs, de benchmarks indépendants publiés, des statistiques d’électricité de l’EIA, des données de colocation CBRE et de l’enquête Uptime Institute sur les centres de données. Chaque chiffre porte une source, une dérivation explicite, ou l’aveu qu’il manque. Deux conventions ne sont ni l’un ni l’autre : une année de travail de 250 jours et un amortissement sur trois ans pour le matériel local. Toutes deux mettent à l’échelle chaque chiffre annuel de cette page, et toutes deux sont des choix, pas des constats.

D’où vient chaque chiffre

L’ensemble des 53 chiffres que cette page peut utiliser, chacun avec un lien et une étiquette indiquant la nature de la preuve. La spécification d’un constructeur et la mesure réelle de quelqu’un ne sont pas la même chose, elles ne sont donc jamais présentées comme si elles l’étaient. Dernière vérification le 2026-08-06.

Prix catalogue
Le prix catalogue publié. La plupart des acheteurs négocient en dessous.
Mesuré
Un tiers l’a mesuré et a publié sa méthode.
Mesuré une fois
Une seule partie l’a mesuré. Personne ne l’a encore répliqué.
Prix revendeur
Un prix revendeur, parce que le constructeur n’en publie pas.
Notre hypothèse
Une convention que nous avons choisie, pas un constat. Changez-la si la vôtre diffère.
Statistique officielle
Une série statistique publique ou officielle.
Tarif de location
Un tarif de location horaire publié.
Notre calcul
Notre propre calcul sur des données sourcées. Le détail est montré.

Validez vos chiffres avec un expert du parc Apple

30 minutes avec un consultant Apple : hypothèses passées au crible, risques de déploiement cartographiés, prochaines étapes en main. Gratuit, sans argumentaire commercial.