Le point d'entrée est le nouveau Mac mini M6 à 899 dollars. Il conserve le petit châssis de la génération précédente, mais passe à un SoC M6 gravé en 2 nm avec CPU 12 cœurs, GPU 12 cœurs et Neural Accelerators intégrés aux cœurs graphiques.
La mémoire reste beaucoup plus restrictive que sur le Mac Studio : 16 Go en standard et 32 Go au maximum, avec 170 Go/s de bande passante. C'est suffisant pour de nombreux petits modèles, outils de génération et agents de développement, mais cela fixe assez vite la taille des modèles que l'on peut charger intégralement en local.
Apple revendique jusqu'à quatre fois les performances IA du Mac mini M4 dans certaines charges. Sur LM Studio, ses propres mesures annoncent un traitement des prompts jusqu'à 4,8 fois plus rapide que sur M4. Ce sont des benchmarks constructeur, réalisés avec des configurations et logiciels précis ; ils donnent surtout une indication sur la direction prise par le GPU M6 et ses accélérateurs.
Le Mac mini devient un petit serveur d'agents posé sur un bureau
Apple insiste beaucoup sur un usage qui aurait semblé assez marginal il y a encore deux générations : laisser la machine fonctionner en permanence pour exécuter des agents. Ce positionnement correspond assez bien au format du Mac mini. Il est compact, relativement sobre et n'a pas besoin d'écran une fois configuré pour certains workflows distants.
La variante M5 Pro est plus intéressante lorsque la mémoire devient le facteur limitant. Elle accepte jusqu'à 64 Go à 307 Go/s et monte à 18 cœurs CPU et 20 cœurs GPU. Ses ports Thunderbolt 5 permettent également à plusieurs Mac mini d'être reliés pour des charges IA distribuées.
Il ne faut pas confondre cette possibilité avec une transformation magique de plusieurs Mac en un seul SoC doté d'une immense mémoire unifiée. Les machines restent des systèmes distincts. L'intérêt vient des logiciels capables de répartir correctement l'inférence et les échanges entre nœuds.
Le Mac Studio M5 Ultra joue dans une autre catégorie
C'est avec le nouveau Mac Studio que le positionnement IA devient beaucoup moins grand public. La configuration M5 Ultra peut recevoir 512 Go de mémoire unifiée avec 1,2 To/s de bande passante. Le processeur monte à 36 cœurs CPU et le GPU à 80 cœurs.
Cette quantité de mémoire compte davantage que certaines comparaisons de puissance brute. Pour un LLM exécuté localement, il faut d'abord réussir à faire tenir les poids du modèle, son contexte et les autres allocations nécessaires. Une machine avec plusieurs centaines de gigaoctets accessibles directement par le CPU et le GPU peut charger des modèles qu'un PC équipé d'une carte graphique à 24 ou 32 Go doit répartir autrement, quantifier plus agressivement ou déporter vers plusieurs accélérateurs.
Apple affirme que cette configuration permet d'exécuter localement des modèles comptant des centaines de milliards de paramètres. La faisabilité réelle dépend évidemment de la précision utilisée, de la quantification, de la taille du contexte et du framework. « 512 Go » ne correspond donc pas automatiquement à une taille précise de modèle exploitable à bonne vitesse.
La configuration maximale n'arrivera d'ailleurs pas en même temps que le reste de la gamme. Les Mac Studio M5 Max et M5 Ultra doivent être disponibles à partir du 22 septembre, mais Apple annonce les modèles avec 512 Go de mémoire pour la fin octobre.
Quatre Mac Studio peuvent maintenant travailler sur la même inférence
Thunderbolt 5 prend ici un rôle plus intéressant que celui d'un connecteur pour SSD rapide. Apple prend en charge RDMA entre plusieurs Mac Studio et propose de les regrouper pour distribuer des charges IA.
La société annonce jusqu'à trois fois les performances d'inférence d'une seule machine avec un cluster de quatre Mac Studio dans ses tests. L'intérêt potentiel est évident pour les modèles trop importants pour un seul système ou pour les équipes qui veulent augmenter le débit sans envoyer leur workload vers un fournisseur cloud.
Cette approche impose cependant une pile logicielle prévue pour le calcul distribué. La latence entre machines reste sans commune mesure avec les échanges internes d'un SoC ou avec la bande passante de la mémoire unifiée du M5 Ultra. L'efficacité réelle variera donc fortement selon la manière dont le modèle est découpé et servi.
L'argument du cloud devient aussi un argument de prix
Apple présente naturellement l'exécution locale comme un moyen de conserver les données sur la machine et d'éviter une facturation permanente au token. C'est pertinent pour certains usages professionnels : code confidentiel, données de recherche, documents internes ou agents qui tournent de nombreuses heures peuvent rendre une infrastructure locale plus prévisible.
Cela ne rend pas le calcul gratuit. Le Mac Studio M5 Ultra commence à 5 499 dollars et la variante M5 Max à 2 499 dollars. Le Mac mini M6 débute à 899 dollars, soit 100 dollars de plus que son prédécesseur selon Reuters. À cela s'ajoutent la consommation électrique et, pour un cluster, plusieurs machines.
Le calcul devient alors très dépendant du workload. Une équipe qui sollicite un modèle quelques minutes par jour peut difficilement justifier une grosse station locale uniquement pour économiser des tokens. Un service interne utilisé en permanence présente une équation différente.
Apple essaie surtout de rendre son architecture mémoire difficile à ignorer
Le M6 et le M5 Ultra ne remplissent pas le même rôle. Le premier cherche à mettre davantage d'accélération IA dans un ordinateur compact relativement accessible. Le second utilise l'un des avantages historiques d'Apple silicon — une grande mémoire unifiée accessible aux différents blocs du SoC — comme argument face aux stations de travail basées sur GPU dédiés.
Le M5 Ultra lui-même adopte une construction inhabituelle : Apple relie par UltraFusion deux ensembles M5 Max composés chacun de deux dies, donnant pour la première fois quatre dies à un SoC M-series Ultra. La bande passante entre ces blocs dépasse 4,4 To/s selon Apple.
La génération arrive aussi dans un contexte moins favorable aux prix. Reuters souligne que la forte demande des centres de données IA continue de tendre le marché de la mémoire, et Apple avait déjà relevé certains tarifs en juin.
Les deux nouveaux Mac peuvent être précommandés depuis le 25 août. Les premières livraisons sont annoncées pour le 22 septembre.