La version 0.34 d'Ollama introduit officiellement la prise en charge de ChatGPT Desktop. Les notes de version indiquent que les modèles Ollama peuvent être utilisés directement dans l'application de bureau de ChatGPT et que la configuration passe, pour l'instant, par l'application Ollama sous macOS.
Le principe est assez important pour l'écosystème de l'IA locale. Jusqu'ici, exécuter un modèle avec Ollama signifiait souvent utiliser son propre client, le terminal, une interface web tierce ou configurer manuellement une application compatible avec son endpoint local.
Ici, Ollama vient se glisser derrière une interface que certains utilisateurs emploient déjà quotidiennement.
ChatGPT devant, Ollama derrière
Ollama expose depuis longtemps une API locale et une couche compatible avec une partie de l'API OpenAI. Une application peut donc envoyer ses requêtes vers un serveur Ollama fonctionnant généralement sur la machine au lieu de les envoyer vers un fournisseur distant.
La nouveauté de la 0.34 consiste à rendre cette connexion directement accessible à ChatGPT Desktop, sans demander à l'utilisateur de reconstruire lui-même tout le chemin de configuration.
Lorsqu'un modèle réellement local est sélectionné, son inférence est assurée par la machine qui fait tourner Ollama. Cela peut être intéressant pour des documents sensibles, du code privé ou simplement pour éviter de dépendre d'une connexion réseau à chaque prompt.
Il faut toutefois éviter de résumer Ollama à « tout reste toujours hors ligne ». Le logiciel propose également des modèles Cloud, qui sont déportés sur l'infrastructure d'Ollama lorsqu'ils sont trop lourds pour une machine personnelle. Local et cloud coexistent désormais dans le même écosystème.
La limite la plus visible est actuellement macOS
Ollama lui-même fonctionne sur macOS, Windows et Linux. L'intégration annoncée avec ChatGPT Desktop est plus restrictive : les notes de version précisent que son paramétrage est disponible depuis l'application Ollama sur macOS.
Autrement dit, il ne faut pas confondre la disponibilité générale d'Ollama avec celle de cette intégration précise. La 0.34 ne promet pas dans ses notes de version le même parcours ChatGPT Desktop sur Windows ou Linux.
Sur Mac, Ollama demande actuellement macOS Sonoma 14 ou plus récent. Les Mac Apple Silicon disposent de l'accélération GPU via Metal ; les Mac Intel sont pris en charge en CPU.
Le vrai coût du local reste la mémoire
Une interface plus simple ne rend pas les modèles moins lourds. Le choix de la taille du modèle, de sa quantification et surtout de sa fenêtre de contexte continue de déterminer ce qu'un Mac peut réellement exécuter confortablement.
La documentation actuelle d'Ollama adapte par défaut le contexte à la quantité de VRAM disponible : 4 000 tokens sous 24 Gio, 32 000 tokens entre 24 et 48 Gio, puis 256 000 tokens à partir de 48 Gio.
Ollama recommande au moins 64 000 tokens pour les tâches qui doivent manipuler de gros contextes, notamment le web, les agents et certains outils de programmation. Monter ce réglage augmente directement la consommation mémoire.
C'est précisément le genre de détail qu'une intégration élégante peut facilement faire oublier. Un modèle de 30 milliards de paramètres ne devient pas soudainement léger parce qu'il apparaît dans un menu déroulant.
Apple Silicon reçoit aussi une optimisation plus discrète
Ollama 0.34 annonce une amélioration des performances pour les sorties structurées sur Apple Silicon.
Les sorties structurées servent lorsqu'une application ne veut pas seulement recevoir du texte libre, mais une réponse respectant un format défini : objets JSON, champs imposés ou données destinées à être consommées automatiquement par un autre outil.
C'est moins spectaculaire qu'un nouveau bouton dans ChatGPT, mais probablement plus important pour les workflows automatisés. Une réponse structurée plus rapide et plus fiable réduit le coût de la couche qui se situe entre le modèle et l'application.
Ollama pousse également plus loin sa compatibilité OpenAI
La version ajoute le support du tool search et de la compaction des réponses pour les clients utilisant l'interface compatible OpenAI d'Ollama.
La compatibilité OpenAI est déjà l'une des méthodes utilisées pour brancher des logiciels existants sur Ollama. Au lieu de réécrire entièrement l'intégration, un développeur peut pointer un client OpenAI vers l'adresse locale d'Ollama et sélectionner un modèle disponible.
Le projet documente par exemple l'utilisation de l'endpoint local sur le port 11434 avec les API Chat Completions et Responses.
Ce choix technique explique pourquoi Ollama peut progressivement s'intégrer à des outils pensés à l'origine pour des services distants : la couche cliente change peu, tandis que le moteur derrière l'endpoint peut être remplacé.
Ollama est en train de devenir moins un lanceur de modèles qu'une couche commune
Le projet permet déjà de lancer directement plusieurs outils de développement et agents depuis sa CLI. Sa documentation liste notamment Codex, Claude Code, OpenCode et des intégrations avec des environnements de développement.
L'ajout de ChatGPT Desktop poursuit la même logique. Ollama n'essaie plus uniquement de fournir une commande simple pour télécharger puis exécuter un modèle. Il cherche de plus en plus à devenir le point de raccordement entre les modèles et les logiciels qui les utilisent.
Cette stratégie a un avantage pratique : changer de modèle ne signifie plus nécessairement changer toute son interface de travail.
Le « local » devient une option dans l'outil qu'on utilise déjà
C'est probablement le changement le plus intéressant de cette version. Pendant longtemps, l'IA locale demandait d'accepter un compromis d'ergonomie : davantage de contrôle en échange de davantage de configuration.
Ollama 0.34 grignote ce compromis. L'utilisateur peut conserver une application de bureau connue et choisir un modèle exécuté localement lorsque son matériel le permet.
Cela ne remplace ni la puissance des très gros modèles cloud ni les contraintes physiques d'un GPU personnel. Mais l'écart entre « utiliser un service d'IA » et « faire tourner son propre modèle » devient nettement moins visible.