Claude et ChatGPT sont l'endroit où la plupart d'entre nous ont commencé avec l'IA, et une fois que vous avez découvert ce qu'ils peuvent faire, il est tout à fait naturel de les mettre au travail au-delà de la fenêtre de discussion. Cela signifie les connecter à d’autres outils et exploits via leurs API. Mais une fois que vous l'avez fait, Claude et ChatGPT cessent d'être un simple abonnement de 20 $ et commencent à se comporter comme des utilitaires payants qui peuvent vous rapporter tranquillement des centaines de dollars par mois, en fonction de ce que font vos automatisations.
Heureusement, vous n'êtes pas limité à l'utilisation de ces modèles premium avec leur prix premium. Il existe des dizaines de modèles d’IA gratuits et open source qui sont tout aussi performants pour la plupart des charges de travail. Et si vous les achetez correctement, ils peuvent vous coûter exactement – rien.
Les meilleures offres en matière d’IA ne sont pas annoncées – elles font l’objet de recherches
Un peu de recherche préalable peut vous faire économiser beaucoup d’argent en fin de compte
La carte mentale de l'IA de la plupart des gens s'articule autour de quatre modèles principaux : les modèles GPT d'OpenAI, Claude d'Anthropic, Gemini de Google et Grok de xAI d'Elon Musk. C'est compréhensible, étant donné que ce sont des modèles soutenus par des budgets marketing massifs. Mais l’espace open source a discrètement produit de véritables poids lourds. Actuellement, Kimi K3 de Moonshot AI, GLM-5.3 de Z.ai et M3 de MiniMaxAI sont quelques-uns des grands noms de l'espace FOSS AI, offrant des performances de premier plan.
Cependant, je ne suis pas ici pour simplement vous dire qu'il existe de bons modèles open source : je suis ici pour vous dire que vous pouvez y accéder à des prix très réduits, parfois même gratuitement.
Il vous suffit de faire appel à des fournisseurs tiers au lieu d'accéder à ces modèles depuis les sites Web de leurs créateurs. Les options populaires incluent OpenRouter, Together AI et Groq (à ne pas confondre avec Elon's Grok). LM Studio a également récemment commencé à proposer un accès hébergé aux États-Unis à ces modèles sans rétention de données à des prix très attractifs.
Cependant, la meilleure offre, au moment de la rédaction de cet article, vient de NVIDIA. Ils hébergent un vaste catalogue de modèles ouverts sur leur propre infrastructure à build.nvidia.comet ils mettent régulièrement à disposition gratuitement des modèles véritablement puissants. Ces points de terminaison gratuits tournent (un modèle peut être gratuit pendant une fenêtre limitée puis être supprimé de la liste) mais il y a toujours quelque chose qui vaut la peine d'être utilisé dans la pile.
Par exemple, NVIDIA propose actuellement un point de terminaison gratuit pour Kimi K3. Avant cela, ils proposaient un point de terminaison gratuit pour MiniMax M3.
Ces modèles gratuits sont-ils vraiment aussi bons que Claude et ChatGPT ?
Une baisse de qualité pour une baisse de prix n'est pas toujours une bonne affaire
Beaucoup de ces modèles ouverts prétendent rivaliser avec Claude Opus 4.8 ou GPT 5.6 Sol. Certains d'entre eux échangent même des coups avec Claude Fable 5, le modèle haut de gamme d'Anthropic. Maintenant, je ne les ai pas personnellement testés par rapport à Fable – effectuer cette comparaison coûterait plus cher que ce que je suis prêt à dépenser. Cependant, j'exécute un certain nombre d'automatisations n8n à l'aide de Claude Opus 5. Je viens de remplacer mon API Anthropic par l'un de ces modèles gratuits et j'ai en fait trouvé les performances plutôt bonnes – suffisamment bonnes pour que je change définitivement.
Cela dit, je me rends compte qu'il s'agit d'une affirmation anecdotique et que votre kilométrage peut varier en fonction de votre cas d'utilisation. En tant que tel, il est préférable de tester ces modèles vous-même pour voir comment ils fonctionnent pour vos besoins particuliers. Remplacez simplement votre point de terminaison API Claude ou GPT par celui de NVIDIA, exécutez vos outils exactement comme vous le feriez normalement et jugez les résultats. Et comme les modèles sont gratuits, les tests ne vous coûtent qu’un peu de temps.
Néanmoins, si vous cherchez une idée de base sur par où commencer, vous pouvez toujours visiter Hugging Face pour des références de modèles. Alternativement, les YouTubers aiment Matthieu Berman et 1petit codeur testons toujours ces nouveaux modèles. Vous pouvez regarder leurs vidéos pour avoir une idée de ce dont ces modèles sont capables.
Comment utiliser ces modèles gratuits et open source
L'installation ne vous prendra que deux minutes
En tant que modèles gratuits et open source, ils sont tous facilement disponibles en ligne et vous pouvez les télécharger et les exécuter sur votre propre matériel. Cependant, même si cela est techniquement possible, ce n’est pas l’option la plus pratique. Nous parlons de modèles comportant des milliards de paramètres. Vous aurez besoin d'un GPU avec au moins 1 000 Go de VRAM pour les exécuter avec une précision totale. Si vous l'avez, tant mieux (et pouvons-nous être amis ?) – mais je suppose que ce n'est pas le cas.
En tant que tel, nous dépendons d’entreprises qui disposent de ce type de matériel pour héberger ces modèles. Maintenant, comme je l'ai mentionné plus tôt, il existe en fait un certain nombre d'entreprises dans ce domaine, dont NVIDIA – et elle rend également ces modèles disponibles gratuitement.
Cela dit, aucune des plates-formes d'inférence n'offre une interface de discussion raffinée vous permettant d'interagir avec ces modèles. Ils sont fournis de la même manière que les API de Claude et ChatGPT : en tant que points de terminaison que vous connectez à d'autres logiciels d'IA, communément appelés harnais. Et même si tout cela peut sembler un peu trop technique, je le jure, la mise en place prend généralement quelques minutes.
Tout d’abord, pour obtenir l’API, visitez build.nvidia.com/models. Ensuite, cliquez sur l'icône de votre profil, sélectionnez Clés API, puis cliquez sur Générer une clé API. Donnez un nom à la clé (afin que vous puissiez vous rappeler où et comment vous l'utiliserez) et définissez une date d'expiration. Vous obtiendrez une nouvelle boîte de dialogue affichant votre clé API, qui commence par « nvapi ». Copiez-la immédiatement et stockez-la dans un endroit sûr : NVIDIA ne vous montrera plus cette clé.
Si vous perdez la clé API ou pensez qu'elle a été compromise, supprimez-la du même tableau de bord. Si quelqu'un a accès à la clé, il peut utiliser votre quota d'inférence.
L'API vous donne accès à tous les modèles mis à disposition par NVIDIA – pas besoin d'acheter de jetons ni de saisir les informations de votre carte de crédit. Avec la clé en main, vous pouvez simplement la coller dans l'application que vous souhaitez utiliser.
Par exemple, si vous souhaitez un chatbot basique alimenté par ces modèles gratuits, vous pouvez utiliser Open WebUI. Sélectionnez simplement le modèle que vous souhaitez utiliser et commencez à discuter, ou confiez-lui une tâche de codage pour avoir une idée de ce dont le modèle est capable. Mais la vraie valeur apparaît lorsque vous les utilisez avec les harnais appropriés – c'est là que l'accès gratuit à l'API s'avère vraiment payant. Certaines options populaires incluent :
- Travail collaboratif ouvert: Une alternative gratuite et open-source à Claude Cowork ou ChatGPT Work.
- Curseur: Un agent de codage alimenté par l'IA.
- Agent Hermès: Une IA agentique qui s'améliore automatiquement.
- Griffe Ouverte: Un agent IA open source.
- n8n: Une plateforme d'automatisation.
Ces points de terminaison gratuits sont destinés à un usage personnel, aux tests et au développement. Ils ne sont pas destinés aux applications de production dans lesquelles vous hébergez quelque chose pour d'autres utilisateurs.
C'est tout pour les avantages, qu'en est-il des inconvénients ?
Il y a toujours quelques mises en garde
Il existe deux principaux points de friction avec les API NVIDIA, même si aucun des deux ne constitue un facteur décisif – du moins pas pour moi.
Le premier est la limite de taux. Bien que cela ne vous limite pas à un nombre défini de messages toutes les cinq heures – comme les niveaux gratuits de Claude ou ChatGPT – cela vous limite à environ 40 requêtes par minute. Pour la plupart des cas d'utilisation personnelle, ce n'est pas un problème : je ne peux pas imaginer un scénario dans lequel je lancerais personnellement 40 requêtes en une minute. Cependant, si vous exécutez des flux de travail fortement automatisés qui traitent des tonnes de requêtes en parallèle, cela peut devenir un goulot d'étranglement.
Le second est plus important : la vitesse. Les modèles sont en fait hébergés sur les propres GPU de NVIDIA, et la quantité de calcul à gérer est limitée. Si vous utilisez un modèle populaire (et les modèles puissants sont toujours les plus populaires) ou si vous utilisez l'API pendant les heures de pointe, les réponses ont tendance à devenir sensiblement plus lentes. Il y a aussi le fait que les modèles plus gros consomment plus de calcul par requête, ce qui aggrave les ralentissements.
Cependant, à mon avis, cela reste un bon compromis. Les réponses lentes ne sont ennuyeuses que si vous l'utilisez comme chatbot. Si vous l'utilisez pour alimenter vos automatisations en arrière-plan – ce que je fais – l'intelligence brute du résultat compte bien plus que le nombre de secondes qu'il a fallu pour terminer.
Vous pouvez lire l’article original (en Angais) sur le blogwww.howtogeek.com