Baseten devient un Inference Provider sur Hugging Face. Accès aux LLM via le routeur HF, clés personnelles ou facturation centralisée : voici ce que l’intégration change côté développeur.
Choisir un modèle ouvert ne suffit pas : il faut aussi décider où et comment l’exécuter. Hugging Face continue de transformer ce choix d’infrastructure en une couche d’accès unifiée. La plateforme annonce l’arrivée de Baseten parmi ses Inference Providers, ces prestataires d’inférence accessibles depuis les pages de modèles du Hub, son routeur API et ses SDK.
Pour un développeur, l’intérêt est concret : appeler certains modèles hébergés par Baseten sans intégrer une API spécifique à Baseten dans chaque projet. L’intégration repose sur le routeur compatible OpenAI de Hugging Face et propose deux chemins de facturation : ta propre clé fournisseur, ou une requête routée et réglée via ton compte Hugging Face.
La source décrit une prise en charge initiale des tâches conversationnelles et de génération de texte. Elle cite notamment Kimi K3, DeepSeek V4 Flash et GLM-5.2 parmi les modèles ouverts disponibles. Elle ne fournit toutefois ni mesures de latence, ni garanties de disponibilité, ni grille tarifaire détaillée modèle par modèle. Ce sont donc des éléments à vérifier avant un déploiement en production.
Ce que l’arrivée de Baseten apporte au Hub Hugging Face
Baseten est présenté par Hugging Face comme une plateforme d’infrastructure IA couvrant l’IA serverless, l’entraînement et d’autres usages. Son intégration élargit la liste des fournisseurs capables d’exécuter des modèles directement depuis l’écosystème Hugging Face.
Concrètement, lorsqu’un modèle est compatible, sa page peut afficher des fournisseurs tiers d’inférence. Leur ordre dépend des préférences définies dans ton compte Hugging Face. Cette logique évite de multiplier les intégrations côté application : le modèle et le fournisseur sont identifiés dans une même référence, utilisée ensuite depuis une API commune.
Le périmètre annoncé au lancement reste ciblé :
- les conversations de type chat ;
- la génération de texte ;
- l’accès à des LLM open-weight, parmi lesquels les modèles nommés dans l’annonce.
Hugging Face indique que d’autres types de tâches seront ajoutés par la suite, sans préciser lesquels ni donner de calendrier. Il serait donc prématuré d’en déduire une prise en charge immédiate de l’embedding, de la génération d’images, de l’audio ou du reranking par cette intégration précise.
Baseten devient une option d’exécution dans l’interface et les SDK Hugging Face. Tu peux conserver une interface API unifiée tout en choisissant Baseten comme fournisseur pour les modèles compatibles.
Deux modes d’accès : clé Baseten ou routage par Hugging Face
Le point le plus utile de cette intégration est la séparation entre l’authentification et le fournisseur qui exécute réellement la requête. La source détaille deux modes.
Utiliser sa propre clé fournisseur
Tu peux enregistrer ta clé API Baseten dans les paramètres de ton compte Hugging Face. Dans ce cas, les appels sont envoyés directement au fournisseur, et la facturation est gérée sur ton compte Baseten. Cette approche peut convenir si ton entreprise centralise déjà ses dépenses et ses accès chez ce prestataire.
Passer par le compte Hugging Face
Tu peux aussi utiliser un jeton Hugging Face sans posséder de clé Baseten. Hugging Face route alors la demande vers Baseten automatiquement lorsque le modèle ciblé le précise. La facturation est appliquée à ton compte Hugging Face.
Selon l’annonce, Hugging Face facture dans ce second cas les tarifs API standards du fournisseur, sans majoration supplémentaire. La plateforme précise cependant qu’elle pourrait conclure ultérieurement des accords de partage de revenus avec ses partenaires. Cette mention ne signifie pas, à elle seule, qu’un changement tarifaire est prévu pour les utilisateurs.
Les abonnés Hugging Face PRO disposent, d’après la source, de 2 dollars de crédits d’inférence par mois, utilisables chez les différents fournisseurs. Une petite allocation gratuite est également évoquée pour les utilisateurs connectés de l’offre gratuite, sans montant ni conditions précises dans l’article source.
Appeler un modèle Baseten avec le SDK OpenAI
L’intégration est disponible via huggingface_hub en Python à partir de la version 1.26.1, et via @huggingface/inference en JavaScript. La démonstration publiée utilise aussi le SDK officiel OpenAI : Hugging Face expose un point d’entrée compatible, ce qui limite les adaptations dans une base de code déjà construite autour de cette API.
Voici le principe en Python, avec le modèle DeepSeek V4 Flash servi par Baseten :
import os
from openai import OpenAI
client = OpenAI(
base_url="https://router.huggingface.co/v1",
api_key=os.environ["HF_TOKEN"],
)
completion = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V4-Flash-0731:baseten",
messages=[
{
"role": "user",
"content": "Write a Python function that returns the nth Fibonacci number using memoization.",
}
],
)
print(completion.choices[0].message)
La partie déterminante est le suffixe :baseten dans le nom du modèle. Il indique le fournisseur à utiliser pour cette référence. L’authentification repose sur HF_TOKEN, et le routeur Hugging Face se charge de transmettre la requête.
Ce mécanisme est particulièrement pratique pour tester plusieurs fournisseurs avec une structure de code comparable. Mais une compatibilité d’API ne garantit pas une équivalence complète des comportements : formats avancés, outils, streaming, limites de contexte et paramètres disponibles doivent être validés sur le modèle et le fournisseur réellement sélectionnés. La source ne détaille pas ces aspects.
Agents : une intégration qui réduit le code de raccordement
Hugging Face indique que ses Inference Providers sont intégrés à plusieurs agent harnesses, dont Pi, OpenCode, Hermes Agents et OpenClaw. L’annonce affirme qu’il est ainsi possible de connecter des modèles hébergés chez Baseten à ces outils sans code de raccordement supplémentaire.
Pour les équipes qui expérimentent des agents, c’est surtout une simplification opérationnelle : l’outil d’agent conserve son chemin d’intégration Hugging Face, tandis que le choix du fournisseur peut être effectué dans la référence de modèle ou les préférences associées. Cela réduit le nombre de configurations à maintenir lors des essais.
Il faut néanmoins distinguer cette facilité de branchement d’une validation de production. L’article ne donne pas d’informations sur les limites de débit, la résidence des données, les conditions de conservation des requêtes ou les engagements de service de Baseten dans ce contexte. Si ton agent manipule des données clients, ces sujets méritent une revue contractuelle et technique séparée.
Comment évaluer Baseten avant de l’ajouter à ton stack
L’intégration a une valeur immédiate pour le prototypage : tu peux évaluer un modèle et son fournisseur depuis la même surface Hugging Face, avec un jeton unique. Pour aller plus loin, traite-la comme une option d’infrastructure à comparer, pas comme un simple sélecteur de modèles.
- Vérifie la compatibilité exacte sur la page du modèle et dans la liste des modèles supportés par Baseten indiquée par Hugging Face.
- Teste ton flux réel : prompts longs, sortie structurée, streaming éventuel et charge concurrente, plutôt qu’une seule requête de démonstration.
- Compare les coûts entre l’usage avec une clé Baseten et le routage Hugging Face, en tenant compte de l’organisation de ta facturation.
- Définis ton niveau de contrôle : clé personnelle pour une relation directe avec le fournisseur, ou jeton HF pour réduire la surface de configuration.
- Documente le modèle complet, suffixe fournisseur inclus, afin d’éviter qu’un changement de référence ne modifie silencieusement ton chemin d’exécution.
Baseten ajoute donc une route d’inférence de plus au Hub Hugging Face, avec un accès qui reste familier pour les projets Python, JavaScript et compatibles OpenAI. Commence par un test ciblé sur un modèle compatible, mesure ce qui compte pour ton produit, puis choisis le mode de facturation et d’authentification adapté à ton organisation.