Sept modèles de langage open source, une seule API.
Un parc de modèles auto-hébergés sur l'infrastructure SHAU : un modèle généraliste principal, des variantes plus légères pour arbitrer qualité et latence, et deux modèles IBM Granite dédiés au contrôle des réponses. Interface compatible OpenAI, documentation OpenAPI, et la vitesse de génération mesurée à chaque appel.
Chaque modèle a un role
Le serveur ne peut garder qu'un seul modèle en mémoire à la fois : changer de modèle implique de décharger le précédent. Les tailles et vitesses ci-dessous sont celles mesurées sur cette machine.
Trois lignes suffisent
L'API suit le format OpenAI : vos clients existants fonctionnent en changeant l'URL de base et la clé.
Ce que renvoie chaque appel
En plus de la réponse, chaque résultat porte un objet metrics :
vitesse de génération, temps de chargement du modèle, délai avant le premier jeton.
{
"choices": [ … ],
"usage": { "prompt_tokens": 24, "completion_tokens": 187 },
"metrics": {
"tokens_per_second": 9.02, // vitesse de génération
"time_to_first_token_ms": 412,
"load_ms": 0, // 0 = modèle déjà résident
"eval_ms": 20732
}
}
Connexion sans mot de passe
La plateforme fonctionne par lien de connexion : saisissez votre adresse, vous recevez un lien valable une seule fois. Si vous n'avez pas encore d'accès, demandez-le — chaque demande est examinée individuellement.