SHAU LLM API

Sept modèles de langage open source, une seule API.

Un parc de modèles auto-hébergés sur l'infrastructure SHAU : un modèle généraliste principal, des variantes plus légères pour arbitrer qualité et latence, et deux modèles IBM Granite dédiés au contrôle des réponses. Interface compatible OpenAI, documentation OpenAPI, et la vitesse de génération mesurée à chaque appel.

État du moteur… Chargement…
7
modèles installés
de poids sur disque
de paramètres cumulés
100 %
auto-hébergé, aucune donnée envoyée à un tiers
Le parc

Chaque modèle a un role

Le serveur ne peut garder qu'un seul modèle en mémoire à la fois : changer de modèle implique de décharger le précédent. Les tailles et vitesses ci-dessous sont celles mesurées sur cette machine.

Chargement du catalogue…
Démarrer

Trois lignes suffisent

L'API suit le format OpenAI : vos clients existants fonctionnent en changeant l'URL de base et la clé.


        

Ce que renvoie chaque appel

En plus de la réponse, chaque résultat porte un objet metrics : vitesse de génération, temps de chargement du modèle, délai avant le premier jeton.

{
  "choices": [ … ],
  "usage": { "prompt_tokens": 24, "completion_tokens": 187 },
  "metrics": {
    "tokens_per_second": 9.02,   // vitesse de génération
    "time_to_first_token_ms": 412,
    "load_ms": 0,              // 0 = modèle déjà résident
    "eval_ms": 20732
  }
}
Accès

Connexion sans mot de passe

La plateforme fonctionne par lien de connexion : saisissez votre adresse, vous recevez un lien valable une seule fois. Si vous n'avez pas encore d'accès, demandez-le — chaque demande est examinée individuellement.

J'ai déjà un accès

Un lien de connexion vous sera envoyé par email. Il expiré au bout de 20 minutes.

Demande d'accès

Dites en quelques mots l'usage envisagé. Vous serez prévenu par email si l'accès est ouvert.