Aller au contenu principal

Les Écrins depuis Briançon, éclairés par le ciel de l’instant · Relief : IGN LiDAR HD, Copernicus · Photographies aériennes : IGN, EOX · Voie lactée : ESO/S. Brunier · Étoiles : HYG

Inférence IA souveraine

Des modèles ouverts servis depuis nos GPU, sans une goutte d’eau. Vos prompts restent en France.

Sur devis, dimensionné au besoin réel.

  • Modèles Ouverts, poids téléchargeables
  • Données 100 % France
  • Eau Zéro litre, refroidissement à l’air
  • Supervision Vauban, en local

Un prompt, c’est une donnée métier

Envoyer vos prompts à une API américaine, c'est exporter vos données métier — souvent les plus sensibles — hors de l'Union européenne, et dépendre d'un modèle qui peut changer ou disparaître du jour au lendemain.

Un contrat relu, un dossier patient résumé, un cahier des charges reformulé : ce que vous envoyez à un modèle est souvent ce que vous avez de plus sensible. La question n’est pas seulement « le modèle est-il bon », mais « où part le texte, et sous quelle juridiction ».

Des modèles ouverts, servis depuis nos GPU

Nous servons des modèles ouverts depuis nos propres nodes GPU. Le texte que vous envoyez est traité sur notre matériel, en France, et n’est confié à aucune API tierce.

Les poids sont ouverts et téléchargeables : le modèle que vous validez aujourd’hui ne peut pas être retiré du catalogue ni remplacé par une autre version du jour au lendemain. Ce que vous recettez reste ce que vous servez.

Et sans une goutte d’eau. Nos GPU sont refroidis par l’air de Briançon, à 1 326 m : aucun circuit d’eau, aucune tour de refroidissement, rien qui s’évapore. Là où tant de datacenters d’IA consomment de l’eau pour refroidir leurs cartes, notre inférence n’en consomme pas un litre.

Deux familles de modèles, deux usages

Deux architectures, qui ne se choisissent pas au hasard. Le modèle retenu pour votre cas est arrêté au cadrage : l’écosystème bouge trop vite pour qu’un nom gravé sur une page ait un sens.

Le dense

Un modèle dense mobilise l’intégralité de ses paramètres à chaque token généré. C’est le calcul le plus régulier et le plus prévisible : la qualité ne dépend pas d’un aiguillage interne. En contrepartie, chaque token coûte le modèle entier.

Le MoE

Un modèle « mixture of experts » stocke beaucoup de paramètres mais n’en active qu’une fraction par token, routé vers les experts pertinents. Dit simplement : beaucoup de connaissances stockées, peu de calcul dépensé à chaque mot, donc davantage de débit à énergie égale.

Trois mots qui décident du coût réel

Quantification
Les poids d’un modèle peuvent être stockés avec une précision réduite. Le modèle occupe alors nettement moins de mémoire vidéo et se lit plus vite, au prix d’une approximation des poids. C’est ce qui permet de servir un modèle sérieux sur une carte raisonnable, plutôt que d’empiler du matériel. Le format retenu se décide par la mesure, carte par carte et modèle par modèle.
Décodage spéculatif
Plutôt que de produire un mot puis d’attendre, le moteur propose plusieurs tokens d’avance et le modèle les vérifie d’un bloc. Ce qui est validé est gardé, le reste est jeté. Le texte produit reste identique : seul le temps d’attente diminue.
Débit mesuré
Nous tenons nos propres bancs de mesure, et nous publions ce qu’ils donnent dans le carnet « Découvertes ». Un débit n’a de sens qu’attaché à un modèle, à une carte, à une longueur de contexte et à un nombre de requêtes simultanées : c’est pourquoi nous le remesurons sur votre cas avant de chiffrer, plutôt que d’afficher un chiffre de brochure.

Le périmètre, sans zone grise

  • Modèles ouverts servis depuis nos propres nodes GPU
  • Architecture (dense ou MoE) et dimensionnement choisis selon votre besoin de qualité, de débit et de contexte
  • Débit et longueur de contexte mesurés sur votre cas avant chiffrage
  • Vauban, notre IA gardienne hébergée en local, supervise la disponibilité et la sobriété
  • Prompts et données traités en France, hors Cloud Act
  • GPU refroidis par l’air de la montagne : aucun circuit d’eau, aucune évaporation, zéro litre consommé
  • Retours d’expérience publiés dans le carnet « Découvertes »

Une IA gardienne, hébergée en local

Comme les forteresses qui veillent sur Briançon, Vauban veille sur l’infrastructure. C’est notre IA gardienne : elle tourne sur nos propres machines, en France, et ne délègue sa surveillance à aucun service tiers. Elle observe en continu, 24/7, sans intervention humaine.

  • Disponibilité des services : chaque workload répond ; les services endormis se réveillent à la demande.
  • Sobriété énergétique : traque du gaspillage, ressources surdimensionnées, workloads jamais mis en veille.
  • Performance et conformité : contrôle continu des bonnes pratiques (performance, sécurité, éco-conception).

À qui ce service s’adresse

  • Organisations qui veulent de l'IA sans exporter leurs documents internes
  • Équipes techniques qui évaluent le coût réel de l’inférence auto-hébergée
  • Structures publiques et professions à secret (santé, droit, RH)

Nos retours d’expérience sont publics

Choix du matériel, quantification, contexte long, mesures de débit : ce que nous apprenons en servant des modèles est écrit dans « Découvertes », notre carnet technique. Vous pouvez juger sur pièces avant de nous écrire.

Lire le carnet Découvertes

Parlons de votre cas d’usage

Dites-nous ce que vous voulez faire faire à un modèle, et sur quels documents. On répond avec une architecture, une mesure et un chiffrage.

contact@sobercloud.fr 06 71 37 01 88 Briançon, Hautes-Alpes