Clusters multi-nœuds

Cluster multi-nœuds pour entraînement distribué

Quand un seul nœud ne suffit plus, Tensorfoundrycorp assemble plusieurs machines en un cluster InfiniBand. Vous entraînez des modèles de plusieurs centaines de milliards de paramètres sur 8, 32 ou 512 GPU, avec un seul point d'entrée et un seul interlocuteur.

512 GPU maximum par cluster
4 800 € par mois et par nœud 8×H100
400 Gb/s InfiniBand par nœud, non partagé

Réservation longue

Ces machines se réservent au mois, parce qu'un entraînement distribué ne supporte pas qu'on lui coupe l'herbe sous le pied en plein milieu. On bloque donc les nœuds pour vous.

Voir comment ça se monte
Le principe

Un cluster, c'est plus qu'une addition de GPU

Le vrai sujet, ce n'est pas le nombre de cartes, c'est ce qui passe entre elles.

Un entraînement réparti sur 64 GPU peut très bien être plus lent que le même job sur 8 GPU si l'interconnexion est mauvaise. C'est pour ça qu'on ne bricole pas : chaque nœud est relié par InfiniBand 400 Gb/s, on dimensionne le réseau en fat-tree, et on vérifie le débit inter-nœuds avant de vous livrer. Vous récupérez ensuite un cluster prêt pour du tensor parallélisme, du pipeline parallélisme ou du FSDP sans avoir à négocier la couche réseau.

8 à 512 GPU par cluster livré

On adapte la taille à votre modèle. Pas besoin de prendre 512 cartes si 32 suffisent.

400 Gb/s par nœud, en full-duplex

Chaque machine dispose de sa propre liaison, elle ne partage pas la bande passante avec ses voisines.

3,2 To/s débit agrégé mesuré sur 8 nœuds

Un chiffre vérifié avec un benchmark NCCL avant chaque mise en production du cluster.

17 jours durée moyenne de réservation

C'est ce que nos clients mettent en moyenne pour boucler un run complet. Libre à vous de prendre plus court ou plus long.

Notre terrain

L'entraînement distribué, on connaît

On a construit ce service en partant de nos propres galères : des jobs qui plantent au bout de 40 heures parce qu'un nœud a des latences réseau irrégulières.

On teste le cluster avant livraison. Si un nœud tient mal la charge, il ne sort pas.

Réseau vérifié avant livraison

On lance un benchmark NCCL all-reduce sur tout le cluster. Le rapport part avec vos identifiants, vous savez exactement ce que le réseau donne.

Reprise de checkpoints intégrée

Un stockage partagé de 200 To est inclus pour vos checkpoints. Si un nœud lâche, votre run repart du dernier point sans perdre 30 heures de calcul.

Un ingénieur dédié au cluster

Au-delà de 32 GPU, vous avez un contact technique nommé, joignable sur un canal direct. Pas de ticket qui traîne dans une file.

Au mois

Ce que coûte un cluster réservé

Les prix sont mensuels, engagement de 30 jours par défaut. On peut descendre jusqu'à 90 jours pour obtenir un meilleur tarif.

Cluster 8 nœuds 32 400 € par mois, soit 4 050 € le nœud
  • 8 nœuds de 8×H100, soit 64 GPU
  • 50 To de stockage partagé
  • InfiniBand 400 Gb/s en fat-tree complet
  • Monitoring Prometheus accessible

Le bon point d'entrée pour du fine-tuning de gros modèles ou un premier run distribué.

Demander un devis
Recommandé au-delà de 30 jours Cluster 32 nœuds 121 600 € par mois, soit 3 800 € le nœud
  • 32 nœuds de 8×H100, soit 256 GPU
  • 200 To de stockage partagé
  • Ingénieur dédié joignable en journée
  • Rapport de benchmark NCCL livré
  • Sauvegarde quotidienne des checkpoints

À partir de 30 jours d'engagement, le tarif par nœud baisse mécaniquement.

Discuter du projet
Cluster sur mesure Sur devis à partir de 64 nœuds
  • Jusqu'à 512 GPU interconnectés
  • Réseau InfiniBand dimensionné au besoin
  • Astreinte technique 24/7 possible
  • Stockage froid pour archivage long

On construit l'offre avec vous, pas à partir d'un catalogue figé.

Nous écrire

Tarifs HT, engagement 30 jours minimum. Un devis précis vous est envoyé après un échange technique de 30 minutes.

Mise en route

Comment on monte votre cluster

D'un premier contact à un cluster opérationnel, il faut en général entre trois et dix jours ouvrés, selon le volume.

01

Appel de cadrage

Une demi-heure pour comprendre la taille de votre modèle, votre stratégie de parallélisme et la durée de réservation visée.

02

Choix de l'architecture réseau

On décide ensemble du type de topologie et du nombre de nœuds, pour éviter de surdimensionner la facture.

03

Devis et engagement

Vous recevez un devis détaillé : nombre de nœuds, stockage, durée, tarif par nœud et conditions de sortie.

04

Assemblage physique

Nos techniciens câblent les nœuds en InfiniBand et montent le stockage partagé. Ça se passe dans notre salle, pas chez vous.

05

Benchmark et validation

On fait tourner un all-reduce sur toute la topologie, on compare aux valeurs attendues et on vous envoie le rapport.

06

Remise des accès

Vous recevez le cluster clé en main, avec le monitoring branché et l'accès à votre ingénieur référent si le volume le justifie.

Le matériel

Ce à quoi ressemble un cluster

Quelques prises de vue de nos installations multi-nœuds et des outils qu'on livre avec.

Avant de vous lancer

Ce qu'on nous demande souvent

Pour tout ce qui touche au réseau ou au parallélisme, mieux vaut nous appeler directement.

Parler à un ingénieur

Oui, et c'est même recommandé. Beaucoup de clients démarrent sur 8 nœuds, mesurent leur scalabilité, puis étendent à 32 ou 64. On ajoute les nœuds sans redémarrer votre job, à condition de prévenir un peu à l'avance.

Le nœud qui ne fonctionne pas n'est pas facturé, et s'il perturbe un run en cours, les heures perdues vous sont créditées sur la facture suivante. On n'attend pas que vous réclamiez.

On sait les configurer, et on le fait volontiers dans le cadre d'une prestation d'intégration séparée. En dehors de ça, on vous garantit le cluster et le réseau, pas les bibliothèques tierces.

Techniquement oui, si vous avez un bucket S3 compatible. On le branche sur le cluster, mais le stockage partagé inclus reste plus rapide pour les checkpoints fréquents.

Comptez entre 8 et 14 jours ouvrés. La plupart du temps passé là-dedans, c'est la validation réseau, pas la préparation du matériel, qui est déjà en salle.

Vous avez 20 To par mois inclus, ce qui couvre largement le transfert de checkpoints. Au-delà, le tarif est de 0,005 € par Go, facturé à la fin du mois.

Cadrons votre projet

Décrivez-nous la taille de votre modèle

Plus vous nous donnez de détails sur le modèle et la stratégie de parallélisme, plus notre devis sera précis dès le premier retour.

+33 4 73 92 84 51
tensorfoundrycorp@gmail.com
Michelin, 12 Cours Sablon, 63000 Clermont-Ferrand, France

Les demandes reçues le week-end sont traitées le lundi matin.