Blog · mesures et retours d'incident · mis à jour en avril

Le blog Tensorfoundrycorp sur le coût réel des GPU

Le blog Tensorfoundrycorp publie des mesures réelles sur la location GPU, les temps d'entraînement et la facture qu'on ne voit jamais venir avant le premier run.

2 articles en ligne, écrits à partir de nos propres runs
400+ entraînements supervisés qui alimentent ces chiffres
0 article sponsorisé, aucun fournisseur ne paie pour figurer ici

Pourquoi ce blog existe

On écrit ce qu'on mesure, pas ce qu'on aimerait vendre.

La plupart des pages qui parlent de location de GPU annoncent des tarifs sans jamais dire ce que coûte un run raté. Chez Tensorfoundrycorp, on voit passer ces factures toutes les semaines, et elles ne ressemblent presque jamais aux estimations faites avant le premier job. On a fini par noter les écarts.

Ce blog n'est pas un canal marketing. C'est là qu'on publie les temps réels de nos nœuds H100 et A100, les taux d'occupation qu'on observe chez nos clients, les erreurs de configuration qui plombent une facture sans que personne ne s'en aperçoive, et les arbitrages qu'on assume en interne. Le chiffre de 62 % d'efficacité linéaire au-delà de quatre nœuds, par exemple, est sorti directement de nos mesures. Il ne nous flatte pas, il vous évite de surdimensionner.

Nos articles

Les deux publications en ligne aujourd'hui

H100 ou A100 : quel GPU choisir pour votre entraînement ?

H100 ou A100 : quel GPU choisir pour votre entraînement ?

Les deux cartes cohabitent dans nos baies et on les facture au même client toutes les semaines. La H100 fait gagner du temps, l'A100 coûte moins cher à la seconde, et le bon choix dépend surtout de la taille de votre modèle et du nombre d'époques. On a repris six runs réels pour comparer les deux séries chiffre par chiffre, bande passante mémoire incluse.

Lire l'article
Cinq leviers pour réduire la facture de vos entraînements GPU

Cinq leviers pour réduire la facture de vos entraînements GPU

Charger les données au bon endroit, monter le batch jusqu'à la limite de la mémoire, garder les checkpoints moins longtemps, s'arrêter vraiment quand un essai ne converge pas, tracer les hyperparamètres. Cinq leviers qui sont tous mesurables, et qui ont fait tomber la facture de trois clients de plus de 30 % sans changer une seule carte.

Lire l'article

Commentaires et contributions

Les corrections viennent aussi des lecteurs

Deux lecteurs nous ont signalé une erreur d'unité sur le débit NVMe dans le premier article, et un ingénieur en compression nous a fait remarquer que la bande passante mémoire des A100 n'est pas le seul facteur limitant sur les modèles à contexte long. On corrige quand on se trompe.

Les sujets qu'on prépare

Ce qui sortira dans les prochaines semaines

Trois sujets sont en cours d'écriture. On ne publie rien tant que les chiffres ne sont pas stables sur au moins dix runs.

01

Le coût réel du passage à 16 cartes

On a mesuré l'efficacité linéaire sur sept configurations différentes. Le résultat n'est pas joli pour les modèles de moins de vingt milliards de paramètres, et personne n'en parle.

02

Reprise sur incident, ce qui marche vraiment

Le checkpointer qu'on utilise écrit toutes les 250 étapes, mais la vraie question est ce qu'il faut y mettre : état de l'optimiseur, échantillonneur, random state. Une histoire de vingt secondes et de trois jours de travail perdu.

03

Comparatif des solutions de stockage pour entrée/sortie

NVMe local, S3, NFS partagé. On a fait tourner le même dataset sur trois modes de lecture et mesuré la part du temps GPU réellement occupée. Surprise : le plus simple n'est pas toujours le plus lent.

Nos offres

Ce qui tourne derrière ces articles

Les chiffres publiés ici sortent directement de nos nœuds. Si vous voulez louer les mêmes machines, les deux pages ci-dessous expliquent ce qu'on facture exactement.

Voir la grille tarifaire

Location de serveurs GPU H100 et A100 à l'heure

Un nœud, une carte, une heure. Facturation à la seconde, aucun frais de mise en route.

Voir l'offre

Cluster multi-nœuds pour entraînement distribué

Huit à trente-deux nœuds reliés en InfiniBand 400 Gb/s. Efficacité linéaire annoncée avant la facture.

Voir le cluster

Questions fréquentes

Les questions qu'on nous pose sur le blog

Les chiffres publiés sont-ils retouchés pour être plus vendeurs ?

Non, et certains nous coûtent des clients. Le 62 % d'efficacité linéaire au-delà de quatre nœuds, on l'aurait préféré à 85 %, mais il n'y est pas. Quand un chiffre est mesuré sur un seul run ou sur une configuration atypique, on le précise dans l'article.

Vous acceptez des articles invités ou sponsorisés ?

Non aux articles sponsorisés. Pour les contributions, ça dépend. On publie volontiers un retour d'expérience rédigé par une équipe cliente s'il contient des chiffres mesurés et une base réutilisable. Les annonces produit déguisées en article, on ne les publie pas.

À quelle fréquence publiez-vous ?

Quand on a quelque chose à dire, ce qui donne en pratique un article par mois en moyenne. On préfère ça à un rythme forcé qui produirait de la paraphrase des articles précédents.

Je peux reproduire vos benchmarks chez moi ?

Oui, et c'est même le but. Chaque article indique la configuration utilisée, la taille de séquence, le batch effectif et la version de la pile logicielle. Si un paramètre manque, écrivez-nous et on le donnera. Les conditions d'usage figurent dans les conditions générales d'utilisation.

Prochaine étape

Un projet d'entraînement, une question de coût ? Écrivez-nous

Décrivez le modèle, la taille du dataset et le nombre d'époques. On vous renvoie une durée estimée et un prix à l'heure, sans engagement. Si vous hésitez entre la location horaire et un cluster dédié, on vous orientera en fonction de vos volumes, pas de ce qui nous rapporte le plus.