Coûts et calculs · 7 min de lecture

Combien coûte vraiment une heure de GPU pour entraîner un modèle

Tensorfoundrycorp décompose la facture d'un entraînement réel, poste par poste, avec les tarifs à l'heure pratiqués en France en 2025. On y parle de H100, de A100, de stockage NVMe, de temps d'attente entre deux jobs et de la ligne qu'on oublie toujours de compter, celle des essais ratés. À la fin, vous saurez estimer votre budget avant même d'ouvrir un terminal.

Un GPU à l'heure, ça ressemble à un prix simple. En pratique, trois lignes arrivent toujours ensemble : la carte, le stockage et le réseau interne entre les nœuds. Chez Tensorfoundrycorp, on facture les trois, et rien d'autre ne se glisse dans le total. Pas de frais de mise en route, pas de facturation au minimum de dix minutes quand votre job en dure deux.

Voilà les tarifs publics, hors TVA, réservés aux clients qui paient à l'heure. Ils baissent dès qu'on passe sur un engagement mensuel, ce qui est logique : une carte réservée pour vous ne sert à personne d'autre, et on peut la laisser tourner sans la replanifier toutes les dix minutes.

Grille horaire

Ce qu'on facture, ligne par ligne

H100 80 Go SXM, nœud de 8 cartes 25,60 € / h
A100 80 Go SXM, nœud de 8 cartes 14,80 € / h
L40S 48 Go, nœud de 4 cartes 4,40 € / h
NVMe en cluster, RAID local 0,18 € / To / h
InfiniBand 400 Gb/s entre nœuds inclus
Snapshot sortant vers votre S3 0,011 € / Go

Le calcul complet d'un fine-tuning 7B

Prenons un cas concret, celui qu'on voit passer trois fois par semaine. Un modèle 7B en LoRA, 60 000 échantillons, contexte de 4k tokens, deux époques. Sur un nœud de 8×H100, la boucle prend 9 heures et 20 minutes quand la lecture de données suit. En ajoutant les checkpoints, la préparation du dataset et une reprise après un plantage de script, on tombe sur 12 heures de réservation réelle.

Facture : 12 fois 25,60, soit 307,20 €. Ajoutez 40 Go de checkpoints intermédiaires gardés 72 heures, environ 0,52 €, et 60 Go de transfert sortant, moins d'un euro. Le vrai sujet n'est pas là. Le vrai sujet, c'est que la première tentative n'a pas convergé et qu'il a fallu la refaire deux fois. Trois runs, c'est 921,60 €.

921,60 € coût réel d'un fine-tuning 7B mené trois fois avant d'obtenir un modèle utilisable

Ce que les gens sous-estiment, ce n'est pas le prix de la carte. C'est le nombre de fois qu'ils vont relancer le même entraînement avant que la loss arrête de danser.

Camille Berthier, ingénieure plateforme chez Tensorfoundrycorp

Le cas du modèle 70B et du multi-nœuds

Au-delà de 30B, on change de catégorie. Le modèle ne tient plus sur un seul nœud, il faut répartir sur deux ou quatre machines, et le réseau entre les cartes devient le facteur limitant. Sur notre cluster InfiniBand 400 Gb/s, un 70B en full fine-tuning sur 32 cartes tourne à environ 62 % de l'efficacité linéaire. Autrement dit, doubler le nombre de cartes ne divise pas le temps par deux, ça le divise par 1,6.

Concrètement, un run de 70B qui prendrait 40 heures sur 8 cartes en prendra 29 sur 16. Vous payez 16 cartes pendant 29 heures au lieu de 8 pendant 40, soit 11 878 € contre 8 192 €. Le passage à l'échelle coûte de l'argent tant que le réseau ne suit pas. C'est pour cette raison qu'on ne propose pas de location multi-nœuds sur du matériel non-Infiniband : le client paierait plus cher pour aller moins vite, et il n'y verrait rien avant la facture.

Ce qui alourdit la note

Cinq lignes qu'on voit dans presque tous les dépassements

01

La carte qui attend les données

Chargez un dataset depuis un S3 mal rangé et le GPU passe 40 % de son temps à ne rien faire. Un chargement séquentiel bien fait change la facture plus que n'importe quelle optimisation de kernel.

02

Les checkpoints gardés pour rien

Un checkpoint toutes les 500 étapes, gardés trois semaines, ça finit par coûter plus cher que le run lui-même. Une politique de rétention à 72 heures suffit dans 9 cas sur 10.

03

Les nœuds oubliés au repos

Un job fini à 3 h du matin, personne ne coupe la réservation avant le lendemain à 10 h. Sept heures de H100 à ne rien faire, c'est 179 €. Nos réservations expirent automatiquement après 15 minutes d'inactivité GPU.

04

Le batch trop petit

Batch de 4 sur une carte de 80 Go, c'est de la place perdue. Tant que la mémoire le permet, monter le batch jusqu'à la limite fait tomber le coût par token, parfois du simple au double.

05

Les essais non tracés

Sans suivi de version des hyperparamètres, on refait le même run sans le savoir. C'est la ligne la plus chère, et elle n'apparaît sur aucune facture.

En images

Le cluster tel qu'on le loue

Quatre baies, 32 nœuds H100, un switch InfiniBand non bloquant. Rien d'exotique, juste du matériel maintenu et une comptabilité propre.

FAQ

Les questions qu'on nous pose le plus

La facturation démarre quand exactement ?

Au premier octet envoyé sur la carte, pas à la création du conteneur. Le temps d'installation d'une image Docker n'est pas compté, on le sait pénible et on préfère ne pas le faire payer.

Vous facturez à la seconde ou à l'heure entamée ?

À la seconde, avec un minimum d'une minute. Un job de test de 90 secondes vous coûte 6 centimes, pas 25,60 € comme chez certains fournisseurs qui arrondissent à l'heure.

Est-ce que je peux réserver un nœud pour plusieurs mois ?

Oui. Un nœud de 8×H100 réservé au mois tombe à 14 900 €, soit une baisse d'environ 25 % sur l'horaire. Sur 12 mois, on descend à 12 400 € par mois, engagement ferme, résiliation possible au bout de trois mois.

Et si mon run plante au bout de six heures ?

Vous ne payez que les six heures, plus la reprise. Un checkpointer est fourni avec chaque image de base, il écrit toutes les 250 étapes par défaut et vous reprenez au dernier point sans repartir de zéro.

L'autrice

Camille Berthier

Ingénieure plateforme chez Tensorfoundrycorp depuis 2021. Elle a supervisé plus de 400 entraînements multi-nœuds sur notre cluster et passe la moitié de son temps à expliquer à des équipes pourquoi leur job rame alors que la carte est vide.

Camille Berthier, ingénieure plateforme

Passer au calcul

Dites-nous quel modèle vous voulez entraîner, on vous donne le devis horaire

Envoyez-nous la taille du modèle, la taille du dataset et le nombre d'époques. On vous renvoie une estimation de durée et un prix à l'heure, sans engagement. Une description approximative suffit pour commencer.