Everpure place FlashBlade//EXA en tête de MLPerf Storage v3.0 sur le checkpointing de modèles de 405 et 1 250 milliards de paramètres.
Lorsque l’entraînement d’un modèle doit sauvegarder son état, les performances du stockage déterminent la vitesse à laquelle les accélérateurs peuvent reprendre leur travail. Sur ce terrain, FlashBlade//EXA d’Everpure arrive en première position dans plusieurs catégories du benchmark MLPerf Storage v3.0. La plateforme se classe en tête pour le checkpointing des modèles de 405 milliards et de 1 250 milliards de paramètres, ainsi que dans les catégories consacrées aux performances du cache KV.
877,52 Gio/s en écriture
Pour le modèle de 1 250 milliards de paramètres, le test associe 1 024 accélérateurs simulés à 30 nœuds de données. FlashBlade//EXA atteint alors 877,52 Gio/s en écriture et 588,28 Gio/s en lecture. Les opérations de checkpointing prennent respectivement 17,74 secondes en écriture et 28,99 secondes en lecture. L’enjeu est de réduire le temps pendant lequel les GPU et accélérateurs restent inactifs lors de la sauvegarde ou de la récupération de l’état du modèle.
Les résultats montrent également une progression du débit avec l’ajout de ressources. Celui-ci passe de 327,65 Gio/s avec 10 nœuds de données à 877,52 Gio/s avec 30 nœuds.
Faire évoluer stockage et calcul ensemble
FlashBlade//EXA repose sur une architecture désagrégée séparant la gestion des métadonnées du transport des données. La configuration soumise aux tests utilise 30 lames FlashBlade//EXA, 120 modules DirectFlash dédiés aux métadonnées et 30 nœuds Linux/NVMe. L’ensemble représente environ 866 To de capacité utile, accessibles via un système de fichiers unifié.
Pour Everpure, ces résultats montrent que l’augmentation des ressources de calcul dédiées à l’IA doit s’accompagner d’une progression prévisible des performances du stockage, afin d’éviter que celui-ci ne devienne un facteur limitant lors des entraînements à grande échelle.
