NVIDIA a officiellement présenté la NVHBM, une nouvelle technologie de mémoire haute bande passante destinée aux partenaires développant des accélérateurs d’IA via NVLink Fusion. Selon l’entreprise, cette innovation servira également de base à l’architecture mémoire de ses futures cartes graphiques. Contrairement aux conceptions HBM standard où le contrôleur réside sur le die de calcul, NVHBM intègre ce contrôleur directement dans le die de base de la mémoire.

Des gains techniques significatifs
Les documents techniques indiquent que NVHBM offre jusqu’à 30 % de bande passante mémoire supplémentaire par empilement et réduit de 15 % la consommation d’énergie de la mémoire HBM par rapport à HBM4E. Cette modification de l’interface permet aussi d’augmenter la surface du die de calcul jusqu’à 25 %, libérant ainsi plus d’espace pour le matériel de calcul sur l’accélérateur principal.
En réduisant jusqu’à 67 % la zone nécessaire pour le PHY et son support, cette conception sur mesure simplifie le routage de l’interposer et peut fournir jusqu’à 80 % de silicium utilisable supplémentaire dans la disposition complète du package. En d’autres termes, ceci permet de réduire drastiquement la taille des éléments d’interconnexion de la mémoire au GPU, libérant plus de place pour intégrer davantage d’unités de calcul sur le GPU. La hausse des performances qui en découle est multifactorielle : davantage d’unités de calcul, une meilleure bande passante mémoire et une réduction de la consommation. Il ne serait pas exact de dire que le gain de performance est lié à 100 % à la mémoire.
Une transition vers des designs personnalisés
Cette annonce marque un tournant dans l’industrie, qui passe d’une mémoire HBM entièrement standardisée à des designs spécifiques aux clients. L’analyste Ian Cutress a noté que cette approche fait partie d’un mouvement plus large dans lequel les fournisseurs d’accélérateurs personnalisent le die de base et l’interface mémoire, rendant la mémoire HBM standard beaucoup moins courante. Selon lui, NVHBM n’est que la partie personnalisée de la HBM4 sur mesure, remplaçant une interface puce à puce par une autre.
Pour l’heure, cette technologie « a juste » été couchée sur le papier, dans le sens où elle n’a pas encore été fabriquée ni intégrée à un produit disponible à ce jour. Les puces d’IA Vera Rubin de NVIDIA utilisent de la mémoire HBM4, mais il est probable que NVIDIA intégrera NVHBM aux futures cartes graphiques de la série Feynman, dont le lancement est prévu en 2028, ou potentiellement lors d’un refresh de la série Vera.
Amazon Annapurna Labs est le premier partenaire à travailler avec NVIDIA sur NVHBM. Annapurna développe déjà Trainium4 avec la prise en charge de NVLink Fusion et NVLink 6, permettant aux accélérateurs Amazon et aux GPU NVIDIA de fonctionner au sein de la même architecture à l’échelle du rack. Bien que NVIDIA n’ait pas encore annoncé quelle génération de GPU utilisera cette technologie en premier, la validation et l’approvisionnement se feront via plusieurs fabricants de mémoire.

