Vue lecture

Il y a de nouveaux articles disponibles, cliquez pour rafraîchir la page.

Nvidia CMP 170HX - La VRAM était bien là, bridée par le firmware

Je viens d'apprendre qu'une carte Nvidia normalement dédiée au minage de cryptomonnaies, vendue avec 8 Go de mémoire en expose aujourd'hui 64 Go, sans que rien n'ait été remplacé ou soudé dessus... C'est ça la magie de Nvidia, la mémoire était bien là depuis le début, mais était juste maintenue en sommeil par le firmware.

Cette carte, la CMP 170HX est sortie il y a 5 ans pour miner de l'Ethereum. Elle est bâtie sur le GA100, le même silicium 7 nm que l'accélérateur A100 que Nvidia vend aujourd'hui autour de 3 500 dollars en version 40 Go. Et la mémoire HBM2e qu'on y trouve est physiquement présente sur la carte, quoi qu'affiche la fiche technique. Alors certes, débrider une carte Nvidia par logiciel n'a rien de neuf puisqu'on transformait déjà des GeForce en Quadro en 2013.

Mais cette fois, le déverrouillage exploite un bug de chargement de signature dans le BootROM du Falcon, le microcontrôleur de sécurité qui garde le démarrage de la puce. Et ce dernier se fait grâce à un outil nommé cmpunlocker , publié sous licence GPL.

Si vous voulez vous lancer, il vous faudra du Linux x86-64, un accès root et le pilote libre nvidia-open en version 610.43.0x. Votre carte 8 Go passera ainsi à 64 Go, une carte 10 Go à 40 Go, et les unités de calcul bridées reviendront naturellement avec. Et surtout, ce patch survit au redémarrage !

Le PCIe, lui, ne se déverrouille qu'à moitié. Passer de Gen1 à Gen2 est logiciel, mais la largeur reste coincée à quatre lignes parce que Nvidia a laissé 24 condensateurs de couplage vides sur le circuit imprimé. Aller au-delà du x4 veut donc dire les souder à la main et ça c'est pas donné à tout le monde.

Reste que ça donne environ 1 Go/s vers la carte. À titre d'exemple, un utilisateur du forum développeurs de Nvidia a réussi à charger un modèle 70B quantifié en une quarantaine de secondes, contre une dizaine avec la modification matérielle et le Gen2 x16. Pour de l'inférence sur une seule carte, ce goulot ne se paie donc qu'au chargement.

Le même utilisateur mesure un taux de 27,3 tokens par seconde en décodage sur un modèle Qwen2.5-72B, pour 150 à 180 watts, et explique que lors de ses tests, le GPU a réclamé un reset autour de 95% d'occupation mémoire, sur de très grandes fenêtres de contexte. Rien de gênant donc. Deux réserves par contre, et elles ne sont pas décoratives.... La première c'est que l' ECC figure toujours dans la liste des problèmes non résolus du projet, avec le NVLink et le PCIe Gen4, alors que c'est précisément le mécanisme qui pourrait nous dire si la mémoire déverrouillée tient dans la durée. Et la seconde, c'est que le palier des 80 Go a été testé, mais rejeté car instable.

Sur la question qui fâche maintenant, à savoir celle du silicium mis au rebut qui serait bridé car défectueux, ValdikSS, dans un fil sur Hacker News , écrit n'avoir trouvé jusqu'ici aucune carte dont la RAM soit réellement défectueuse. Le bridage ressemble donc à de la segmentation commerciale plus qu'à du recyclage de puces ratées, mais pour le moment, personne n'a fait tourner ces 64 Go assez longtemps pour le prouver.

Reste le prix... La 170HX se trouvait peu de temps avant ça, autour de 250 dollars sur eBay mais depuis que l'exploit circule, elle dépasse les 1 000 $... Bref, le verrou a sauté, et le prix est en train d'exploser !

Source : Tom's Hardware

Un atelier japonais double la VRAM des RTX 2080 Ti pour pas cher

Dans la préfecture de Saitama, au Japon, une petite boutique s'est fait une spécialité qui tombe à pic en pleine flambée des prix de la mémoire, celle de faire passer une vieille GeForce RTX 2080 Ti de 11 à 22 Go de VRAM pour environ 45 000 yens, soit 282 dollars ou un peu moins de 250 euros.

Le procédé n'a rien d'un tour de passe-passe logiciel et repose entièrement sur une vraie dextérité au fer à souder, puisqu'il faut dessouder les onze puces GDDR6 de 1 Go montées d'origine, les remplacer par onze modules Samsung de 2 Go, ajuster quelques résistances sur le circuit imprimé que tous les modèles n'acceptent pas, puis flasher un VBIOS adapté pour que la carte reconnaisse ses nouveaux 22 Go.

La 2080 Ti se prête bien à l'exercice grâce à sa configuration mémoire un peu bâtarde de 11 Go, qui se double proprement là où d'autres cartes coincent.

Autant le dire tout de suite, ce gain ne rapporte strictement rien en jeu, le bus mémoire restant bloqué à 352 bits, la bande passante à 616 Go/s et la puissance de calcul du processeur graphique ne bougeant pas d'un pouce.

L'intérêt se trouve entièrement du côté des modèles d'intelligence artificielle que l'on fait tourner chez soi, là où c'est la quantité de mémoire disponible, et elle seule, qui détermine si un modèle parvient à se charger ou non.

En passant de 11 à 22 Go, on débloque toute une série de modèles de langage quantifiés qui refusaient jusque-là de tenir, et surtout on les garde entièrement en mémoire vidéo au lieu de déborder sur la mémoire système, ce qui change complètement la fluidité de l'ensemble.

Le calcul financier finit de rendre l'idée séduisante, avec une modification facturée 282 dollars, des cartes déjà transformées vendues à partir de 430 dollars et un ensemble complet qui tourne autour de 500 dollars une fois cumulé avec une 2080 Ti d'occasion, quand les GPU récents taillés pour l'IA et dotés d'autant de mémoire réclament facilement plus de 1 000 dollars.

Il reste quand même deux réserves de taille, à commencer par l'architecture Turing de cette carte qui remonte à 2018 et commence à accuser son âge sans profiter des optimisations des générations récentes, et surtout par la disponibilité, l'atelier n'ayant reçu que 200 puces Samsung, de quoi transformer une petite vingtaine de cartes avant de devoir se réapprovisionner.

Bref, c'est rigolo mais ça ne va pas tout de suite changer le monde.

Source : Tom's Hardware , xingyao74043

❌