De Instinct MI455X is de krachtigste GPU die AMD ooit bouwde: 320 miljard transistors op twee nanometer gebakken, 432 GB HBM4 en tot 40 petaflops aan FP4-rekenkracht. Toch draait het verhaal deze generatie minder om brute kracht en meer om efficiëntie en de rol van de GPU in een groter geheel.
“Het doel is niet langer om de grootste GPU te bouwen. Al hebben we er wel een behoorlijk grote gebouwd”, grapt Alan Smith, Corporate Fellow en hoofdarchitect van de Instinct-lijn, tijdens de technische briefing in San Francisco op de AMD Advancing AI-conferentie.
“Het doel is een systeem bouwen dat aansluit op de communicatie- en uitvoeringspatronen van AI-workloads. Modellen en infrastructuur evolueren samen; de volgende sprong in AI-prestaties komt uit het co-design van beide als één geheel.” De MI455X is dan ook onlosmakelijk verbonden met AMD Helios, het rack waarin 72 van deze GPU’s als één systeem samenwerken.
CDNA 5 op 2 nanometer
De MI455X bouwt op de nieuwe CDNA 5-architectuur en is een van de eerste chips op TSMC’s tweenanometerprocedé. Het blijft een chipletontwerp, maar de indeling gaat op de schop. Acht accelerator complex dies (XCD’s), geproduceerd op 2 nm, herbergen samen 256 actieve workgroup processors.
Nieuw zijn de twee fabric-and-cache-dies (FCD’s), deze gebakken op TSMC N3P: daarop verhuisde de L2-cache, nu twee blokken van 96 MB die elk door acht shader engines gedeeld worden. Samen met twee I/O-dies wordt alles verpakt met CoWoS-L packaging en 3D hybrid bonding. Die herverdeling levert drie keer zoveel cachebandbreedte op als de infinity cache van de MI355X, en tot vier keer bandbreedteversterking door tensordata via multicast naar meerdere rekeneenheden tegelijk te sturen.


Ook fundamenteel: CDNA 5 stapt over op native Wave32-uitvoering, bekend uit de RDNA-consumentenkaarten, en laat Wave64 definitief los. Waar een instructie voorheen vier cycli nodig had om door een zestien lanes brede SIMD te stromen, start de MI455X elke cyclus een nieuwe instructie op een 32 lanes brede eenheid. Dat verlaagt de instructielatency en de straf op vertakkende code.
Verder ondersteunt de chip de volledige OCP MX-standaard voor blokgeschaalde dataformaten, inclusief fractionele schaling die FP4-training praktisch bruikbaar maakt door kwantisatiefouten te drukken.
De cijfers
| Specificatie | Instinct MI455X | T.o.v. Instinct MI355X |
| Procedé | 2 nm (TSMC), chiplets | — |
| Transistors | 320 miljard | — |
| Geheugen | 432 GB HBM4 (12 stacks) | Tot 1,5x meer |
| Geheugenbandbreedte | 23,3 TB/s | Tot 2,9x meer |
| Piek MXFP4 | 40,26 petaflops | Tot 4x meer |
| Piek MXFP8/FP8 | 20,13 petaflops | Tot 4x meer |
| Piek MXFP6 | 20,13 petaflops | Tot 2x meer |
| Matrix FP16/BF16 | 5,03 petaflops | Tot 2x meer |
| L2-cache | 2x 96 MB globaal gedeeld | Nieuwe cachehiërarchie |
| Scale-up bandbreedte | 3,6 TB/s per GPU (UALoE) | — |
Die specificaties vertalen zich volgens AMD in tot 34 keer meer token-doorvoer en tot achttien keer lagere kosten per token dan de Instinct MI355X, gemeten op DeepSeek V4 Flash met FP4. Opvallend: op de briefing benadrukte software-topman Anush Elangovan dat de kerncijfers, 20 petaflops FP4 en 20 TB/s HBM-bandbreedte, gemeten waarden zijn op draaiende hardware in het AMD-lab, geen projecties.

Efficiëntie boven pk’s
Spierballen rollen is leuk, maar de interessantste innovaties zitten in de benutting ervan. “We moeten tegelijk optimaliseren voor compute, geheugen, communicatie, energie-efficiëntie en kostprijs”, aldus Smith. De MI455X krijgt daarvoor een arsenaal nieuwe technieken: een Tensor Data Mover die geheugentransfers overlapt met rekenwerk, workgroup clusters die programmeurs controle geven over dataplaatsing, gesplitste barriers voor efficiëntere synchronisatie, en fors lagere kernel-opstartlatency zodat ook korte kernels de machine gevuld houden.

De volledig herwerkte DMA-architectuur verdeelt datatransfers automatisch over de beschikbare verbindingen, rekening houdend met congestie op het netwerk.
Ook dichter bij de rekenkernen groeit alles mee met de eisen van moderne modellen. De lokale datastore per workgroup processor verdubbelt in capaciteit en bandbreedte, en een thread kan voortaan tot 1.024 registers aanspreken in plaats van 256, nodig om de bredere vectoreenheden gevuld te houden.
Voor de flexibiliteit ondersteunt de MI455X verschillende NUMA-modi: draai de GPU als één groot geheugendomein, splits hem in twee, of partitioneer hem tot maximaal acht kleinere virtuele GPU’s voor gevirtualiseerde omgevingen.

Beveiliging schaalt bovendien mee van chip naar rack: een hardwarematige root of trust en confidential computing beschermen modelgewichten, prompts en KV-caches tijdens uitvoering, en via virtuele pods binnen AMD Helios blijven huurders volledig van elkaar geïsoleerd.
Twee smaken: MI455X en MI430X
De MI400-reeks bestaat bij lancering uit twee leden met elk hun doelpubliek.
| Instinct MI455X | Instinct MI430X | |
| Doelgroep | Frontier-AI en AI-factories | Sovereign AI en HPC |
| Inzet | AMD Helios rackscale (72 GPU’s per rack) | Klassieke mesh-gebaseerde HPC-clusters |
| Sterkte | Tot 40 PF FP4, maximale token-doorvoer | Tot 288 TFLOPS hardwarematige FP64 |
| Geheugen | 432 GB HBM4 | HBM4 |
Met de MI430X speelt AMD zijn oude HPC-troef uit: waar de concurrentie hardwarematige FP64 grotendeels losliet, combineert AMD dankzij zijn chipletaanpak FP4-AI-rekenkracht met volwaardige dubbele precisie voor wetenschappelijk rekenwerk. Dat maakt de kaart geknipt voor onderzoeksinstellingen die AI en simulatie op dezelfde infrastructuur draaien.
De motor van Helios
De MI455X is uitdrukkelijk ontworpen als motor van AMD Helios, het rackscale-systeem dat AMD gelijktijdig lanceert. Daarin werken 72 MI455X’en samen met per vier GPU’s één Epyc Venice SP7-processor, die via coherente Infinity Fabric aan 256 GB/s per GPU mee in het geheugendomein stapt in plaats van louter als PCIe-host te fungeren.

Elke GPU beschikt over 3,6 TB/s scale-up bandbreedte via UALink over Ethernet en plaats voor drie 800G-netwerkkaarten voor scale-out. Opgeteld levert dat een rack op met 31 TB HBM4, 2,9 exaflops FP4-rekenkracht en 260 TB/s aan interne bandbreedte, waarin elke GPU elke andere GPU in één hop bereikt.
En Nvidia?
De lat ligt uiteraard bij Nvidia’s Vera Rubin NVL72, aangekondigd op CES en net als Helios voorzien voor de tweede jaarhelft. AMD claimt op papier vijftien procent meer FP4-compute, 50 procent meer HBM-geheugen en tot 30 procent meer tokens per dollar; op scale-up bandbreedte eindigen beide racks met 260 TB/s op een gelijkspel.
Die vergelijking verdient wel een kanttekening: AMD zet eigen metingen en modellen af tegen de gepubliceerde specificaties van een rack dat evenmin al bij klanten draait, terwijl Nvidia van zijn kant vijf keer de inferentieprestaties van Blackwell en tien keer lagere tokenkosten belooft. Papier is voorlopig geduldig, aan beide kanten.
Bovendien blijft Nvidia’s echte slotgracht de software. AMD-topman Andrew Dieckmann mag CUDA op de briefing dan een “non-event” noemen, dat is wel AMD dat over zijn grootste handicap spreekt: het gros van de AI-tooling, documentatie en ontwikkelaars leeft nog altijd in Nvidia’s ecosysteem, en Vera Rubin schuift aan bij een klantenbestand dat vandaag al op Blackwell draait.
AMD geeft bovendien zelf toe dat vergelijkingen tussen GPU-leveranciers vooral momentopnames zijn van wiens software het verst staat. Een waarheid die evengoed in zijn nadeel kantelt zodra Nvidia zijn stack updatet.
De roadmap ligt intussen vast: de MI500-serie volgt in 2027 met de volgende generatie HBM en een groter scale-up domein met koper- én optische interconnects, terwijl de MI600 al in ontwikkeling is. Belangrijker: met OpenAI, Meta, Anthropic, Microsoft en Oracle zetten de zwaarste GPU-kopers ter wereld voor het eerst gigawatts aan Nvidia-alternatief in de steigers.
De MI455X hoeft Vera Rubin daarvoor niet op elk vlak te kloppen; hij moet vooral bewijzen dat de tweede leverancier eindelijk volwassen is. Op papier is dat bewijs geleverd, in de tweede jaarhelft moet het in draaiende datacenters gebeuren.
