W klastrze AI to sieć, a nie procesory graficzne, najczęściej decyduje o realnej wydajności. Trening dużych modeli polega na ciągłej synchronizacji wyników między dziesiątkami lub setkami akceleratorów - jeśli sieć wprowadza opóźnienia albo gubi pakiety, kosztowne GPU stoją bezczynnie i czekają na dane. Dlatego infrastruktura sieciowa pod AI to dziś osobna dyscyplina projektowa. Wyjaśniamy, jakie wymagania stawia i jak odpowiada na nie Dell PowerSwitch Z9864F-ON z portami 800 GbE.
Czym sieć pod AI różni się od klasycznej sieci data center?
Ruch generowany przez trening modeli AI ma charakterystykę, której klasyczne sieci nie znoszą dobrze. Po każdej iteracji obliczeń akceleratory wymieniają między sobą gradienty w operacjach zbiorczych (all-reduce) - powstają krótkie, ekstremalnie intensywne fale ruchu, w których wiele źródeł wysyła dane do tych samych odbiorców jednocześnie. Kluczowe wymagania wobec sieci to:
- Bezstratność - retransmisja zgubionego pakietu zatrzymuje całą operację zbiorczą; sieć musi aktywnie zapobiegać przeciążeniom, zanim wystąpią.
- Niskie i przewidywalne opóźnienia - o tempie iteracji decyduje najwolniejsza ścieżka; rozrzut opóźnień (jitter) jest równie groźny jak samo opóźnienie.
- Pełna, nieblokująca przepustowość - fabric dla GPU projektuje się bez oversubscription (1:1), inaczej niż sieci ogólnego przeznaczenia, o których piszemy w przewodniku o architekturze leaf-spine.
- RDMA przez Ethernet (RoCE) - dane trafiają bezpośrednio z pamięci GPU do pamięci GPU z pominięciem procesora; wymaga to od przełączników sprzętowej obsługi mechanizmów kontroli przeciążeń (PFC, ECN).
Z9864F-ON: 51,2 Tb/s w jednym urządzeniu
Dell PowerSwitch Z9864F-ON to najwydajniejszy przełącznik w portfolio Dell - zbudowany na układzie Broadcom Tomahawk 5 o przepustowości 51,2 Tb/s, z 64 portami 800 GbE w standardzie OSFP112. Każdy port można dzielić na interfejsy o niższych prędkościach, co pozwala elastycznie łączyć serwery GPU wyposażone w karty 400 GbE. W praktyce jedno urządzenie obsługuje fabric dla kilkudziesięciu serwerów akceleratorowych, a topologie wielowarstwowe skalują się do klastrów liczonych w tysiącach GPU.
Dla środowisk o mniejszej skali lub budżecie naturalnym punktem wejścia jest Z9664F-ON (64× 400 GbE, 25,6 Tb/s, Tomahawk 4) - pełny przegląd serii znajdziesz w artykule Dell PowerSwitch - przegląd portfolio.
| Parametr | Z9864F-ON | Z9664F-ON |
|---|---|---|
| Porty | 64× 800 GbE OSFP112 | 64× 400 GbE QSFP56-DD |
| Przepustowość | 51,2 Tb/s | 25,6 Tb/s |
| Układ przełączający | Broadcom Tomahawk 5 | Broadcom Tomahawk 4 |
| Typowe zastosowanie | Fabric GPU 400/800 GbE, spine AI | Fabric GPU 400 GbE, spine DC |
Ethernet zamiast InfiniBand - rola Ultra Ethernet Consortium
Przez lata sieci klastrów obliczeniowych utożsamiano z technologią InfiniBand - wydajną, ale zamkniętą i uzależniającą od jednego dostawcy. Branża odpowiedziała powołaniem Ultra Ethernet Consortium (UEC) - organizacji rozwijającej otwarte standardy, które czynią Ethernet pełnoprawnym transportem dla obciążeń AI i HPC: od nowoczesnych mechanizmów kontroli przeciążeń po transport zoptymalizowany pod RDMA. Dell Technologies jest członkiem Ultra Ethernet Consortium, a przełączniki PowerSwitch z układami Tomahawk 5 stanowią sprzętowy fundament tej strategii.
Dla klienta oznacza to konkretne korzyści: jeden zespół i jeden zestaw narzędzi do zarządzania siecią ogólną i siecią AI, otwarty rynek optyki i okablowania oraz brak uzależnienia od pojedynczego dostawcy interconnectu. Warstwą systemową jest tu Dell Enterprise SONiC z automatyzacją przez SmartFabric Manager - w tym z profilami konfiguracji RoCE, które eliminują najczęstsze błędy ręcznego strojenia QoS.
O czym pamiętać przy projektowaniu fabricu GPU?
- Projektuj bez oversubscription (1:1) - sieć AI nie toleruje wąskich gardeł między leafem a spinem.
- Oddziel fabric obliczeniowy (GPU-GPU) od sieci storage i sieci zarządzania - to trzy różne profile ruchu.
- Zaplanuj RoCE od początku: PFC i ECN muszą być spójnie skonfigurowane na każdym urządzeniu w ścieżce.
- Dobierz optykę i okablowanie do realnych odległości - przy 800 GbE koszt transceiverów to istotna pozycja budżetu.
- Zweryfikuj zasilanie i chłodzenie szaf - przełączniki tej klasy mają odpowiednio wyższe wymagania środowiskowe.
- Przetestuj fabric obciążeniowo przed oddaniem do produkcji, na wzorcach ruchu zbliżonych do treningu modeli.
Jak możemy pomóc
Budujemy kompletne środowiska AI - od serwerów GPU, przez sieć, po storage. Jako partner Dell Technologies mamy bezpośredni dostęp do zespołu Dell Networking w Polsce - od doradztwa projektowego po ceny specjalne dzięki naszemu partnerstwu. Pomożemy zwymiarować fabric pod planowaną liczbę akceleratorów i przygotujemy wycenę wraz z optyką i wdrożeniem.
Oferta Dell Networking Zapytaj o sieć pod AI →
Zobacz też stronę marki Dell Technologies w DQH, kategorię przełączniki i routing oraz infrastrukturę AI.