Infolinia: +48 690 479 761 Wsparcie 24/7 - jesteśmy dostępni
PL · EN · DE

Sieć pod klastry AI - Dell PowerSwitch Z9864F-ON i 800 GbE

W klastrze AI to sieć, a nie procesory graficzne, najczęściej decyduje o realnej wydajności. Trening dużych modeli polega na ciągłej synchronizacji wyników między dziesiątkami lub setkami akceleratorów - jeśli sieć wprowadza opóźnienia albo gubi pakiety, kosztowne GPU stoją bezczynnie i czekają na dane. Dlatego infrastruktura sieciowa pod AI to dziś osobna dyscyplina projektowa. Wyjaśniamy, jakie wymagania stawia i jak odpowiada na nie Dell PowerSwitch Z9864F-ON z portami 800 GbE.

Czym sieć pod AI różni się od klasycznej sieci data center?

Ruch generowany przez trening modeli AI ma charakterystykę, której klasyczne sieci nie znoszą dobrze. Po każdej iteracji obliczeń akceleratory wymieniają między sobą gradienty w operacjach zbiorczych (all-reduce) - powstają krótkie, ekstremalnie intensywne fale ruchu, w których wiele źródeł wysyła dane do tych samych odbiorców jednocześnie. Kluczowe wymagania wobec sieci to:

  • Bezstratność - retransmisja zgubionego pakietu zatrzymuje całą operację zbiorczą; sieć musi aktywnie zapobiegać przeciążeniom, zanim wystąpią.
  • Niskie i przewidywalne opóźnienia - o tempie iteracji decyduje najwolniejsza ścieżka; rozrzut opóźnień (jitter) jest równie groźny jak samo opóźnienie.
  • Pełna, nieblokująca przepustowość - fabric dla GPU projektuje się bez oversubscription (1:1), inaczej niż sieci ogólnego przeznaczenia, o których piszemy w przewodniku o architekturze leaf-spine.
  • RDMA przez Ethernet (RoCE) - dane trafiają bezpośrednio z pamięci GPU do pamięci GPU z pominięciem procesora; wymaga to od przełączników sprzętowej obsługi mechanizmów kontroli przeciążeń (PFC, ECN).

Z9864F-ON: 51,2 Tb/s w jednym urządzeniu

Dell PowerSwitch Z9864F-ON to najwydajniejszy przełącznik w portfolio Dell - zbudowany na układzie Broadcom Tomahawk 5 o przepustowości 51,2 Tb/s, z 64 portami 800 GbE w standardzie OSFP112. Każdy port można dzielić na interfejsy o niższych prędkościach, co pozwala elastycznie łączyć serwery GPU wyposażone w karty 400 GbE. W praktyce jedno urządzenie obsługuje fabric dla kilkudziesięciu serwerów akceleratorowych, a topologie wielowarstwowe skalują się do klastrów liczonych w tysiącach GPU.

Dell PowerSwitch Z9864F-ON - 64 porty 800 GbE, 51,2 Tb/s, Broadcom Tomahawk 5

Dla środowisk o mniejszej skali lub budżecie naturalnym punktem wejścia jest Z9664F-ON (64× 400 GbE, 25,6 Tb/s, Tomahawk 4) - pełny przegląd serii znajdziesz w artykule Dell PowerSwitch - przegląd portfolio.

ParametrZ9864F-ONZ9664F-ON
Porty64× 800 GbE OSFP11264× 400 GbE QSFP56-DD
Przepustowość51,2 Tb/s25,6 Tb/s
Układ przełączającyBroadcom Tomahawk 5Broadcom Tomahawk 4
Typowe zastosowanieFabric GPU 400/800 GbE, spine AIFabric GPU 400 GbE, spine DC

Ethernet zamiast InfiniBand - rola Ultra Ethernet Consortium

Przez lata sieci klastrów obliczeniowych utożsamiano z technologią InfiniBand - wydajną, ale zamkniętą i uzależniającą od jednego dostawcy. Branża odpowiedziała powołaniem Ultra Ethernet Consortium (UEC) - organizacji rozwijającej otwarte standardy, które czynią Ethernet pełnoprawnym transportem dla obciążeń AI i HPC: od nowoczesnych mechanizmów kontroli przeciążeń po transport zoptymalizowany pod RDMA. Dell Technologies jest członkiem Ultra Ethernet Consortium, a przełączniki PowerSwitch z układami Tomahawk 5 stanowią sprzętowy fundament tej strategii.

Dla klienta oznacza to konkretne korzyści: jeden zespół i jeden zestaw narzędzi do zarządzania siecią ogólną i siecią AI, otwarty rynek optyki i okablowania oraz brak uzależnienia od pojedynczego dostawcy interconnectu. Warstwą systemową jest tu Dell Enterprise SONiC z automatyzacją przez SmartFabric Manager - w tym z profilami konfiguracji RoCE, które eliminują najczęstsze błędy ręcznego strojenia QoS.

O czym pamiętać przy projektowaniu fabricu GPU?

  • Projektuj bez oversubscription (1:1) - sieć AI nie toleruje wąskich gardeł między leafem a spinem.
  • Oddziel fabric obliczeniowy (GPU-GPU) od sieci storage i sieci zarządzania - to trzy różne profile ruchu.
  • Zaplanuj RoCE od początku: PFC i ECN muszą być spójnie skonfigurowane na każdym urządzeniu w ścieżce.
  • Dobierz optykę i okablowanie do realnych odległości - przy 800 GbE koszt transceiverów to istotna pozycja budżetu.
  • Zweryfikuj zasilanie i chłodzenie szaf - przełączniki tej klasy mają odpowiednio wyższe wymagania środowiskowe.
  • Przetestuj fabric obciążeniowo przed oddaniem do produkcji, na wzorcach ruchu zbliżonych do treningu modeli.

Jak możemy pomóc

Budujemy kompletne środowiska AI - od serwerów GPU, przez sieć, po storage. Jako partner Dell Technologies mamy bezpośredni dostęp do zespołu Dell Networking w Polsce - od doradztwa projektowego po ceny specjalne dzięki naszemu partnerstwu. Pomożemy zwymiarować fabric pod planowaną liczbę akceleratorów i przygotujemy wycenę wraz z optyką i wdrożeniem.

Oferta Dell Networking Zapytaj o sieć pod AI →

Zobacz też stronę marki Dell Technologies w DQH, kategorię przełączniki i routing oraz infrastrukturę AI.

Kontakt

Zapytaj o wycenę lub konsultację

Odpowiadamy w ciągu 1-2 dni roboczych. Zapraszamy do kontaktu telefonicznego w godzinach 8-17. Oczywiście Klienci z odpowiednią umową SLA mają dostępną linię 24/7.

Dane firmyDQH Solutions Sp. z o.o.ul. Lęborska 3B, 80-386 GdańskNIP: 584 281 60 64
OddziałyWarszawa
Telefon: +48 690 479 761
Kontakt mailowy: kontakt@dqh.plKontakt z działem handlowym: handlowy@dqh.pl
Administratorem danych jest DQH Solutions Sp. z o.o. Zgłoszenie trafia bezpośrednio do naszego działu handlowego i do wewnętrznego rejestru zapytań. Przysługuje Ci prawo dostępu, sprostowania, usunięcia i sprzeciwu - szczegóły w polityce prywatności. Formularz chroniony przez reCAPTCHA v3 - obowiązują Polityka prywatności i Warunki usługi Google.