Chłodzenie szaf serwerowych o wysokiej gęstości mocy w infrastrukturze AI

Wdrażanie rozwiązań AI wymaga przejścia z tradycyjnego chłodzenia powietrznego na zaawansowane systemy cieczowe zdolne obsłużyć obciążenia rzędu 100 kW na szafę. Artykuł analizuje technologie wymienników ciepła RDHEx oraz bezpośredniego chłodzenia cieczą DLC w kontekście standardów OCP. Kluczowe znaczenie dla stabilności systemów ma również zintegrowany monitoring parametrów fizycznych i zasilanie 48 V DC.

Dodaj do ulubionych źródeł w Google
Posłuchaj
00:00

Wdrażanie rozwiązań opartych na sztucznej inteligencji wymaga radykalnej zmiany podejścia do projektowania centrów danych. Tradycyjne obiekty, optymalizowane pod kątem średniej gęstości mocy od 5 do 10 kW na szafę, nie są w stanie obsłużyć nowoczesnych serwerów GPU, które generują obciążenia cieplne rzędu 30 kW, 50 kW, a nawet powyżej 100 kW. Skuteczne przygotowanie infrastruktury na potrzeby AI zależy od decyzji podjętych na wczesnym etapie planowania, obejmujących precyzyjną ocenę obciążenia cieplnego, wybór odpowiedniej architektury chłodzenia oraz integrację systemów zasilania i monitoringu.

Analiza obciążenia cieplnego jako fundament projektu

Pierwszym i najważniejszym krokiem jest określenie obciążenia cieplnego przypadającego na pojedynczą szafę, a nie na cały obiekt. W infrastrukturze AI ciepło jest skoncentrowane na niewielkiej powierzchni, co sprawia, że sumaryczna moc chłodnicza obiektu staje się parametrem drugorzędnym wobec wydajności chłodzenia punktowego. Należy uwzględnić specyfikę pracy procesorów graficznych, które podczas trenowania modeli AI pracują stale z mocą bliską znamionowej, w przeciwieństwie do serwerów ogólnego przeznaczenia o zmiennym cyklu obciążenia.

W procesie weryfikacji założeń termicznych pomocne są narzędzia takie jak RiTherm, które pozwalają na symulację warunków wewnątrz obudowy przed zakupem sprzętu. Zaleca się również angażowanie architektów rozwiązań na etapie przedspecyfikacyjnym, co pozwala uniknąć kosztownych modernizacji w przyszłości. Planowanie musi uwzględniać rezerwę wydajności, ponieważ kolejne generacje sprzętu AI charakteryzują się coraz wyższą gęstością upakowania komponentów.

Dobór architektury chłodzenia do gęstości mocy

Wybór technologii chłodzenia jest bezpośrednio uzależniony od gęstości mocy w szafie. Chłodzenie powietrzne na poziomie pomieszczenia zachowuje efektywność jedynie do granicy 10 do 15 kW. Powyżej tej wartości zarządzanie przepływem powietrza staje się nieefektywne, co prowadzi do powstawania gorących punktów i nadmiernego zużycia energii. Dla średnich gęstości, sięgających 70 kW, optymalnym rozwiązaniem są wymienniki ciepła w tylnych drzwiach (RDHEx). Urządzenia te wykorzystują obieg cieczy do przechwytywania gorącego powietrza bezpośrednio u wylotu serwerów, co pozwala na integrację z istniejącą infrastrukturą bez konieczności modyfikacji samych serwerów. Istotnym elementem wpływającym na bezpieczeństwo eksploatacji w środowisku produkcyjnym jest nadmiarowość wentylatorów w układzie N+1 oraz zastosowanie modułu sterującego typu hot-swap, który umożliwia wymianę komponentów bez przerywania pracy systemu i znacząco upraszcza procedury serwisowe.

W przypadku najbardziej wymagających klastrów AI, gdzie moc przekracza 100 kW, standardem staje się bezpośrednie chłodzenie cieczą (DLC). Technologia ta doprowadza chłodziwo bezpośrednio do procesorów, oferując najwyższą efektywność termiczną. Kluczowym elementem systemów DLC jest jednostka dystrybucji chłodziwa (CDU). Rozwiązania typu In-rack CDU zapewniają do 150 kW mocy chłodniczej wewnątrz szafy, co jest idealne przy ograniczonej przestrzeni. Z kolei jednostki In-row CDU, umieszczane między szafami, pozwalają na skalowanie wydajności powyżej 1 MW poprzez modułowe dodawanie jednostek o mocy 250 kW w układzie N+1.

Integracja platformy szafowej i systemów zasilania

Architektura chłodzenia i platforma szafowa są od siebie współzależne. Infrastruktura AI coraz częściej bazuje na standardzie Open Compute Project (OCP) i formacie 21-calowym, który umożliwia gęstsze rozmieszczenie komponentów. Przykładem takiego rozwiązania jest szafa ORV3, która integruje systemy zasilania i chłodzenia w sposób modułowy. Zastosowanie szyny zbiorczej 48 V DC bezpośrednio w szafie pozwala na redukcję liczby stopni konwersji napięcia, co zmniejsza straty energii i ogranicza ilość generowanego ciepła odpadowego.

Właściwe planowanie musi obejmować również inteligentne jednostki PDU, które umożliwiają precyzyjny pomiar zużycia energii na poziomie każdego gniazda. Widoczność poboru mocy w czasie rzeczywistym pozwala operatorom korelować obciążenie obliczeniowe z emisją ciepła, co jest niezbędne do zapobiegania awariom w środowiskach o wysokiej gęstości.

Zaawansowany monitoring i skalowalność

W systemach o mocy 100 kW anomalie termiczne lub wycieki chłodziwa postępują znacznie szybciej niż w tradycyjnych serwerowniach. System monitorowania, taki jak CMC III, musi być wdrożony przed uruchomieniem procesów obliczeniowych. Powinien on obejmować czujniki temperatury na wlocie i wylocie, kontrolę przepływu i ciśnienia chłodziwa oraz wykrywanie wycieków na poziomie komponentów. Wykorzystanie magistrali CAN-bus pozwala na łączenie wielu jednostek monitorujących w centralny system zarządzania, co zapewnia pełną kontrolę nad parametrami fizycznymi i bezpieczeństwem szaf.

Projektowanie z myślą o przyszłości wymaga uwzględnienia skalowalności na każdym poziomie. Modułowe jednostki CDU, elastyczne systemy rozdzielaczy z bezwyciekowymi złączami oraz szafy obsługujące adaptery dla starszych standardów pozwalają na płynną adaptację infrastruktury do kolejnych generacji procesorów GPU bez konieczności całkowitej przebudowy centrum danych.

Przygotowanie centrum danych na potrzeby AI wymaga priorytetowego potraktowania obciążenia cieplnego na poziomie szafy jako głównego parametru projektowego. Skuteczna strategia opiera się na doborze technologii chłodzenia adekwatnej do gęstości mocy – od wymienników drzwiowych po zaawansowane systemy bezpośredniego chłodzenia cieczą. Integracja zasilania 48 V DC oraz wielopoziomowy monitoring stanowią niezbędne dopełnienie infrastruktury, zapewniając jej wydajność, bezpieczeństwo i możliwość przyszłej rozbudowy.

Źródło: Rittal

Więcej na www.rittal.com
Chcesz częściej widzieć nasze artykuły w Google? Dodaj AutomatykaB2B do ulubionych źródeł

Zobacz więcej w kategorii: Technika
Pomiary
Nowoczesna automatyzacja i monitoring procesów w hutnictwie stali
PLC, HMI, Oprogramowanie
Centralne zarządzanie OZE stworzone na bazie zenon
Obudowy, złącza, komponenty
Zespoły przygotowania powietrza w pneumatyce: funkcje i zasady doboru
Przemysł 4.0
Jak przemysł skraca czas reakcji na awarie, nie tracąc kontroli nad bezpieczeństwem
Roboty
Całkowity koszt inwestycji w robotyzację. Co naprawdę rozstrzyga o wyniku?
Przemysł 4.0
Pompy ciepła w przemyśle
Zobacz więcej z tagiem: Przemysł 4.0
Gospodarka
Siemens Mobility inwestuje pod Poznaniem. W Gądkach powstanie nowoczesne centrum serwisowe lokomotyw
Informacje z firm
Nowoczesne technologie Datalogic dla handlu detalicznego na targach NACS Show 2026
Prezentacje firmowe
Konserwacja predykcyjna i AI w przemyśle procesowym – nowe standardy diagnostyki

Cyberbezpieczeństwo OT - od technicznego tła do elementu odporności organizacji

Systemy automatyki przemysłowej, budynkowej i infrastrukturalnej przez lata funkcjonowały jako środowiska techniczne, których kluczowym zadaniem było zapewnienie ciągłości działania procesów. Projektowane z myślą o niezawodności i stabilności, pozostawały relatywnie odseparowane od szerszej dyskusji o cyberbezpieczeństwie. Nie oznaczało to jednak, że bezpieczeństwo stanowiło kwestię drugorzędną. Wręcz przeciwnie – było wpisane w samą naturę tych systemów. Dziś zmienia się przede wszystkim to, że zaczynamy tę zależność świadomie identyfikować i wprost nią zarządzać.
Zapytania ofertowe
Unikalny branżowy system komunikacji B2B Znajdź produkty i usługi, których potrzebujesz Katalog ponad 7000 firm i 60 tys. produktów