Wdrażanie rozwiązań opartych na sztucznej inteligencji wymaga radykalnej zmiany podejścia do projektowania centrów danych. Tradycyjne obiekty, optymalizowane pod kątem średniej gęstości mocy od 5 do 10 kW na szafę, nie są w stanie obsłużyć nowoczesnych serwerów GPU, które generują obciążenia cieplne rzędu 30 kW, 50 kW, a nawet powyżej 100 kW. Skuteczne przygotowanie infrastruktury na potrzeby AI zależy od decyzji podjętych na wczesnym etapie planowania, obejmujących precyzyjną ocenę obciążenia cieplnego, wybór odpowiedniej architektury chłodzenia oraz integrację systemów zasilania i monitoringu.
Analiza obciążenia cieplnego jako fundament projektu
Pierwszym i najważniejszym krokiem jest określenie obciążenia cieplnego przypadającego na pojedynczą szafę, a nie na cały obiekt. W infrastrukturze AI ciepło jest skoncentrowane na niewielkiej powierzchni, co sprawia, że sumaryczna moc chłodnicza obiektu staje się parametrem drugorzędnym wobec wydajności chłodzenia punktowego. Należy uwzględnić specyfikę pracy procesorów graficznych, które podczas trenowania modeli AI pracują stale z mocą bliską znamionowej, w przeciwieństwie do serwerów ogólnego przeznaczenia o zmiennym cyklu obciążenia.
W procesie weryfikacji założeń termicznych pomocne są narzędzia takie jak RiTherm, które pozwalają na symulację warunków wewnątrz obudowy przed zakupem sprzętu. Zaleca się również angażowanie architektów rozwiązań na etapie przedspecyfikacyjnym, co pozwala uniknąć kosztownych modernizacji w przyszłości. Planowanie musi uwzględniać rezerwę wydajności, ponieważ kolejne generacje sprzętu AI charakteryzują się coraz wyższą gęstością upakowania komponentów.
Dobór architektury chłodzenia do gęstości mocy
Wybór technologii chłodzenia jest bezpośrednio uzależniony od gęstości mocy w szafie. Chłodzenie powietrzne na poziomie pomieszczenia zachowuje efektywność jedynie do granicy 10 do 15 kW. Powyżej tej wartości zarządzanie przepływem powietrza staje się nieefektywne, co prowadzi do powstawania gorących punktów i nadmiernego zużycia energii. Dla średnich gęstości, sięgających 70 kW, optymalnym rozwiązaniem są wymienniki ciepła w tylnych drzwiach (RDHEx). Urządzenia te wykorzystują obieg cieczy do przechwytywania gorącego powietrza bezpośrednio u wylotu serwerów, co pozwala na integrację z istniejącą infrastrukturą bez konieczności modyfikacji samych serwerów. Istotnym elementem wpływającym na bezpieczeństwo eksploatacji w środowisku produkcyjnym jest nadmiarowość wentylatorów w układzie N+1 oraz zastosowanie modułu sterującego typu hot-swap, który umożliwia wymianę komponentów bez przerywania pracy systemu i znacząco upraszcza procedury serwisowe.
W przypadku najbardziej wymagających klastrów AI, gdzie moc przekracza 100 kW, standardem staje się bezpośrednie chłodzenie cieczą (DLC). Technologia ta doprowadza chłodziwo bezpośrednio do procesorów, oferując najwyższą efektywność termiczną. Kluczowym elementem systemów DLC jest jednostka dystrybucji chłodziwa (CDU). Rozwiązania typu In-rack CDU zapewniają do 150 kW mocy chłodniczej wewnątrz szafy, co jest idealne przy ograniczonej przestrzeni. Z kolei jednostki In-row CDU, umieszczane między szafami, pozwalają na skalowanie wydajności powyżej 1 MW poprzez modułowe dodawanie jednostek o mocy 250 kW w układzie N+1.
Integracja platformy szafowej i systemów zasilania
Architektura chłodzenia i platforma szafowa są od siebie współzależne. Infrastruktura AI coraz częściej bazuje na standardzie Open Compute Project (OCP) i formacie 21-calowym, który umożliwia gęstsze rozmieszczenie komponentów. Przykładem takiego rozwiązania jest szafa ORV3, która integruje systemy zasilania i chłodzenia w sposób modułowy. Zastosowanie szyny zbiorczej 48 V DC bezpośrednio w szafie pozwala na redukcję liczby stopni konwersji napięcia, co zmniejsza straty energii i ogranicza ilość generowanego ciepła odpadowego.
Właściwe planowanie musi obejmować również inteligentne jednostki PDU, które umożliwiają precyzyjny pomiar zużycia energii na poziomie każdego gniazda. Widoczność poboru mocy w czasie rzeczywistym pozwala operatorom korelować obciążenie obliczeniowe z emisją ciepła, co jest niezbędne do zapobiegania awariom w środowiskach o wysokiej gęstości.
Zaawansowany monitoring i skalowalność
W systemach o mocy 100 kW anomalie termiczne lub wycieki chłodziwa postępują znacznie szybciej niż w tradycyjnych serwerowniach. System monitorowania, taki jak CMC III, musi być wdrożony przed uruchomieniem procesów obliczeniowych. Powinien on obejmować czujniki temperatury na wlocie i wylocie, kontrolę przepływu i ciśnienia chłodziwa oraz wykrywanie wycieków na poziomie komponentów. Wykorzystanie magistrali CAN-bus pozwala na łączenie wielu jednostek monitorujących w centralny system zarządzania, co zapewnia pełną kontrolę nad parametrami fizycznymi i bezpieczeństwem szaf.
Projektowanie z myślą o przyszłości wymaga uwzględnienia skalowalności na każdym poziomie. Modułowe jednostki CDU, elastyczne systemy rozdzielaczy z bezwyciekowymi złączami oraz szafy obsługujące adaptery dla starszych standardów pozwalają na płynną adaptację infrastruktury do kolejnych generacji procesorów GPU bez konieczności całkowitej przebudowy centrum danych.
Przygotowanie centrum danych na potrzeby AI wymaga priorytetowego potraktowania obciążenia cieplnego na poziomie szafy jako głównego parametru projektowego. Skuteczna strategia opiera się na doborze technologii chłodzenia adekwatnej do gęstości mocy – od wymienników drzwiowych po zaawansowane systemy bezpośredniego chłodzenia cieczą. Integracja zasilania 48 V DC oraz wielopoziomowy monitoring stanowią niezbędne dopełnienie infrastruktury, zapewniając jej wydajność, bezpieczeństwo i możliwość przyszłej rozbudowy.
Źródło: Rittal
Więcej na www.rittal.com