زمانی که سرورهای هوش مصنوعی به فناوری خنک کننده بالاتری نیاز دارند! چرا روند از "خنک کننده هوا" به "خنک کننده مایع" تغییر می کند
Aug 23, 2024
پیام بگذارید
جنسن هوانگ، مدیر عامل انویدیا، برای حمایت از سخنرانی رئیس Supermicro، چارلز لیانگ، در COMPUTEX 2023 ظاهر شد. لین یوشن، رئیس Fanner اشاره کرد که اکثر محصولات سرور نمایش داده شده روی صحنه، دارای ماژول های خنک کننده آب Fanner هستند. فانر، که سالها در ماژولهای خنککننده آب سرمایهگذاری کرده است، در موقعیت خوبی برای سرمایهگذاری از این موج هوش مصنوعی قرار دارد. با این حال، از آنجایی که سرورهای هوش مصنوعی به طور فزاینده ای استانداردهای خنک کننده بالاتری را طلب می کنند، چرا این روند از "خنک کننده هوا" به "خنک کننده مایع" تغییر می کند؟
I از عملکرد با سرعت بالا تا خنک کننده مایع
از نظر فناوری خنککننده، لین یوشن خاطرنشان کرد که ماژولهای خنککننده فعلی عمدتاً از فناوری خنککننده هیبریدی استفاده میکنند که لولههای حرارتی را در خود جای داده است. این ماژول های خنک کننده لوله های حرارتی اجزایی مانند فن ها، سینک های حرارتی و لوله های حرارتی را برای ایجاد یک محیط حرارتی متعادل برای قطعات الکترونیکی داخلی ترکیب می کنند و در نتیجه پایداری دستگاه های الکترونیکی را افزایش می دهند. با این حال، همانطور که محصولات الکترونیکی ترمینال پایین دستی چند منظوره و فشرده تر می شوند، تولید کنندگان ماژول های خنک کننده به طراحی راه حل های خنک کننده با محوریت اتاق های بخار و لوله های حرارتی روی آورده اند.
در حال حاضر ماژول های خنک کننده به دو نوع "خنک کننده هوا" و "خنک کننده مایع" تقسیم می شوند. خنک کننده هوا از هوا به عنوان واسطه استفاده می کند، با موادی مانند مواد رابط حرارتی، محفظه های بخار (VC)، یا لوله های حرارتی که گرما را هدایت می کنند، که سپس از طریق هیت سینک یا فن ها از طریق همرفت هوا پخش می شود. در مقابل، خنک کننده مایع، گرما را از طریق جابجایی مایع، از جمله خنک کننده غوطه وری، که تراشه ها را به طور موثرتری خنک می کند، دفع می کند. با این حال، همانطور که تراشه ها گرمای بیشتری تولید می کنند و کوچکتر می شوند، و با افزایش توان طراحی حرارتی (TDP)، خنک کننده هوا به تدریج ناکافی می شود.

▲ مقایسه بین فن آوری های خنک کننده هوا و خنک کننده مایع
با ظهور ChatGPT، هوش مصنوعی مولد باعث افزایش محمولههای سرور شده است که به نوبه خود منجر به ارتقای مشخصات ماژولهای خنککننده شده و آنها را به سمت راهحلهای خنککننده مایع برای برآورده کردن الزامات سختگیرانه برای خنکسازی و پایداری سرور سوق داده است. لین یوشن تاکید کرد که فنر با فناوری خنک کننده هوا شروع کرد و از ده سال پیش شروع به دستیابی به فناوری خنک کننده مایع از طریق انتقال فناوری IBM کرد. آنها دربهای پشتی خنککننده آب را ارائه کردند که به مشتریان اجازه میداد بدون تغییر زیرساختهای مرکز داده موجود، خنککنندههای آبی را به کابینتها اضافه کنند.
II تا سال 2025، دوره جدیدی از خنک کننده همزمان هوا و مایع
با توسعه فناوری نیمه هادی مرتبط با برنامه های کاربردی هوش مصنوعی، معرفی GPT-3 در ChatGPT پارامترهای الگوریتم هوش مصنوعی را به ۱۷۵ میلیارد افزایش داده است که نیاز به افزایش صد برابری قدرت محاسباتی GPU دارد. این صنعت در درجه اول از فناوری خنک کننده غوطه وری تک فاز در خنک کننده مایع برای حل چالش های اتلاف گرما سرورها یا قطعات با چگالی بالا استفاده می کند. با این حال، این روش دارای محدودیت 600 وات است، در حالی که نیازهای خنک کننده برای ChatGPT یا سرورهای پیشرفته تر از 700 وات بیشتر است.

▲ تصویر فناوری خنک کننده غوطه وری تک فاز
با توسعه اینترنت اشیا، محاسبات لبه و برنامه های کاربردی 5G، هوش مصنوعی داده ها قدرت محاسباتی جهانی را به مرحله رشد بالا سوق می دهد. نسل بعدی طرحهای ماژول خنککننده دو جهت اصلی را دنبال خواهند کرد: ارتقای ماژولهای خنککننده موجود با محفظههای بخار سهبعدی (3DVC) یا معرفی سیستمهای خنککننده مایع که از مایع به عنوان یک محیط انتقال حرارتی برای بهبود راندمان خنککننده استفاده میکنند. در نتیجه، تعداد آزمایشهای خنککننده مایع در سال 2023 به طور قابلتوجهی افزایش یافت. با این حال، 3DVC در نهایت یک راهحل انتقالی است و انتظار میرود تا 2024-2025، دوره خنکسازی همزمان هوا و مایع آغاز شود.
طبق گزارش TrendForce، در سال 2022، سرورهای هوش مصنوعی مجهز به GPGPU (GPUs با هدف عمومی) حدود 1٪ از کل محموله ها را تشکیل می دادند. با این حال، با استفاده از ChatGPT، انتظار میرود که محمولههای سرورهای هوش مصنوعی در سال 2023 به میزان 38.4 درصد رشد کند و نرخ رشد مرکب سالانه ارسال سرورهای هوش مصنوعی بین سالهای 2022 و 2026 به 29 درصد برسد.
III "خنک کننده مایع" به جریان اصلی تراشه های هوش مصنوعی تبدیل خواهد شد
همانطور که TDP نسل جدید سرورها به محدودیت های خنک کننده هوا نزدیک می شود، شرکت های فناوری پیشرو شروع به آزمایش خنک کننده مایع یا افزایش فضای خنک کننده می کنند. برای مثال، Eagle Stream Intel و AMD Genoa TDP 350-400W به محدودیتهای خنککننده هوا رسیدهاند و خنکسازی مایع را به راهحل اصلی برای تراشههای AI تبدیل کردهاند. H100 NVIDIA دارای TDP 700 وات است و خنککننده هوا با استفاده از 3DVC معمولاً به بیش از 4U فضا نیاز دارد که برای معماریهای استقرار با چگالی بالا مناسب نیست.

▲ H100 NVIDIA
با توجه به اینکه سیستم های خنک کننده تقریباً 33 درصد از کل انرژی مصرفی در مراکز داده را تشکیل می دهند، کاهش مصرف کل انرژی و بهبود اثربخشی مصرف برق (PUE) شامل بهینه سازی سیستم های خنک کننده، تجهیزات فناوری اطلاعات و استفاده از انرژی های تجدیدپذیر است. از آنجایی که ظرفیت حرارتی آب چهار برابر هوا است، اجرای سیستم های خنک کننده مایع تنها به 1U فضا برای صفحه خنک کننده مایع نیاز دارد. طبق آزمایشهای NVIDIA، برای دستیابی به قدرت محاسباتی یکسان، خنککننده مایع میتواند تعداد کابینتهای مورد نیاز را تا ۶۶ درصد، مصرف انرژی را تا ۲۸ درصد و PUE را از ۱.۶ به ۱.۱۵ کاهش دهد و در عین حال عملکرد محاسباتی را نیز بهبود بخشد.
استفاده IV Supermicro از ماژول های خنک کننده فنر بسیار مهم است
خنک کننده مایع بیشتر به «خنک کردن با آب» و «خنک کننده روغن» تقسیم می شود که در حال حاضر خنک کننده با آب بیشترین استفاده را دارد. لین یوشن خاطرنشان کرد که تقریباً همه سرورهای هوش مصنوعی اکنون از راه حل های خنک کننده آب استفاده می کنند. به عنوان مثال، GH100 NVIDIA با TDP بیش از 700 وات، باید از خنک کننده آب استفاده کند. اگرچه خنک کننده آب در حال حاضر بخش کوچکی از درآمد Fanner را تشکیل می دهد، میانگین قیمت فروش (ASP) سرورهای هوش مصنوعی ده برابر بیشتر از سرورهای سنتی است که به تغییر ساختار محصول Fanner در نیمه دوم سال کمک می کند. تخمین زده میشود که سرورهای هوش مصنوعی میتوانند 5-10٪ از تجارت آنها را در سال 2023 تشکیل دهند.
لین یوشن تاکید کرد که دلیل اصلی استفاده Supermicro از ماژول های خنک کننده آب از Fanner برای سرورهای مجهز به پردازنده گرافیکی NVIDIA GH100 این است که Fanner بیش از یک دهه است که روی راه حل های خنک کننده مایع کار می کند. در حالی که چالشهای اجرای خنککننده آب عمدتاً شامل هزینهها و جلوگیری از نشت میشود، تحقیقات بیش از ده ساله Fanner به تدریج بر این مسائل نشتی غلبه کرده است. سرمایهگذاری بلندمدت Fanner در ماژولهای خنککننده آب، آنها را به سرمایهگذاری در این موج هوش مصنوعی تبدیل کرده است.

▲ خنک کننده مایع سفارشی Supermicro
لین یوشن تاکید کرد که افزایش مستمر TDP ناشی از محاسبات با سرعت بالا و تقاضای رو به رشد سرمایش سرورهای هوش مصنوعی، خنکسازی سنتی لولههای حرارتی را به حد خود رسانده است و نیاز به پذیرش ماژولهای خنککننده آبی را ضروری کرده است. Fanner در حال حاضر چندین مشتری از جمله Supermicro و Meta دارد که راه حل های خود را اتخاذ کرده اند. علیرغم پذیرش سریعتر از حد انتظار خنک کننده آبی، بعید است که در سال 2023 به طور کامل اجرا شود. با این حال، انتظار می رود که تا سال 2024 شاهد پیشرفت قابل توجهی باشیم و رشد انفجاری در سال 2025 پیش بینی می شود.
