صفر تا صد تعمیر سخت افزار سرور: مرجع تخصصی عیب‌یابی و رفع مشکلات فنی

تعمیر سخت افزار سرور

صفر تا صد تعمیر سخت افزار سرور: مرجع تخصصی عیب‌یابی و رفع مشکلات فنی

فهرست مطالب

اگر در حوزه مدیریت زیرساخت، شبکه یا پشتیبانی تجهیزات دیتاسنتر فعالیت داشته باشید، احتمالاً خوب می‌دانید که روبرو شدن با چراغ قرمز یک سرور خاموش یا سروری که ناگهان از مدار خارج شده، چقدر استرس‌زا است. سرورها قلب تپنده هر مجموعه نرم‌افزاری و ارتباطی هستند؛ از سرویس‌های آنلاین و وب‌سایت‌ها گرفته تا پایگاه‌های داده حیاتی یک سازمان. وقوع کوچک‌ترین اختلال در کارکرد سخت‌افزاری این دستگاه‌ها برابر است با توقف عملیات کسب‌وکار و وارد آمدن خسارت‌های سنگین مالی یا اعتباری.

تعمیر سخت افزار سرور برخلاف سیستم‌های دسکتاپ معمولی، فرآیندی کاملاً پیچیده و حساسی است که نیازمند درک دقیق از معماری قطعات، شناخت پروتکل‌های نگهداری و تسلط بر کدهای خطا و ابزارهای عیب‌یابی اختصاصی است. کوچک‌ترین اشتباه در باز یا بستن قطعات یا نادیده گرفتن استانداردهای ایمنی الکترواستاتیک می‌تواند آسیب‌های زنجیره‌ای به سایر بخش‌ها وارد کند.

در این مرجع جامع و تخصصی، می‌خواهیم گام‌به‌گام و به‌صورت کاملاً کاربردی، تمام جنبه‌های عیب‌یابی، نگهداری و تعمیرات سخت‌افزاری سرورها را بررسی کنیم تا یک نقشه راه عملیاتی کامل در اختیارتان قرار گیرد.

مقدمه‌ای بر اهمیت نگهداری و تعمیر سخت افزار سرور

در دنیای فناوری اطلاعات و تجهیزات شبکه، سرورها قلب زیرساخت سازمان محسوب می‌شوند. بسیاری از سرویس‌های حیاتی مثل پایگاه داده، وب‌سایت‌ها، ایمیل سازمانی، فایل‌سرورها، سیستم‌های مجازی‌سازی و نرم‌افزارهای مدیریتی روی سرورها اجرا می‌شوند. به همین دلیل، سرورها باید به‌صورت مداوم، پایدار و بدون وقفه در طول شبانه‌روز و در تمام روزهای سال فعالیت کنند.

این نوع کارکرد ۲۴ ساعته و ۷ روز هفته، باعث می‌شود قطعات سخت‌افزاری سرور تحت فشار دائمی قرار بگیرند. پردازنده، رم، هارد یا SSD، منبع تغذیه، فن‌ها، مادربرد و سایر اجزا هر کدام در معرض استهلاک تدریجی هستند. حرارت بالا، گردوغبار، نوسانات برق، بار پردازشی زیاد، فرسودگی فن‌ها و حتی شرایط محیطی نامناسب می‌تواند عمر مفید این قطعات را کاهش دهد.

برخلاف تصور برخی افراد، حتی سرورهای حرفه‌ای و باکیفیت برندهایی مانند HPE، Dell، Lenovo و Supermicro نیز کاملاً مصون از خرابی نیستند. این تجهیزات هرچقدر هم پیشرفته و مقاوم باشند، در نهایت به نگهداری منظم، بازبینی دوره‌ای و تعمیر تخصصی نیاز دارند. نادیده گرفتن سرویس‌های دوره‌ای می‌تواند باعث بروز مشکلاتی مانند کاهش سرعت سیستم، خاموشی ناگهانی، از دست رفتن اطلاعات، اختلال در سرویس‌های شبکه و حتی توقف کامل فعالیت سازمان شود.

از این رو، نگهداری و تعمیر به‌موقع سخت‌افزار سرور فقط یک کار فنی نیست، بلکه یک اقدام حیاتی برای حفظ پایداری کسب‌وکار، جلوگیری از خسارت‌های مالی، افزایش طول عمر تجهیزات و تضمین تداوم خدمات سازمانی است. هرچه رسیدگی به سرورها منظم‌تر و اصولی‌تر باشد، احتمال خرابی‌های سنگین کمتر و عملکرد زیرساخت مطمئن‌تر خواهد بود.

چرا عیب‌یابی سریع و تعمیر سرور برای کسب‌وکارها حیاتی است؟

در دنیای تجارت دیجیتال، پایداری زیرساخت فناوری اطلاعات ستون اصلی فعالیت‌های سازمان است و به همین دلیل، عیب‌یابی سریع و تعمیر سرور برای تداوم کسب‌وکارها اهمیت حیاتی دارد. وقوع هرگونه قطعی سرور (Server Downtime) به معنای هدررفت زمان، افت بازدهی و تحمیل خسارات مالی سنگین است؛ زیرا در طول زمان از دسترس خارج شدن سرور فروشگاهی یا پایگاه داده‌های سازمان، فرایند ثبت سفارش، پردازش داده‌ها و ارائه خدمات به مشتریان کاملاً متوقف می‌شود و اعتبار برند در کنار درآمد به خطر می‌افتد. از این رو، عیب‌یابی دقیق سرور به کاهش مدت‌زمان خاموشی سیستم کمک کرده و جریان درآمدی و پایداری عملکرد را در سریع‌ترین زمان ممکن به حالت عادی بازمی‌گرداند.

از سوی دیگر، اقدام به‌موقع برای تعمیر سرور نقشی کلیدی در حفظ امنیت و یکپارچگی داده‌ها دارد و مانع از از دست رفتن دائمی اطلاعات (Data Loss) می‌شود. اختلال در بخش‌های حساسی همچون کارت رید (RAID Controller)، هاردها یا آرایه‌های ذخیره‌سازی، در صورت عدم شناسایی سریع، می‌تواند به خرابی کامل دیتابیس منجر شود.

علاوه بر این، بررسی و عیب‌یابی تخصصی سرور از خطرات ناشی از آسیب‌های ثانویه جلوگیری می‌کند؛ چرا که یک نقص به‌ظاهر کوچک در سیستم خنک‌کننده، نظیر خرابی فن سرور یا فن پاور، به‌سرعت دمای شاسی را بالا برده و زمینه سوختن قطعات گران‌قیمت مثل پردازنده سرور و مادربورد را فراهم می‌سازد. در نتیجه، تعمیر فوری و نگهداری پیشگیرانه سرور نه‌تنها از هزینه‌های سرسام‌آور تعویض قطعات جلوگیری می‌کند، بلکه پایداری سرویس و رضایت نهایی مشتریان را تضمین می‌نماید.

تفاوت تعمیر سرور با تعمیر کامپیوترهای خانگی و دسکتاپ

تعمیر سرور با تعمیر کامپیوترهای خانگی و دسکتاپ تفاوت‌های اساسی دارد و نمی‌توان این دو را یکسان در نظر گرفت. سرورها برای کارکرد مداوم، پردازش سنگین، پایداری بالا و جلوگیری از قطعی سرور (Server Downtime) طراحی شده‌اند؛ به همین دلیل، عیب‌یابی سرور و تعمیر تخصصی سرور نیازمند دانش فنی عمیق‌تر و ابزارهای حرفه‌ای‌تر است.

در حالی که تعمیرات کامپیوترهای شخصی معمولاً روی قطعات عمومی و مشکلات ساده‌تر تمرکز دارد، در سرور باید ساختار سخت‌افزاری، نرم‌افزاری و مدیریتی به‌صورت هم‌زمان بررسی شود. یکی از مهم‌ترین تفاوت‌ها در معماری قطعات سرور و وجود Redundancy یا افزونگی است. در بسیاری از سرورها، قطعات حیاتی مانند پاور سرور، فن سرور و حتی مسیرهای ارتباطی شبکه به‌صورت چندتایی طراحی می‌شوند تا در صورت خرابی یکی از آن‌ها، قطعه جایگزین بلافاصله وارد مدار شود.

این موضوع باعث می‌شود تعمیر سرور فقط به تعویض یک قطعه محدود نباشد، بلکه بررسی سلامت قطعات پشتیبان و عملکرد هم‌زمان آن‌ها نیز اهمیت داشته باشد. در مقابل، در کامپیوترهای خانگی معمولاً چنین افزونگی‌ای وجود ندارد و خرابی یک قطعه می‌تواند کل سیستم را متوقف کند.

تفاوت مهم دیگر، استفاده از رم سرور ECC است. رم‌های سروری نسبت به رم‌های معمولی دسکتاپ، قابلیت تصحیح خطا دارند و همین ویژگی در فرآیند عیب‌یابی سرور اهمیت زیادی پیدا می‌کند. در نتیجه، تست و تشخیص خرابی رم سرور با روش‌های رایج در کامپیوترهای خانگی متفاوت است.

علاوه بر این، قطعاتی مانند هارد سرور و کارت RAID نیز ساختار و حساسیت بیشتری دارند و در صورت بروز مشکل، می‌توانند به از دست رفتن اطلاعات (Data Loss) منجر شوند. به همین دلیل، تعمیرات سرور باید با دقت بیشتری انجام شود تا سلامت داده‌ها و آرایه ذخیره‌سازی حفظ گردد.

یکی از مزیت‌های مهم سرورها، قابلیت Hot-Swap یا تعویض داغ است. بسیاری از قطعات سرور مانند هاردها و پاورها بدون خاموش کردن دستگاه قابل تعویض هستند؛ قابلیتی که در تعمیر کامپیوتر دسکتاپ معمولاً وجود ندارد. با این حال، استفاده از این ویژگی نیازمند تجربه و دانش کافی است، زیرا هرگونه خطا در زمان تعویض قطعات می‌تواند باعث اختلال در RAID، افزایش Server Downtime و حتی آسیب به سایر اجزای سخت‌افزاری شود. بنابراین، تعمیر سرور در این بخش حساس‌تر و تخصصی‌تر از تعمیر سیستم‌های خانگی است.

علاوه بر این، سرورها دارای ابزارهای مدیریت از راه دور مانند iLO در سرورهای HP و iDRAC در سرورهای Dell هستند. این ابزارها امکان بررسی وضعیت سخت‌افزار، دما، خطاهای سیستم و سلامت قطعات را حتی در زمان خاموش بودن سیستم‌عامل فراهم می‌کنند. چنین قابلیت‌هایی در کامپیوترهای خانگی وجود ندارد و همین موضوع، فرآیند عیب‌یابی سرور را کاملاً متفاوت می‌کند. تعمیرکار سرور باید بتواند علاوه بر بررسی سخت‌افزار، لاگ‌های مدیریتی و گزارش‌های ریموت را نیز تحلیل کند تا منبع اصلی مشکل را دقیق‌تر شناسایی نماید.

در نتیجه، تعمیر سرور با تعمیر کامپیوترهای خانگی و دسکتاپ تفاوت‌های زیادی دارد و نمی‌توان از یک روش واحد برای هر دو استفاده کرد. سرورها به دلیل اهمیت بالا در کسب‌وکارها، حساسیت بیشتر در ذخیره‌سازی اطلاعات، معماری افزونه و ابزارهای مدیریتی پیشرفته، نیازمند تعمیر تخصصی سرور و عیب‌یابی حرفه‌ای سرور هستند. اگر کسب‌وکارها به دنبال کاهش قطعی سرور، حفظ اطلاعات و افزایش پایداری سیستم‌های خود هستند، باید تعمیر و نگهداری سرور را به افراد متخصص در این حوزه بسپارند.

بررسی نرخ خرابی (Failure Rate) قطعات سرور و تأثیر آن بر Down time

نرخ خرابی قطعات سرور (Failure Rate) یکی از مهم‌ترین شاخص‌ها در مدیریت و نگهداری زیرساخت‌های IT است، چون مستقیماً روی پایداری سرویس، کاهش قطعی سرور (Server Downtime) و جلوگیری از از دست رفتن اطلاعات (Data Loss) تأثیر می‌گذارد. در محیط‌های سازمانی و دیتاسنترها، قطعات سرور به‌صورت ۲۴ ساعته و تحت بار کاری مداوم کار می‌کنند؛ به همین دلیل، استهلاک آن‌ها با کامپیوترهای معمولی قابل مقایسه نیست.

در این شرایط، آگاهی از نرخ خرابی هر قطعه به تیم فنی کمک می‌کند تا تعمیر و نگهداری پیشگیرانه سرور را بهتر برنامه‌ریزی کند و قبل از ایجاد اختلال جدی، قطعات در معرض خرابی را شناسایی و تعویض کند. طول عمر مفید قطعات سرور معمولاً بر اساس منحنی‌های استاندارد استهلاک و تجربه عملی در دیتاسنترها بررسی می‌شود.

این منحنی‌ها نشان می‌دهند که برخی قطعات در ابتدای عمر، برخی در میانه و برخی در مرحله فرسودگی، بیشتر دچار خرابی می‌شوند. قطعاتی که دارای بخش‌های متحرک هستند یا به‌طور دائم در معرض حرارت بالا، جریان الکتریکی زیاد و فشار کاری مداوم قرار دارند، معمولاً بیشترین نرخ خرابی را دارند. به همین دلیل، هارد سرور، SSD، فن سرور و پاور سرور از مهم‌ترین قطعاتی هستند که باید به‌صورت مستمر مانیتور شوند.

 

بسیاری از مشکلات شبکه و سرور با نگهداری اصولی و پشتیبانی مداوم قابل پیشگیری هستند. در مقاله پشتیبانی و نگهداری شبکه و سرور؛ کاهش قطعی، افزایش امنیت و عملکرد به بررسی راهکارهایی پرداخته‌ایم که به بهبود امنیت و عملکرد سیستم‌ها کمک می‌کنند.

 

آشنایی با قطعات کلیدی سرور و نقش آن‌ها در سخت‌افزار

برای عیب‌یابی موفق یک سرور معیوب، فقط دانستن نام قطعات کافی نیست؛ بلکه باید بدانید هر قطعه دقیقاً چه وظیفه‌ای دارد، خرابی آن چه علائمی ایجاد می‌کند و اختلال هر بخش چگونه روی بخش‌های دیگر تأثیر می‌گذارد.

یعنی وقتی سرور روشن نمی‌شود، کند شده، خطای RAID می‌دهد یا مدام ریست می‌شود، شما باید بتوانید تشخیص دهید مشکل از پاور، رم، هارد، مادربورد، پردازنده، فن، RAID Controller یا حتی Firmware است و این قطعات چگونه با هم کار می‌کنند. چون در سرور، خرابی یک قطعه ممکن است فقط همان قطعه را از کار نیندازد، بلکه کل سیستم را تحت تأثیر قرار دهد و باعث Downtime، Data Loss یا اختلال در سرویس‌های سازمانی شود.

پردازنده (CPU) سرور: ویژگی‌ها، معماری و نشانه رفتن سلامت

پردازنده‌های سروری (مانند سری Intel Xeon یا AMD EPYC) برای پردازش‌های سنگین، موازی و طولانی‌مدت ساخته شده‌اند. این پردازنده‌ها دارای تعداد هسته بسیار بالا، کش (Cache) حجم بالا و پشتیبانی از حجم زیادی از حافظه رم هستند.

خرابی مستقیم خود چیپ پردازنده بسیار نادر است، اما مشکلاتی نظیر آسیب دیدن پین‌های سوکت مادربورد، عدم اتصال کامل پایه پردازنده به سوکت، یا کثیف شدن و خشک شدن خمیر سیلیکون از موارد شایعی هستند که منجر به داغ شدن شدید (Overheating) و خاموش شدن سرور می‌شوند.

حافظه رم سرور (Server RAM) و فناوری ECC

رم‌های سروری با داشتن تراشه اضافی برای فناوری Error-Correcting Code (ECC) قادرند خطاهای تک‌بیتی (Single-bit errors) داده‌ها را در لحظه تشخیص داده و به‌صورت خودکار اصلاح کنند تا سیستم دچار Crashes یا کرش ناگهانی نشود.

هنگام عیب‌یابی رم سرور باید به این نکته توجه داشت که بروز خطاهای چندبیتی (Multi-bit errors) از عهده اصلاح ECC خارج بوده و باعث ایجاد کدهای خطا روی سیستم، کاهش سرعت، یا بوت نشدن سرور می‌شود. همچنین ترتیب چیدمان رم‌ها روی اسلات‌های مادربورد (Channel Configuration) بر اساس راهنمای شاسی سرور بسیار حائز اهمیت است.

مادربورد سرور (Server Motherboard): چیپست‌ها و مسیرهای ارتباطی

مادربورد سرور، تخته اصلی ارتباطی تمام قطعات است. این بوردها به گونه‌ای طراحی شده‌اند که توانایی پشتیبانی از دو یا چند پردازنده (Multi-Socket)، ده‌ها اسلات رم و چندین کارت توسعه PCIe را داشته باشند.

از رایج‌ترین مشکلات سخت‌افزاری مادربورد سرور می‌توان به موارد زیر اشاره کرد:

  • سوختگی خازن‌ها یا مدار تغذیه (VRM) بر اثر نوسانات برق.
  • قطع شدن مسیرهای ارتباطی لایه‌های داخلی بورد بر اثر فشار فیزیکی یا حرارت زیاد.
  • خرابی چیپست مدیریت از راه دور (iLO/iDRAC) که مانع از روشن شدن یا دسترسی به سرور می‌شود.

پاور سرور (Redundant Power Supply): سیستم تامین برق همپوشان

پاورهای سروری معمولاً به‌صورت ماژولار و دوتایی (یا بیشتر) نصب می‌شوند. این سیستم‌ها به‌گونه‌ای عمل می‌کنند که اگر یک پاور به دلیل سوختگی یا قطعی برق از مدار خارج شد، پاور دوم بدون حتی یک میلی‌ثانیه وقفه، کل بار پردازشی سرور را بر عهده بگیرد.

معمولاً عیب‌یابی پاورهای سرور از طریق بررسی چراغ‌های LED پشت ماژول پاور و پیغام‌های وضعیت ورودی برق انجام می‌شود. خرابی در بخش مدار سوییچینگ، خازن‌های صافی یا فن داخلی پاور از علل اصلی عملکرد نادرست این قطعه است.

کارت رید (RAID Controller) و نقش آن در مدیریت داده‌ها

کارت رید کنترلر در واقع یک پردازنده مستقل همراه با حافظه کش اختصاصی (و معمولاً یک باتری پشتیبان به نام CacheVault یا BBU) است که وظیفه مدیریت، ترکیب و سازماندهی دیسک‌های ذخیره‌سازی را بر عهده دارد.

اگر کارت رید دچار مشکل شود یا باتری کش آن ضعیف و فاسد گردد، سرعت خواندن و نوشتن داده‌ها به شدت افت کرده و احتمال تخریب آرایه‌های رید (RAID Breakdown) وجود دارد. عیب‌یابی این بخش نیاز به تسلط بر محیط تست BIOS کارت رید و ابزارهای نرم‌افزاری مربوطه دارد.

تجهیزات ذخیره‌سازی: مقایسه HDD ،SSD و NVMe سروری

دیسک‌های سروری برای کارکرد مداوم ساخته شده‌اند و با دیسک‌های عادی متفاوتند. هارد دیسک‌های SAS (با سرعت‌های 10K یا 15K RPM) و حافظه‌های SSD/NVMe Enterprise دارای دوام بالا (DWPD بالا) هستند.

نشانه‌های خرابی در سیستم ذخیره‌سازی عبارتند از:

  • افزایش چشمگیر Bad Sectorها در HDD.
  • تمام شدن عمر سلول‌های نوشتن (TBW) در SSDها.
  • روشن شدن چراغ نارنجی یا قرمز (Fault LED) روی کدی (Caddy) هارد.

سیستم‌های خنک‌کننده (Cooling & Fans) و مدیریت حرارت

سرورها متکی بر جریان هوای قوی و مستقیم هستند. فن‌های سرور با سرعت بالا (گاهی بیش از ۱۰,۰۰۰ دور در دقیقه) کار می‌کنند و خروج یا خرابی حتی یک فن باعث تغییر در کانال‌کشی هوای داخل شاسی (Airflow) می‌شود. سنسورهای دمایی سرور به محض تشخیص کندی یا خرابی فن، سرعت سایر فن‌ها را به حداکثر رسانده یا برای جلوگیری از سوختن قطعات، سرور را خاموش می‌کنند.

نشانه‌ها و علائم رایج خرابی سخت‌افزار سرور

بزرگ‌ترین مزیت سرورهای مدرن نسبت به رایانه‌های معمولی، امکان ارزیابی و تشخیص زودهنگام مشکلات قبل از رخ دادن یک فاجعه کاملاً جدی است. سرورها پیش از قطع کامل یا از دست رفتن داده‌ها، پیام‌ها و نشانه‌های متعددی از خود بروز می‌دهند که شناخت آن‌ها کلید اصلی یک عیب‌یابی موفق است.

بوق‌های هشدار (Beep Codes) و کدهای LED مادربورد

در صورت بروز اختلال در مراحلی که سرور هنوز وارد سیستم‌عامل نشده (مرحله POST)، سیستم از طریق سیگنال‌های صوتی یا چراغ‌های راهنما روی بورد، نوع مشکل را اعلام می‌کند:

  • کدهای بوقی (Beep Codes): الگوی بوق‌های کوتاه و بلند به هنگام روشن شدن، مستقیماً به قطعه معیوب اشاره دارد. برای مثال، الگوی مشخصی از بوق‌ها می‌تواند نشان‌دهنده عدم شناسایی حافظه رم، الگوی دیگر مربوط به خطای کارت گرافیک یا پردازنده و الگوی متفاوت دیگر نشان‌دهنده خطای منبع تغذیه باشد.
  • دیودهای نورانی (LEDs): روی مادربورد و پنل جلویی سرورها، چراغ‌های تشخیصی (Diagnostic LEDs) تعبیه شده‌اند. در سرورهای اچ‌پی، پنل System Insight Display (SID) تمام قطعات را به شکل یک دیاگرام نشان می‌دهد. اگر چراغ قطعه‌ای از رنگ سبز به نارنجی یا قرمز تغییر کند، بدون نیاز به باز کردن شاسی می‌توان قطعه معیوب را متوجه شد.

خاموش شدن ناگهانی یا ریستارت‌های پی‌درپی سرور

اگر سرور در حین کار ناگهان خاموش شده یا وارد چرخه ریستارت مداوم (Reboot Loop) شود، معمولاً با یکی از سه عامل زیر روبرو هستید:

  • ۱. داغ شدن بیش از حد (Overheating): اگر دمای پردازنده یا چیپست اصلی از حد مجاز بگذرد، سنسورهای حرارتی فرمان خاموشی اضطراری (Thermal Shutdown) را صادر می‌کنند.
  • ۲. افت یا نوسان در مدار تغذیه (Power Fault): نوسان ولتاژ ورودی، خراب شدن یکی از پاورها یا اختلال در مدار VRM مادربورد موجب قطع جریان و خاموشی فوری سرور می‌شود.
  • ۳. اتصالی فیزیکی: وجود شیء خارجی، شل شدن پیچ‌ها یا خرابی پایه قطعاتی که با بدنه فلزی شاسی اتصال کوتاه ایجاد می‌کنند.

کُندی شدید در پردازش و پاسخگویی سیستم

افت ناگهانی عملکرد سرور همواره یک مسئله نرم‌افزاری نیست. در بسیاری از موارد، ریشه کندی در قطعات سخت‌افزاری نهفته است:

  • محدودسازی فرکانس پردازنده (CPU Throttling): وقتی سیستم خنک‌کننده به درستی عمل نکند، پردازنده برای جلوگیری از سوختن، فرکانس کاری خود را به حداقل ممکن می‌رساند.
  • طوفان خطاهای رم (ECC Error Storm): زمانی که یکی از ماژول‌های رم در آستانه سوختن کامل قرار می‌گیرد، تعداد خطاهای تصحیح‌شده تک‌بیتی (Single-bit) به شدت بالا می‌رود. پردازش این حجم از خطاها توسط پردازنده باعث کندی سیستم می‌شود.
  • تنزيل وضعیت آرایه ذخیره‌سازی (Degraded RAID): اگر یکی از هاردهای یک آرایه RAID خرابی پیدا کند، سرعت خواندن و نوشتن داده‌ها به دلیل الگوریتم‌های بازیابی اطلاعات به شدت افت می‌کند.

خطاهای صفحه آبی (BSOD) یا Purple Screen در مجازی‌سازها

نمایش صفحه‌های خطا هنگام کار با سیستم‌عامل یا هایپروایزرها (مانند VMware ESXi)، حاوی اطلاعات ارزشمندی در مورد قطعات سخت‌افزاری است:

  • صفحه آبی مرگ (BSOD) در ویندوز سرور: خطاهایی نظیر WHEA_UNCORRECTABLE_ERROR یا MEMORY_MANAGEMENT نشان‌دهنده نقص در عملکرد سخت‌افزار، بروز خطا در رم یا ایراد در درایور قطعات است.
  • صفحه بنفش مرگ (PSOD) در VMware ESXi: رخ دادن خطاهای بنفش همراه با عبارت‌هایی مثل Machine Check Exception (MCE) یا NMI مستقیماً به ایرادات پردازنده، گذرگاه PCIe یا رم اشاره دارد و آدرس فیزیکی قطعه معیوب را در متن خطا ثبت می‌کند.

اخطارهای مربوط به دیسک و خرابی آرایه‌های RAID

سیستم‌های ذخیره‌سازی سرور دارای مکانیزم‌های پیشرفته هشدار هستند:

  • چراغ چشمک‌زن نارنجی/قرمز کدی هارد: نشان می‌دهد دیسک دچار خطای خواندن/نوشتن شده یا پیام Predictive Failure (پیش‌بینی خرابی) صادر کرده است.
  • پیام‌های کارت رید: اخطارهایی مانند RAID Degraded (از دست رفتن یک دیسک در آرایه متوازن) یا RAID Failed (از دست رفتن تعداد دیسکی بیشتر از حد تحمل آرایه) که نشان‌دهنده وضعیت بحرانی داده‌ها هستند.

 

خدمات پشتیبانی شبکه؛ برای اطلاعات بیشتر کلیک کنید.

 

ابزارها و تجهیزات مورد نیاز برای تعمیر سخت افزار سرور

تعمیر و عیب‌یابی تجهیزات سروری نیازمند ابزارهای دقیق و استانداردی است. استفاده از ابزارهای نامناسب می‌تواند به قطعات آسیب‌های جبران‌ناپذیری وارد کند.

نرم‌افزارها و ابزارهای تست

ابزارهای فیزیکی

کنسول‌های ریموت (iLO / iDRAC)

دستبند و پد آنتی‌استاتیک (ESD)

نرم‌افزار تست رم MemTest86

مولتی‌متر دیجیتال با دقت بالا

تسترهای بنچمارک CPU (Prime95)

پیچ‌گوتی‌های آلن و ست ستاره‌ای (T15)

ابزار تست دیسک (Smartmontools)

تستر اختصاصی پاور سرور

نرم‌افزار اختصاصی SSA / LSI MegaRAID

خمیر سیلیکون مرغوب و الکل ۹۹٪

ابزارهای فیزیکی و سخت‌افزاری

  • تجهیزات ایمنی ESD: دستبند ضد الکتریسیته ساکن (ESD Wrist Strap) و پد آنتی‌استاتیک از حیاتی‌ترین ابزارها هستند. الکتریسیته ساکن بدن انسان می‌تواند به راحتی تراشه‌های نیمه‌هادی حساس سرور را بسوزاند.
  • مجموعه پیچ‌گوشتی‌های تخصصی: اکثر سرورهای برند (به‌ویژه HPE و Dell) از پیچ‌های ستاره‌ای (Torx) با سایزهای T15 و T30 برای بستن هیت‌سینک‌ها و شاسی استفاده می‌کنند.
  • مولتی‌متر دیجیتال دقیق: برای بررسی ولتاژ خروجی خطوط مختلف پاور، تست سلامت خازن‌ها و اطمینان از عدم وجود اتصال کوتاه روی مدار مادربورد.
  • تستر پاور سروری: ابزاری جهت سنجش سریع ولتاژهای ۵، ۱۲ و ۳.۳ ولت ورودی به بورد و اطمینان از عملکرد درست سیگنال Power Good.
  • مواد پاک‌کننده و خمیر سیلیکون: الکل ایزوپروپیل ۹۹ درصد برای پاک کردن خمیرهای سیلیکون قدیمی و خمیرهای سیلیکون با رسانایی گرمایشی بالا.

نرم‌افزارها و تسترهای عیب‌یابی اختصاصی برندها

  • HPE Integrated Lights-Out (iLO): چیپست اختصاصی سرورهای اچ‌پي که لاگ کامل تمامی قطعات (Integrated Management Log) را حتی در صورت خاموش بودن سرور نگه می‌دارد.
  • Dell iDRAC: ابزار مدیریت از راه دور سرورهای دل با قابلیت گزارش‌گیری دقیق از سلامت قطعات (Lifecycle Controller).
  • HPE Smart Storage Administrator (SSA): نرم‌افزار تست، پیکربندی و عیب‌یابی دقیق کارت رید و هاردهای سرورهای HP.

ابزارهای تست بنچمارک و استرس‌تست قطعات

  • MemTest86 / MemTest86+: ابزاری مرجع که خارج از محیط سیستم‌عامل بوت شده و تمام بانک‌های حافظه رم را بیت‌به‌بیت تحت تست‌های پیچیده قرار می‌دهد.
  • Prime95 و Stress-NG: ابزارهایی برای اعمال حداکثر بار پردازشی بر روی تمامی هسته‌های پردازنده جهت تست سیستم خنک‌کننده و پایداری.
  • Smartmontools / CrystalDiskInfo: برای استخراج پارامترهای S.M.A.R.T دیسک‌ها، بررسی سلامت سلول‌های SSD و شناسایی بدسکتورهای فیزیکی.

راهنمای گام‌به‌گام عیب‌یابی و تعمیر قطعات سرور

برای یک عیب‌یابی و تعمیر اصولی در سرور، نباید عجولانه اقدام کرد. عیب‌یابی سرور یک فرآیند سیستماتیک است که هدف آن کاهش زمان Downtime و جلوگیری از خطاهای ثانویه است. در اینجا یک راهنمای گام‌به‌گام با توضیحات متوسط ارائه شده است:

عیب‌یابی و تعمیر پردازنده (CPU) و سوکت‌ها

  • بررسی داغ شدن بیش از حد (Overheating) و تعویض خمیر سیلیکون: اگر فن‌های سرور با حداکثر دور می‌چرخند و لاگ سیستم خطای Thermal Critical ثبت کرده، ابتدا هیت‌سینک را باز کنید. خمیر سیلیکون قدیمی را با الکل ایزوپروپیل ۹۹٪ کاملاً پاک کنید. مقدار مناسبی از خمیر سیلیکون مرغوب را به‌صورت نوار افقی یا الگوی X روی سطح پردازنده بمالید.
  • تشخیص آسیب‌دیدگی پین‌های سوکت CPU: در سوکت‌های LGA (که پین‌ها روی مادربورد قرار دارند)، خم شدن حتی یک پین باعث بوت نشدن سرور یا نشناختن بخشی از رم‌ها می‌شود. با نور موضعی و ذره‌بین، فیلد پین‌ها را چک کنید. پین‌های کج‌شده را می‌توان با دقت زیاد و ابزار سوزنی میکروسکوپی اصلاح کرد.

عیب‌یابی و تعویض رم (RAM) سرور

  • تشخیص خطاهای Single-bit و Multi-bit ECC: خطاهای Single-bit توسط فناوری ECC اصلاح شده و سرور به کار خود ادامه می‌دهد، اما لاگ سیستم آدرس اسلات رم مورد نظر را ثبت می‌کند. خطاهای Multi-bit قابل اصلاح نیستند و بلافاصله منجر به بنفش شدن صفحه (PSOD) یا ریستارت سرور می‌شوند.
  • تست اسلات‌های رم و روش تمیزکاری پایه‌ها: گاهی اکسید شدن پایه‌های طلایی رم یا نفوذ گرد و غبار به داخل اسلات باعث بروز خطا می‌شود. رم را خارج کرده، پایه‌های طلایی آن را با پاک‌کن نرم تمیز کنید و با اسپری کنتاکت‌شور خشک، اسلات روی مادربورد را شستشو دهید.

عیب‌یابی و تعمیر مادربورد سرور (Motherboard)

  • بررسی خازن‌های بادکرده و سوختگی مسیرها: نوسانات شدید برق معمولاً به مدار تغذیه (VRM) و خازن‌های جامد اطراف سوکت پردازنده آسیب می‌زند. بوردهای سروری به دلیل داشتن لایه‌های متعدد در صورت سوختگی عمیق لایه‌های داخلی، قابل تعمیر نیستند. اما تعویض خازن‌های سوخته یا ماسفت‌های ورودی مدار تغذیه با ابزار هویه هوای گرم (Hot Air) قابل انجام است.
  • به‌روزرسانی یا ریکاوری BIOS/Firmware آسیب‌دیده: قطع شدن جریان برق در زمان آپدیت بایوس باعث به اصطلاح آجر شدن (Brick) مادربورد می‌شود. برای حل این مشکل باید آی‌سی فلش BIOS روی مادربورد از طریق ابزار پروگرمر سخت‌افزاری مجدداً با فایل سالم رایت شود.

عیب‌یابی و تعویض پاور سرور (Power Supply)

  • تست ولتاژ خروجی و تشخیص افت جریان: پاور سرور را از شاسی خارج کرده و به برق متصل کنید. چراغ LED پشت پاور وضعیت اولیه را نشان می‌دهد. با استفاده از تستر پاور، ولتاژهای خطوط ۱۲ ولت را زیر بار بررسی کنید. اگر ولتاژ تحت بار دچار افت مجاز بیش از ۵٪ شود، خازن‌های صافی خروجی پاور آسیب دیده‌اند.
  • بررسی عملکرد سیستم Redundancy: پاورهای دوتایی باید بار را به‌صورت متوازن یا بک‌آپ مدیریت کنند. اگر با کشیدن کابل برق یکی از پاورها، سرور خاموش شود، یا بیک‌پلیت (Power Backplane) داخل شاسی دچار اتصالی شده یا تنظیمات قدرت در BIOS/iLO روی حالت Non-Redundant تنظیم شده است.

عیب‌یابی سیستم ذخیره‌سازی و کارت RAID

  • بازسازی (Rebuild) آرایه‌های RAID خراب‌شده: اگر یکی از هاردهای یک آرایه RAID 5 یا RAID 6 Fail شود، چراغ کدی هارد قرمز می‌شود. برای تعمیر، هارد معیوب را خارج کرده و یک هارد سالم با ظرفیت و مشخصات یکسان یا بالاتر جایگزین کنید. فرایند Rebuild معمولاً به‌صورت خودکار آغاز می‌شود.
  • جایگزینی دیسک‌های Fail شده بدون قطع جریان کار (Hot-swapping): اکثر سرورها از قابلیت Hot-Swap پشتیبانی می‌کنند. برای تعویض هارد نیازی به خاموش کردن سرور نیست. فقط کافیست شاسی کدی هارد معیوب را باز کرده، دیسک را خارج و دیسک جدید را جایگزین کنید.

تعمیر و سرویس سیستم خنک‌کننده و فن‌ها

  • تشخیص فن‌های آسیب‌دیده از طریق کنسول مدیریتی: فن‌های سرور به‌صورت Hot-Plug و ماژولار طراحی شده‌اند. در کنسول مدیریت (iLO/iDRAC) دور دقیقه (RPM) هر فن به تفکیک نشان داده می‌شود. اگر دور یک فن به زیر حد استاندارد برسد یا متوقف شود، سیستم خطای Fan Failure ثبت می‌کند.
  • تمیزکاری تخصصی و گردگیری فن‌ها و هیت‌سینک‌ها: نفوذ گرد و غبار به بلبرینگ فن‌ها باعث کندی عملکرد و ایجاد صدای غیرعادی می‌شود. سرویس فن‌ها با استفاده از پمپ باد (بلوور) و شستشوی هیت‌سینک‌ها با مواد پاک‌کننده باید در فواصل زمانی منظم انجام شود.

بررسی تخصصی تعمیر سخت‌افزار سرورهای محبوب در ایران

با توجه به رشد استفاده از سرورها در کسب‌وکارهای ایرانی، از شرکت‌های کوچک گرفته تا سازمان‌های بزرگ، نیاز به تعمیر تخصصی سخت‌افزار سرور بیش از هر زمان دیگری اهمیت پیدا کرده است. سرورها به‌دلیل کارکرد ۲۴ ساعته، فشار پردازشی بالا و وابستگی مستقیم به قطعات حیاتی مانند پاور، رم، هارد، فن، مادربورد و RAID Controller، در صورت بروز مشکل می‌توانند به‌سرعت باعث اختلال در سرویس‌های سازمانی و قطعی سرور شوند.

از آنجا که برندهای مختلف سرور مانند HP، Dell، Lenovo و Supermicro ساختارها، قطعات و سیستم‌های مدیریتی متفاوتی دارند، تعمیر آن‌ها نیز نیازمند دانش تخصصی، ابزار مناسب و تجربه عملی است. هر برند ممکن است در بخش‌هایی مانند سیستم خنک‌کننده، ماژول‌های رم ECC، کنترلر ذخیره‌سازی، پاورهای Redundant و ابزارهای مدیریتی مانند iLO و iDRAC تفاوت‌های مهمی داشته باشد؛ به همین دلیل، عیب‌یابی و تعمیر هرکدام باید بر اساس معماری همان مدل انجام شود.

در ادامه، به‌صورت تخصصی بررسی می‌کنیم که تعمیر سخت‌افزار در سرورهای محبوب بازار ایران چه تفاوت‌هایی دارد، هر برند بیشتر با چه نوع خرابی‌هایی مواجه می‌شود و در زمان بروز مشکل، چه نکاتی باید برای جلوگیری از Data Loss و افزایش Downtime در نظر گرفته شود

تعمیر سخت‌افزار سرورهای اچ‌پی (HPE ProLiant)

سرورهای HPE (به‌ویژه سری DL380 و DL360) پرکاربردترین سرورها در ایران هستند.

  • کدهای خطای رایج در HPE iLO: خطای Unrecoverable System Error معمولاً نشان‌دهنده ایراد در اسلات‌های PCIe یا خرابی یکی از پردازنده‌ها است. خطای Cache Module Battery Degraded مربوط به ضعیف شدن باتری کارت رید است.
  • عیب‌یابی نسل‌های G8 ،G9 ،G10 و G11: در نسل G8 و G9 خرابی رم‌ها و پریدن فیرم‌ور کارت رید P420/P440 بسیار شایع است. در نسل G10 و G11 با اضافه شدن مکانیزم‌های امنیتی مانند Silicon Root of Trust، در صورت عدم مطابقت فیرم‌ور قطعات جانبی، سرور اجازه بوت نخواهد داد.

تعمیر سخت‌افزار سرورهای دل (Dell PowerEdge)

سرورهای Dell (مانند R730، R740 و R750) به پایداری بالا معروف هستند.

  • استفاده از iDRAC برای تشخیص قطعه معیوب: کنسول iDRAC کدهای دقیقی مانند UEFI0067 (خطای CPU) یا MEM0001 (خطای عمومی رم) صادر می‌کند. بخش LifeCycle Log در سرورهای دل، دقیق‌ترین جزئیات را ثبت می‌کند.
  • عیب‌یابی کدهای خطا روی پنل LCD سرورهای Dell: پنل جلویی سرورهای دل دارای یک نمایشگر کوچک LCD است. در صورت بروز مشکل، این پنل به رنگ نارنجی درآمده و کد خطا همراه با شرح مختصر قطعه معیوب روی آن اسکرول می‌شود.

تعمیر سخت‌افزار سرورهای سوپرمیکرو (Supermicro)

  • مشخصات خاص مادربوردها و تعویض قطعات: مادربوردهای سوپرمیکرو برخلاف اچ‌پی، از استانداردهای عمومی‌تری پشتیبانی می‌کنند. کدهای خطا در این سرورها بیشتر از طریق بوق‌های بازر (Beep Codes) هنگام POST یا از طریق ابزار اختصاصی Supermicro IPMI گزارش می‌شوند.

 

بسیاری از مشکلات شبکه و سرور با نگهداری اصولی و پشتیبانی مداوم قابل پیشگیری هستند. در مقاله پشتیبانی و نگهداری شبکه و سرور؛ کاهش قطعی، افزایش امنیت و عملکرد به بررسی راهکارهایی پرداخته‌ایم که به بهبود امنیت و عملکرد سیستم‌ها کمک می‌کنند.

 

اقدامات پیشگیرانه (Preventive Maintenance) برای کاهش نیاز به تعمیرات

در دنیای زیرساخت‌های فناوری اطلاعات، بزرگ‌ترین دشمن پایداری، «غافلگیری» است. خرابی سرورها معمولاً نه در اثر یک اتفاق ناگهانی، بلکه نتیجه استهلاک تدریجی است که در صورت نادیده گرفتن، به یک فاجعه هزینه‌بر تبدیل می‌شود. نگهداری پیشگیرانه (Preventive Maintenance) یا به‌اختصار PM، رویکردی است که در آن به‌جای انتظار برای بروز خرابی و تعمیرات اضطراری (Reactive Maintenance)، با پایش مستمر، سرویس دوره‌ای و تحلیل داده‌های سخت‌افزاری، عمر مفید تجهیزات را افزایش می‌دهیم. پیاده‌سازی یک استراتژی PM هوشمندانه، نه تنها ریسک از دست رفتن اطلاعات (Data Loss) و قطعی‌های ناخواسته (Downtime) را به حداقل می‌رساند، بلکه هزینه‌های جاری نگهداری سرور را به دلیل پیشگیری از آسیب‌های ثانویه، به‌طور قابل‌توجهی کاهش می‌دهد.

زمان‌بندی و مراحل سرویس دوره‌ای سخت‌افزار سرور

سرویس پیشگیرانه باید حداقل هر ۶ ماه یک‌بار طبق چک‌لیست زیر انجام شود:

  • ۱. پشتیبان‌گیری کامل (Full Backup): قبل از لمس هر قطعه، از تمامی داده‌ها و کانفیگ‌ها بک‌آپ بگیرید.
  • ۲. خاموشی برنامه‌ریزی‌شده (Scheduled Downtime): سرور را به‌صورت اصولی خاموش کرده و کابل‌های برق را جدا کنید.
  • ۳. گردگیری و بادگیری: با استفاده از پمپ باد استاندارد (با فشار کنترل‌شده)، گرد و غبار را از فن‌ها، هیت‌سینک‌ها و منافذ شاسی خارج کنید.
  • ۴. بازبینی چشمی: خازن‌های مادربورد، کابل‌های SATA/SAS و سوکت‌های برق را از نظر نداشتن تغییر شکل یا آثار سوختگی بررسی کنید.
  • ۵. تست سلامت دیسک‌ها: پارامترهای S.M.A.R.T و درصد سلامت SSDها را بررسی کنید.

استانداردسازی اتاق سرور

سخت‌افزار سرور فوق‌العاده به محیط اطراف خود حساس است. شرایط محیطی استاندارد عبارتند از:

  • دما: دمای ایده آل اتاق سرور بین ۱۸ تا ۲۱ درجه سانتی‌گراد است.
  • رطوبت: رطوبت نسبی باید بین ۴۰ تا ۵۵ درصد نگه داشته شود.
  • تغذیه برق: سرورها باید حتماً به استابلایزر و سیستم برق اضطراری آنلاین (Online UPS) متصل باشند.

آپدیت منظم فیرم‌ور (Firmware) قطعات

خیلی از مشکلات سخت‌افزاری در واقع ناشی از باگ‌های نرم‌افزاری داخل چیپست قطعات است. آپدیت به موقع BIOS، کارت رید، پاور و فیرم‌ور هارد دیسک‌ها، از بروز رفتارهای ناپایدار سخت‌افزار جلوگیری می‌کند.

چه زمانی قطعه را تعمیر کنیم و چه زمانی تعویض (Repair vs Replace)؟

در تصمیم‌گیری بین تعمیر (Repair) و تعویض (Replace) قطعات سرور، مهم‌ترین معیار باید ریسک خرابی مجدد، احتمال از دست رفتن داده‌ها و توجیه اقتصادی باشد؛ به‌طور کلی قطعاتی مثل کارت RAID، هارد دیسک، SSD و رم به دلیل نقش مستقیم در سلامت اطلاعات و پایداری سیستم، جزو قطعاتی هستند که نباید به‌صورت سطحی یا غیراصولی تعمیر شوند، چون کوچک‌ترین خطا در تعمیر آن‌ها می‌تواند باعث Data Loss یا آسیب‌های زنجیره‌ای به سرور شود، اما قطعاتی مانند پاور سرور، فن‌های شاسی و بعضی بخش‌های مادربورد در صورتی که تعمیر آن‌ها توسط متخصص و با تجهیزات مناسب انجام شود، می‌توانند گزینه‌ای قابل قبول باشند؛ با این حال اگر هزینه تعمیر به بیش از ۴۰ تا ۵۰ درصد قیمت یک قطعه سالم جایگزین برسد، یا آن قطعه نقش حیاتی در عملکرد سرور و امنیت داده‌ها داشته باشد، معمولاً تعویض قطعه انتخاب منطقی‌تر، ایمن‌تر و مقرون‌به‌صرفه‌تری است.

نکات ایمنی و اصول ESD در هنگام تعمیر سخت‌افزار سرور

در هنگام تعمیر سخت‌افزار سرور، رعایت نکات ایمنی و اصول ESD بسیار حیاتی است، زیرا بدن انسان می‌تواند بدون اینکه متوجه شود، چند هزار ولت الکتریسیته ساکن ذخیره کند، در حالی که قطعات سروری با ولتاژهای بسیار پایین، حتی زیر ۳.۳ ولت، کار می‌کنند و یک تخلیه ناگهانی می‌تواند به‌سادگی تراشه‌ها را بسوزاند؛ به همین دلیل باید همیشه از دستبند ضد الکتریسیته ساکن (ESD Wrist Strap) که به زمین (Earth) متصل است استفاده کرد، قطعات تعویضی را تا لحظه نصب از بسته‌بندی آنتی‌استاتیک خارج نکرد و آن‌ها را روی سطوحی مثل موکت، فرش یا پارچه قرار نداد.

از طرف دیگر، در بخش برق نیز باید احتیاط کامل داشت، چون پاور سرور حتی پس از جدا شدن کابل برق، به دلیل وجود خازن‌های ورودی با ظرفیت بالا ممکن است تا چند دقیقه همچنان شارژ ولتاژ بالا را حفظ کند؛ بنابراین هرگز نباید بلافاصله بدنه فلزی پاور را باز کرد یا بدون اطمینان از تخلیه کامل آن را دست‌کاری نمود.

 

با مشکلات سخت‌افزاری سرور کلافه شدید؟

عیب‌یابی و تعمیر تخصصی سرور نیاز به دقت و تجربه بالایی دارد. برای جلوگیری از توقف‌های طولانی‌مدت یا آسیب بیشتر به تجهیزات، همین حالا از متخصص کمک بگیرید.

برای دریافت مشاوره یا اعزام کارشناس جهت عیب‌یابی فوری، فرم زیر را تکمیل کنید:

سوالات متداول

1.هزینه تعمیر سخت افزار سرور چگونه محاسبه می‌شود؟

هزینه تعمیرات بستگی به نوع قطعه آسیب‌دیده، میزان پیچیدگی مدار، نیاز به تعویض چیپست یا قطعات جانبی و همچنین مدل و نسل سرور دارد. معمولاً هزینه‌ها شامل اجرت عیب‌یابی، هزینه قطعات جایگزین و اجرت تست پایداری است.

2.آیا تعمیر مادربورد سرور از نظر فنی و امنیتی توصیه می‌شود؟

تعمیرات جزئی مانند تعویض خازن‌های ورودی، پورتهای فیزیکی یا ترمیم سوکت‌های برق مشکلی ندارد. اما تعمیر چیپست اصلی، CPU Socket و سوختگی لایه‌های داخلی مادربورد به دلیل کاهش پایداری و ریسک بالای قطعی ناگهانی، برای سرورهای عملیاتی حیاتی پیشنهاد نمی‌شود.

3.نحوه تشخیص خراب بودن کارت رید سرور چیست؟

روشن نشدن چراغ‌های کارت، عدم شناسایی دیسک‌ها در BIOS، پاک شدن ناگهانی تنظیمات RAID، غیرفعال شدن دائمی حافظه Cache و صدور خطاهای Read/Write Error در لاگ iLO/iDRAC از نشانه‌های اصلی خرابی کارت رید یا باتری آن است.

4.در صورت روشن نشدن سرور، اولین اقدام چیست؟

ابتدا ورودی‌های برق و سلامت کابل‌ها را چک کنید. سپس پاورها را جداگانه تست کرده و به چراغ‌های وضعیت پشت پاور دقت کنید. در قدم بعدی کابل‌های برق را کشیده، دکمه پاور را ۳۰ ثانیه نگه دارید و سپس لاگ‌های کنسول iLO یا iDRAC را چک کنید.