راهنما

راهنمای پایش NAS و تعویض امن دیسک معیوب

از هشدار SMART تا Rebuild؛ برای حفظ داده چه چیزهایی را قبل و بعد از تعویض دیسک کنترل کنیم؟

راهنمای پایش NAS و تعویض امن دیسک معیوب

از هشدار SMART تا Rebuild؛ برای حفظ داده چه چیزهایی را قبل و بعد از تعویض دیسک کنترل کنیم؟

هشدار را تأیید کنید

شماره Bay، وضعیت SMART، خطاهای I/O و رویدادهای آرایه را ثبت کنید. چراغ هشدار به‌تنهایی برای بیرون‌کشیدن دیسک کافی نیست؛ اشتباه در انتخاب Bay می‌تواند آرایه را از دسترس خارج کند.

بکاپ و سازگاری را بررسی کنید

پیش از تعویض، وضعیت آخرین بکاپ و امکان بازیابی را کنترل کنید. دیسک جایگزین باید از نظر نوع، ظرفیت قابل استفاده و فهرست سازگاری دستگاه مناسب باشد و ظرفیتش از عضو قبلی کمتر نباشد.

Rebuild را تا پایان پایش کنید

پس از تعویض، فرایند بازسازی، دما، خطای دیسک‌های دیگر و بار سیستم را بررسی کنید. تا پایان و تأیید سلامت آرایه، تغییر بزرگ یا خاموشی برنامه‌ریزی‌نشده انجام ندهید.

میان هشدار دیسک و هشدار آرایه تفاوت بگذارید

SMART Warning، Bad Sector، I/O Error و Degraded RAID معنای یکسانی ندارند. مدل، Serial، Bay و آخرین رخداد را ثبت و از رابط مدیریت یا چراغ Locate برای شناسایی فیزیکی استفاده کنید. اگر چند دیسک هشدار دارند یا Pool ناپایدار است، تعویض عجولانه می‌تواند وضعیت را بدتر کند؛ ابتدا بکاپ و مسیر بازیابی را تأیید کنید.

دیسک جایگزین را دقیق انتخاب کنید

نوع رابط، فناوری CMR/SMR در صورت اهمیت، سرعت، Sector Size، ظرفیت قابل استفاده و فهرست سازگاری NAS را بررسی کنید. ظرفیت اسمی برابر ممکن است چند Sector کمتر باشد و عضو آرایه نشود. برای Workload پیوسته از دیسک مناسب NAS/Enterprise استفاده و Firmware یا محدودیت سازنده را کنترل کنید. دیسک دست‌دوم بدون سابقه روشن برای بازسازی انتخاب امنی نیست.

تعویض را مطابق نوع RAID انجام دهید

Hot Swap فقط وقتی مجاز است که Chassis، Controller و پیکربندی آن را پشتیبانی کنند. Bay درست را خارج، دیسک جدید را نصب و آغاز Rebuild را در UI تأیید کنید. در RAID 0 تعویض عضو بازیابی خودکار ایجاد نمی‌کند. در RAID 5/6/10 رفتار تحمل خرابی متفاوت است؛ قبل از اقدام وضعیت همه اعضا را ببینید.

Rebuild را به حال خود رها نکنید

در زمان بازسازی، درصد پیشرفت، دما، Latency، خطای دیسک‌های دیگر و فضای آزاد را پایش کنید. بار غیرضروری را کاهش دهید اما سرویس‌های حیاتی را بر اساس سیاست ادامه دهید. پس از پایان، Scrub یا آزمون سازگاری پیشنهادی سازنده، Snapshot و Job بکاپ را کنترل کنید. دیسک معیوب را برچسب و مطابق سیاست داده امحا یا RMA کنید.

چک‌لیست اجرایی و معیار تحویل

Bay، Serial و علت هشدار دوباره تأیید شده‌اند؛ بکاپ مستقل و Restore نمونه سالم است؛ دیسک جایگزین از نظر ظرفیت و سازگاری مناسب است؛ Hot Swap و روش تعویض با مدل/RAID سازگارند؛ Rebuild، دما، خطا و بکاپ پس از آن پایش شده‌اند؛ معیار تحویل: آرایه Healthy، هیچ عضو هشدار‌دار و Job بکاپ/اعلان سالم باشد و گزارش تعویض ثبت شود.