توضیحات
خدمات پایداری و حفاظت از داده در زیرساخت ذخیرهسازی مرکزداده:
1) طراحی و پیکربندی RAID با تحمل خطای مناسب
- تحلیل workload و انتخاب سطح RAID بهینه (۶، ۱۰ یا Dynamic)، تنظیم Global و Dedicated Hot Spare، و پیکربندی هشدارهای پیشاز خرابی.
اولین سنگر پایداری، داخل خود استوریج و در سطح دیسکهاست. انتخاب RAID صرفاً بین ۵ و ۱۰ نیست؛ RAID 5 با دیسکهای ۴ ترابایتی یعنی یک دیسک خراب شود، ۲۴ ساعت Rebuild زمان میبرد و در این فاصله، خرابی دیسک دوم یعنی از دست رفتن کل داده. RAID 6 این ریسک را با دو دیسک Parity به شدت کاهش میدهد. RAID 10 بهترین کارایی را برای دیتابیس دارد اما ۵۰٪ ظرفیت را فدا میکند. ما با توجه به نوع دیسکها (SAS, NL-SAS, SSD) و workload شما (IOPS سنگین یا ظرفیت بالا)، RAID مناسب را انتخاب میکنیم. برای هر Pool حداقل یک Hot Spare Global و برای آرایههای بحرانی یک Dedicated Hot Spare تخصیص میدهیم. هشدارها را طوری تنظیم میکنیم که پیش از خرابی کامل دیسک (مثلاً با افزایش Bad Sector یا Reallocated Sector Count) آگاه شوید، نه بعد از آن.
2) پیکربندی کنترلرهای افزونه و Failover شفاف
- تنظیم کنترلرهای Dual Controller با Active-Active یا Active-Passive، تست Failover بدون قطعی، و پیکربندی Heartbeat بین کنترلرها.
دیسکها با RAID محافظت میشوند، اما اگر تنها کنترلر استوریج خراب شود، کل Volume ها از دسترس خارج میشوند. کنترلر دوم، بیمهنامه تداوم سرویس است. در معماری Active-Active هر دو کنترلر به طور همزمان به Volume ها سرویس میدهند و خرابی یکی، بار روی دیگری میافتد. در Active-Passive کنترلر دوم آمادهبهکار است و Failover در چند ثانیه انجام میشود. تیم ما کنترلرها را با Firmware یکسان، تنظیمات Cache Mirroring (برای حفظ دادههای در حال نوشتن حین Failover) و Heartbeat سالم پیکربندی میکند. سپس Failover را عملاً تست میکنیم: کنترلر A را خاموش میکنیم و تأیید مینماییم که I/O بدون حتی یک خطا روی کنترلر B ادامه یابد. شفافیت Failover یعنی سرورها حتی متوجه خرابی نشوند.
3) پیکربندی Multipathing با حداقل دو مسیر کاملاً مجزا
- تنظیم دو مسیر فیزیکی از هر سرور به استوریج (FC/iSCSI)، پیکربندی ALUA، انتخاب Policy توزیع بار (Round Robin) و تست Failover مسیر.
حتی با دو کنترلر، اگر فقط یک مسیر فیزیکی از هاست به استوریج باشد، خرابی آن کابل یا پورت سوئیچ یعنی قطع دسترسی. Multipathing استاندارد یعنی هر هاست حداقل دو HBA، دو کابل، دو پورت سوئیچ و دو مسیر تا کنترلرهای استوریج داشته باشد. ما MPIO را روی هاستها پیکربندی میکنیم، ALUA را روی استوریج فعال مینماییم تا مسیرهای بهینه (Optimized) از غیربهینه (Unoptimized) تفکیک شوند، و Policy را روی Round Robin تنظیم میکنیم تا ترافیک علاوه بر افزونگی، بین دو مسیر توزیع و پهنای باند تجمیع شود. در پایان، با قطع عمدی یک مسیر، تأیید میکنیم که ترافیک بدون حتی یک Retry یا Error به مسیر دوم سوئیچ میکند. این تست را در حضور کارفرما انجام میدهیم تا اعتماد ایجاد شود.
4) پیکربندی افزونگی پاور و خنککننده
- اطمینان از دبل پاور و اتصال به دو مدار برق مجزا (A/B Feed)، تنظیم و تست Fan Redundancy، و پیکربندی هشدار خرابی.
پایداری ذخیرهسازی فقط در دیسک و کنترلر خلاصه نمیشود. اگر هر دو منبع تغذیه استوریج به یک PDU وصل باشند و آن PDU خراب شود، استوریج خاموش میشود. اگر فنها افزونه نباشند، خرابی یک فن میتواند باعث Overheat و خاموشی اضطراری شود. تیم ما اتصال پاورها را بررسی میکند: Power Supply 1 به مدار A (UPS مسیر چپ) و Power Supply 2 به مدار B (UPS مسیر راست). این تفکیک را مستند میسازیم و تست میکنیم (قطع یکی از دو مدار، تأیید ادامه کار). هشدار خرابی پاور و فن را روی کنسول مدیریتی فعال میکنیم و آستانه دمایی (Temperature Threshold) را متناسب با دمای محیط تنظیم مینماییم.
5) تضمین یکپارچگی داده با Consistency Check و Scrubbing
- تنظیم Consistency Check دورهای RAID، Media Scan برای شناسایی بدسکتور، و Data Scrubbing برای اصلاح خطاهای خاموش.
خطاهای داده همیشه با خرابی یک دیسک خود را نشان نمیدهند. گاهی یک سکتور روی دیسک خراب میشود (Media Error) و تا وقتی کسی آن سکتور را نخواند، خطا مخفی میماند. این خطاها به مرور جمع میشوند و یک روز حین Rebuild، کل آرایه از کار میافتد. Consistency Check هفتگی RAID همه بلاکها را میخواند و با Parity مقایسه میکند. Media Scan یا Data Scrubbing هم سکتورهای خراب را شناسایی و با استفاده از RAID Parity اصلاح میکند. تیم ما این فرآیندها را با زمانبندی مناسب (مثلاً شنبهشبها در پنجره کمباری) برنامهریزی میکند و گزارش سلامت را به صورت خودکار ایمیل میشود. این نگهداری پیشگیرانه، جلوی فاجعههای خاموش را میگیرد.
6) مستندسازی معماری پایداری و تحویل Runbook خرابی
- تهیه دیاگرام افزونگی (Redundancy Map)، مستندسازی سناریوهای خرابی و پاسخ استاندارد، و آموزش مراحل تعویض قطعه معیوب.
پایداری یعنی بدانید وقتی خرابی رخ داد، دقیقاً چه اتفاقی میافتد و چه کاری باید انجام دهید. ما یک Redundancy Map تحویل میدهیم که نشان میدهد هر دیسک در کدام RAID Group است، Hot Spare کجاست، مسیرهای Multipath از کدام HBA و سوئیچ عبور میکنند، و Failover کنترلر چگونه عمل میکند. برای سناریوهای محتمل (خرابی دیسک، خرابی کنترلر، قطع کابل FC) یک پاسخ استاندارد (Runbook) مینویسیم: گامبهگام با دستورات دقیق و اسکرینشات از کنسول مدیریتی. همچنین یک جلسه عملی با تیم شما برگزار میکنیم: یک دیسک را عمداً از array خارج میکنیم و فرآیند تعویض و Rebuild واقعی را با هم تمرین میکنیم. پایداری فقط طراحی نیست، آمادگی تیم در لحظه بحران هم بخشی از آن است.

نقد و بررسیها
هنوز بررسیای ثبت نشده است.