توضیحات
خدمات پایش و نگهداری زیرساخت شبکه مرکزداده
۱) پایش لحظهای سلامت و کارایی شبکه (Real-Time Health & Performance Monitoring)
مانیتورینگ ۲۴/۷ تمام سوئیچها، پورتها و لینکهای شبکه با SNMP و Syslog، رصد پهنای باند، خطاها، دمای تجهیزات و CPU/Memory سوئیچها، و هشداردهی بلادرنگ برای هر ناهنجاری.
شبکه مثل برق شهری باید همیشه باشد و کسی متوجه حضور آن نشود. اما برخلاف برق، شبکه هزاران نقطه بالقوه برای خرابی دارد: یک پورت که شروع به بالا دادن CRC Error کرده، یک لینک فیبر که دمایش رفته بالا و Link Flapping شروع شده، یک سوئیچ که CPU Usage اش به ۹۰٪ رسیده و BPDU ها را با تأخیر پردازش میکند. مانیتورینگ ابتدایی (پینگ کردن سوئیچ) فقط ۲۰٪ مشکلات را نشان میدهد. تیم ما پایش عمیق را با پروتکلهای استاندارد دیتاسنتری پیادهسازی میکند: SNMP v3 برای خواندن Utilization پورتها، Error Counters، دما و Power Supply وضعیت (با OID های اختصاصی هر برند)، Syslog برای جمعآوری بلادرنگ تمام لاگهای سوئیچها (Link Down/Up، Spanning Tree Topology Change، BGP Neighbor Down)، و NetFlow/sFlow برای تحلیل جریان ترافیک. Threshold های هوشمند تعریف میکنیم: Warning اگر Utilization پورت Uplink از ۷۰٪ عبور کرد، Critical اگر CRC Error در ۵ دقیقه از ۱۰۰ عدد گذشت، Emergency اگر Core Switch یکی از Power Supply هایش را از دست داد. هشدارها از طریق ایمیل، پیامک یا پیامرسان در کمتر از ۲ دقیقه به تیم فنی میرسد. هدف: ما قبل از کاربران از مشکل باخبر میشویم.
2) ارتقای بدون توقف Firmware سوئیچها (Online Firmware Upgrade – ISSU)
بهروزرسانی Firmware سوئیچهای Core و Distribution با روش In-Service Software Upgrade (ISSU)، بدون حتی یک پکت از دست رفته یا قطعی لینک، با رعایت ترتیب و پیشنیازها.
بهروزرسانی Firmware سوئیچ Core معمولاً مساوی است با یک پنجره Maintenance شبانه، قطعی چنددقیقهای کل شبکه، و استرس فراوان. اما سوئیچهای سازمانی مدرن (Cisco Nexus، Catalyst 9000، Juniper EX/QFX، Arista) قابلیتی به نام ISSU دارند: Firmware در حافظه بارگذاری میشود، Supervisor Engine ثانویه با نسخه جدید بالا میآید، Control Plane بدون وقفه Failover میشود، و بعد Supervisor اصلی هم آپدیت میشود. کل فرآیند بدون حتی یک پکت Lost. اما اجرای ISSU نیازمند رعایت دقیق پیشنیازهاست: Compatibility Matrix نسخه مبدأ و مقصد (همه نسخهها ISSU Supported نیستند)، فضای کافی Bootflash، سلامت کامل Supervisor ثانویه، و Non-Stop Forwarding فعال. تیم ما این ارتقا را مهندسی میکند: Pre-Check کامل (Show Module، Show Redundancy، Dir Bootflash)، بکآپ از Configuration، اجرای ISSU با مانیتورینگ لحظهای پکت لاس (Ping با Interval ۱۰۰ms در طول فرآیند)، و در پایان Health Check کامل. نتیجه: Firmware سوئیچ Core شما بهروز میشود و حتی یک Session کاربری قطع نمیشود.
3) عیبیابی قطعی لینکها و رفع خطاهای پورت (Link & Port Troubleshooting)
تشخیص علت قطعی لینکهای فیبر و مس، عیبیابی Link Flapping، رفع خطاهای CRC، Input/Output Errors و Collision، و تست سلامت فیزیکی و منطقی پورتها.
Link Flapping (بالا و پایین شدن مکرر لینک در کسری از ثانیه) یکی از مخربترین مشکلات شبکه است: Spanning Tree دائماً Recalculate میکند، MAC Table خالی میشود، و ترافیک شبکه قطع و وصل میشود. علت میتواند فیزیکی باشد (کابل فیبر شکسته، کانکتور کثیف، SFP معیوب، یا خمش بیش از حد فیبر) یا منطقی (Speed/Duplex Mismatch، Auto-Negotiation Fail، یا تداخل تنظیمات). تیم ما عیبیابی را لایهبهلایه انجام میدهد: لایه ۱: SFP را با SFP سالم تعویض میکنیم، کابل را با OTDR تست مینماییم، کانکتور را با ابزار بازرسی فیبر (Fiber Scope) چک میکنیم. لایه ۲: Show Interface Errors میگیریم. CRC Error یعنی مشکل فیزیکی (کابل/SFP). Runts و Giants یعنی مشکل Duplex. Input Errors با Collision یعنی Half Duplex در یک سمت و Full در سمت دیگر. لایه کنترل: آیا Spanning Tree پورت را Block نکرده؟ آیا Port Security MAC Address ای بیش از حد مجاز دیده و پورت را Err-Disable کرده؟ ما علت ریشهای را پیدا میکنیم، خطا را رفع مینماییم، و پورت را با تست iPerf تأیید میکنیم که سالم است.
4) تحلیل گلوگاههای ترافیکی و بهینهسازی کارایی (Bottleneck Analysis & Performance Optimization)
تحلیل ترافیک با NetFlow/sFlow برای شناسایی Host ها و Application های پرمصرف، کشف گلوگاههای پهنای باند، بهینهسازی QoS و Load Balancing روی لینکهای Trunk.
“شبکه کند شده” یک شکایت عمومی است که میتواند هزاران علت داشته باشد. شاید یک سرور بکآپ در ساعت کاری، کل پهنای باند Uplink را اشغال کرده. شاید یک VM آلوده به بدافزار، ترافیک سنگین به اینترنت تولید میکند. شاید QoS تنظیم نشده و ترافیک VoIP با ترافیک File Transfer رقابت میکند. تیم ما بهجای حدس زدن، دادهمحور تحلیل میکند: NetFlow یا sFlow را روی پورتهای کلیدی فعال مینماییم (Uplink ها، اینترنت Edge، لینک به Storage)، دادههای جریان ترافیک را ۲۴-۴۸ ساعت جمعآوری میکنیم، و Top Talker ها را شناسایی مینماییم (کدام Host، کدام Protocol، کدام Port بیشترین پهنای باند را مصرف میکند). سپس گلوگاه را مشخص میکنیم: آیا Utilization لینک Core-Distribution به ۹۵٪ رسیده و اشباع شده؟ آیا Buffer Microburst داریم (ترافیک لحظهای که Average نشان نمیدهد اما Drop ایجاد میکند)؟ راهحل را ارائه میدهیم: اضافه کردن لینک به Port-Channel، تنظیم QoS با اولویتدهی به ترافیک بحرانی، محدودسازی Rate Limit برای ترافیک غیرضروری، یا تغییر مسیر ترافیک با تنظیم Cost در Spanning Tree یا Metric در Routing. گزارش نهایی میگوید: “گلوگاه اینجاست، راهحل این است، بعد از اعمال، پهنای باند مؤثر ۴۰٪ افزایش یافت.”
5) پشتیبانی اورژانسی و رفع خرابی بحرانی (Emergency Network Support)
واکنش فوری به قطعیهای بحرانی شبکه (Core Switch Failure، Spanning Tree Loop، Routing Black Hole، VLAN قطعشده)، عیبیابی سریع و بازگردانی سرویس در کمترین زمان ممکن.
قطعی شبکه در دیتاسنتر یعنی همه سرویسها Down هستند: VM ها Unreachable، استوریج All Paths Down، کاربران قطع. در این لحظه، هر دقیقه میتواند میلیونها تومان ضرر بزند و اولین واکنش معمولاً پانیک و آزمون و خطاست (سوئیچ را ریست کنیم ببینیم درست میشود؟!) که اغلب شرایط را بدتر میکند. تیم Emergency Support ما فرآیند نظاممند برای بحران دارد: ۱) Triage: اولین تماس، اولویتبندی میشود. تیم ما در کمتر از ۱۵ دقیقه به صورت ریموت (از طریق Out-of-Band Management یا iLO/iDRAC) وارد میشود. ۲) Scope: مرز مشکل را تعیین میکنیم. آیا کل شبکه Down است یا فقط یک VLAN؟ فقط سوئیچ Core یا یک Access Switch؟ ۳) Diagnose: دستورات عیبیابی استاندارد اجرا میشود (Show Log، Show Spanning Tree، Show VLAN، Show Interface Status، Show IP Route). ۴) Resolve: علت ریشهای یافت میشود (مثلاً Spanning Tree Loop به خاطر اتصال اشتباه یک کابل، یا BGP Neighbor Down به خاطر مشکل لینک اینترنت) و رفع فوری میشود. ۵) Report: پس از بازگشت سرویس، Root Cause Analysis کامل با گاهشمار وقایع و توصیههای پیشگیرانه ارائه میدهیم. در صورت نیاز به حضور فیزیکی (تعویض سختافزار)، تیم عملیاتی با تجهیزات یدکی اعزام میشود. ما در بحران، خونسردی و دقت را جایگزین هرجومرج میکنیم.
6) ممیزی سلامت شبکه و گزارشدهی دورهای (Network Health Audit & Periodic Reporting)
اجرای ممیزی فصلی کامل شبکه (Configuration Audit، Security Audit، Performance Baseline)، مستندسازی تغییرات، و ارائه گزارش سلامت با نمودارهای روند و توصیههای بهینهسازی.
شبکه موجودی زنده است: ترافیک ماهبهماه رشد میکند، کانفیگها تغییر میکنند، و خطاهای کوچک اگر دیده نشوند، تبدیل به بحرانهای بزرگ میشوند. تیم ما یک Health Audit فصلی انجام میدهد که سه بُعد دارد: ۱) Configuration Audit: آیا Configuration همه سوئیچها همخوان و مطابق Best Practice است؟ Consistency Check بین سوئیچها (VLAN Database، Spanning Tree Root Bridge، Password/SNMP Community). ۲) Security Audit: آیا پورتهای استفادهنشده Admin Down هستند؟ آیا Telnet غیرفعال و SSH v2 فعال است؟ آیا ACL های مرزی بهروز هستند؟ ۳) Performance Baseline: مقایسه Utilization پورتها، خطاها، و CPU سوئیچها با Baseline سه ماه قبل. آیا Utilization Uplink از ۶۰٪ به ۸۰٪ رسیده (نشانه نیاز به ارتقا)؟ آیا Error Rate پورت خاصی از ۰ به ۵۰ در روز افزایش یافته (نشانه خرابی تدریجی کابل)؟ در پایان، یک گزارش Executive با نمودارهای روند (Trend Charts) و Action Plan اولویتبندیشده (موارد قرمز: اقدام فوری، زرد: برنامهریزی برای ماه آینده، سبز: وضعیت مطلوب) به شما ارائه میدهیم. ممیزی یعنی شبکه شما هر سه ماه یکبار چکآپ کامل میشود، نه وقتی که درد به سراغش بیاید.

نقد و بررسیها
هنوز بررسیای ثبت نشده است.