توضیحات
خدمات فوریتهای زیرساخت شبکه مرکزداده
۱) بازیابی از قطعی کامل سوئیچ Core و شکست لینکهای حیاتی
تشخیص فوری علت خاموشی یا از کار افتادن سوئیچ Core (خرابی سختافزار، Firmware Crash، قطع برق)، Failover به مسیر جایگزین، و بازگردانی کامل سرویس.
وقتی سوئیچ Core از کار میافتد، یعنی تمام ترافیک بین VLAN ها، تمام Gateway ها، و احتمالاً تمام ارتباطات اینترنت قطع میشود. این سناریوی “قلب ایستاده” شبکه است. اولین قدم، تأیید Failover است: آیا Core ثانویه به درستی Gateway ها را با HSRP/VRRP تحویل گرفته؟ آیا Routing Table کاملاً Converge شده و مسیرهای جایگزین از طریق Core دوم فعال هستند؟ اگر Failover خودکار موفق نبوده (مثلاً Preempt تنظیم نبوده)، تیم ما بهصورت دستی VIP را روی Core دوم فعال میکند. همزمان، وضعیت Core اصلی را عیبیابی میکنیم: از طریق کنسول Out-of-Band وارد میشویم، لاگهای آخرین لحظات قبل از Crash را بررسی میکنیم (Show Log، Crash Dump)، سلامت سختافزاری (Power Supply، Supervisor، Fabric Module) را چک میکنیم. در ۸۰٪ موارد، مشکل با Reload کنترلشده یا تعویض قطعه معیوب حل میشود. RTO هدف ما در این سناریو زیر ۱۵ دقیقه است. پس از بازگشت، Root Cause Analysis کامل با گاهشمار رویدادها و توصیههای پیشگیرانه (مثلاً ارتقای Firmware، تعویض سختافزار فرسوده) ارائه میدهیم.
2) مهار طوفانهای Broadcast و Multicast (Storm Control & Loop Prevention)
تشخیص منبع Storm (Broadcast، Multicast یا Unicast Flood)، ایزوله کردن پورت یا VLAN معیوب، و بازگردانی پایداری شبکه در عرض چند دقیقه.
طوفان Broadcast مثل سونامی در شبکه است: یک بسته Broadcast در یک Loop گرفتار میشود، تکثیر میشود، کل پهنای باند را اشغال میکند، CPU سوئیچها را به ۱۰۰٪ میرساند و همه چیز را قفل میکند. علت معمول: یک کابل اشتباه که دو پورت یک سوئیچ را به هم وصل کرده، یا یک دستگاه معیوب که بیوقفه Broadcast میفرستد. تیم ما در این سناریو ابتدا Storm را مهار میکند: با دستور Show Interface | include broadcast یا Show Process CPU، پورتی که نرخ Broadcast غیرعادی دارد را پیدا میکنیم و بلافاصله آن را Shutdown مینماییم. اگر Storm کل شبکه را فرا گرفته، VLAN معیوب را روی Trunk های اصلی Suspend میکنیم تا بقیه VLAN ها نجات یابند. سپس علت ریشهای را مییابیم: آیا Spanning Tree روی پورتی غیرفعال شده؟ آیا Storm Control آستانه مناسب نداشته؟ تنظیمات پیشگیرانه را اعمال میکنیم: Storm Control با Threshold (مثلاً ۱٪ پهنای باند) روی تمام Access Port ها، BPDU Guard و Loop Guard فعال، و Unidirectional Link Detection (UDLD) روی فیبرها. نتیجه: نه تنها Storm فعلی میخوابد، بلکه شبکه در برابر Storm های آینده واکسینه میشود.
3) خنثیسازی حملات DDoS و سیل ترافیک مخرب
تشخیص حمله DDoS (Volumetric، Protocol یا Application Layer)، فیلتر کردن ترافیک مخرب با ACL، Blackhole Routing با BGP، و Rate Limiting برای حفظ دسترسی سرویسهای حیاتی.
حمله DDoS مثل ترافیک سنگینی است که همه خطوط ورودی را قفل میکند. سرورها و فایروالها زیر حجم عظیم ترافیک خفه میشوند و کاربران واقعی نمیتوانند وارد شوند. تیم ما ابتدا حمله را تأیید و Profile میکند: با NetFlow یا sFlow، منبع ترافیک (Source IP، Port، Protocol) و هدف (Destination IP/Port) را شناسایی میکنیم. آیا حمله Volumetric است (پهنای باند اشباع شده)؟ یا SYN Flood (اتصالات نیمهباز میلیونی)؟ استراتژی دفاع را متناسب انتخاب میکنیم: برای SYN Flood، SYN Cookies و Connection Rate Limiting روی فایروال یا ADC. برای Volumetric، Blackhole Routing با BGP: آدرس IP هدف را با یک Static Route به Null0 هدایت میکنیم و از طریق BGP به Upstream Provider اعلام میشود که ترافیک به این IP را Drop کند (Remotely Triggered Black Hole). همزمان، ACL های موقت روی روتر مرزی اعمال میکنیم تا ترافیک از Source IP های مخرب Block شود. پس از فروکش حمله، یک گزارش کامل از Profile حمله، اقدامات انجامشده، و توصیههای بلندمدت (مثل DDoS Mitigation Appliance یا Scrubbing Justify) ارائه میدهیم.
4) پاسخ فوری به نفوذ و تهدیدات امنیتی شبکه
ایزوله کردن دستگاه یا VLAN کامپرومایز شده، تحلیل لاگها برای شناسایی Scope نفوذ، مسدودسازی دسترسی مهاجم، و جمعآوری شواهد برای forensic.
وقتی SOC یا تیم امنیت هشدار میدهد که یک IP داخلی در حال اسکن پورتهاست، یا ترافیک C&C (Command & Control) به یک سرور خارجی مشکوک شناسایی شده، شبکه وارد فاز جنگی میشود. تیم فوریتهای شبکه ما مکمل تیم امنیت شما عمل میکند: ۱) ایزولهسازی فوری: MAC Address یا IP دستگاه آلوده را با ACL یا VLAN Change قرنطینه میکنیم تا به بقیه شبکه آسیب نزند، اما ارتباطش را کامل قطع نمیکنیم (برای Daily Forensic). ۲) Scope Assessment: روی سوئیچها و روترها، Session های فعال آن IP را بررسی میکنیم (Show IP Flow، NetFlow Record)، که ببینیم با چه سرورهای دیگری در ارتباط بوده. ۳) شواهد شبکه: لاگهای NetFlow، Syslog و ARP Table از سوئیچها را Export و Time-stamp میکنیم برای تیم Forensic. ۴) Block: IP و دامنههای C&C شناساییشده را در Firewall و DNS Sinkhole مسدود میکنیم. ۵) پاکسازی: پس از تأیید تیم امنیت، پورت دستگاه آلوده را Shutdown مینماییم. هدف ما در این سناریو این است که شبکه، بستر گسترش حمله نباشد، بلکه دیوار دفاعی فعال در برابر آن باشد.
5) بازیابی پیکربندی از دست رفته یا خراب (Configuration Rollback)
بازیابی Configuration سوئیچ یا روتری که بر اثر خرابی Flash، حذف اشتباهی Startup-Config یا آپدیت ناموفق از دست رفته، و بازگردانی سریع به وضعیت عملیاتی.
صحنه: ساعت ۳ نصفهشب، سوئیچ Core پس از یک Reload با پیغام “No Startup-Config” بالا آمده. یعنی تمام VLAN ها، SVI ها، Routing و ACL ها پاک شدهاند. اگر نسخه پشتیبان نداشته باشید، باید از حفظ Config بنویسید. تیم ما برای این سناریو از پیش آماده است. ما از تمام سوئیچهای شما بهصورت خودکار نسخه پشتیبان رمزنگاریشده روی یک سرور امن خارج از شبکه تولید نگه میداریم. در لحظه بحران: آخرین نسخه سالم Configuration را از Backup Server برداشته، از طریق Console یا Out-of-Band Management به سوئیچ منتقل میکنیم، و آن را Load و Commit مینماییم. سپس Configuration را با آخرین تغییرات مستند (VLAN جدید، ACL جدید) تطبیق میدهیم. همچنین Startup-Config را دوباره ذخیره میکنیم. پس از بازگشت سرویس، علت پاک شدن Config را بررسی میکنیم: خرابی Flash، دستور Write Erase اشتباهی، یا Bug Firmware. توصیههای پیشگیرانه: تنظیم Configuration Auto-Save، Mirror Flash، و ارتقای Firmware. RTO هدف ما برای این سناریو زیر ۳۰ دقیقه است.
6) فرماندهی بحران و مستندسازی درسآموختهها (Incident Command & Post-Mortem)
مدیریت سناریوی بحرانی با Incident Command System (ICS)، هماهنگی بین تیمهای شبکه، امنیت و سرور، ثبت گاهشمار دقیق رویدادها، و ارائه گزارش Post-Mortem با درسآموختهها.
در یک بحران بزرگ، بزرگترین دشمن، بینظمی و اقدامات پراکنده است. ممکن است تیم شبکه در حال عیبیابی باشد، تیم سرور VM ها را Restart کند، و تیم امنیت یک ACL بگذارد که همه چیز را بدتر کند. تیم ما با متدولوژی ICS (سیستم فرماندهی حادثه) بحران را مدیریت میکند: ۱) یک Incident Commander از تیم ما تعیین میشود که تمام ارتباطات و تصمیمات از کانال او عبور کند. ۲) یک Timeline دقیق (دقیقهبهدقیقه) از همه رویدادها و اقدامات ثبت میشود. ۳) هر اقدام با تأیید Commander انجام میشود تا از تداخل و اقدامات متناقض جلوگیری شود. ۴) پس از Resolution، حداکثر ظرف ۴۸ ساعت، یک جلسه Post-Mortem با حضور تمام تیمهای درگیر برگزار میکنیم. گزارش نهایی شامل: Timeline کامل، Root Cause Analysis (با متد ۵ Whys)، اقدامات انجامشده، زمانهای قطعی و بازیابی، و از همه مهمتر، Action Plan برای جلوگیری از تکرار. نکته مثبت: این جلسه بدون انگشتنشان کردن افراد، با تمرکز بر بهبود فرآیند برگزار میشود. ما بحران را نه فقط حل میکنیم، بلکه از آن یک سپر دفاعی برای آینده سازمان میسازیم.

نقد و بررسیها
هنوز بررسیای ثبت نشده است.