اختلال در دیتاسنتر میتواند دسترسی به سامانههای حیاتی، دادهها و سرویسهای سازمان را با مشکل مواجه کند. Disaster Recovery یا «بازیابی پس از بحران» مجموعهای از برنامهها، فرآیندها و زیرساختهایی است که به سازمان کمک میکند پس از وقوع یک اختلال جدی، سرویسهای فناوری اطلاعات را در زمان قابلقبولی بازیابی کند. در این مقاله بررسی میکنیم Disaster Recovery چیست، چه ارتباطی با تداوم کسبوکار دارد و سازمانها برای آمادگی در برابر اختلال دیتاسنتر باید چه اقداماتی انجام دهند.
مقدمه
امروزه بسیاری از فرآیندهای عملیاتی سازمانها به زیرساخت فناوری اطلاعات وابسته هستند. توقف یک سرور، قطع ارتباطات شبکه، خرابی تجهیزات، اختلال در برق، خطای انسانی یا یک حادثه گستردهتر میتواند باعث شود بخشی از خدمات سازمان برای مدتی در دسترس نباشد.
در چنین شرایطی، داشتن نسخه پشتیبان بهتنهایی کافی نیست. سازمان باید از قبل مشخص کرده باشد چه سرویسهایی باید زودتر بازیابی شوند، اطلاعات از چه نقطهای قابل بازگردانی هستند، زیرساخت جایگزین کجاست و چه تیمهایی مسئول اجرای فرآیند بازیابی خواهند بود.
به همین دلیل Disaster Recovery باید بخشی از برنامه مدیریت ریسک و تداوم فعالیت سازمان باشد، نه اقدامی که بعد از وقوع بحران به آن فکر شود.
Disaster Recovery چیست؟
Disaster Recovery یا DR به مجموعه سیاستها، فرآیندها، فناوریها و زیرساختهایی گفته میشود که برای بازیابی سرویسهای فناوری اطلاعات پس از یک اختلال جدی طراحی میشوند.
هدف اصلی DR این نیست که وقوع تمام حوادث را متوقف کند؛ بلکه هدف آن کاهش زمان توقف سرویسها و محدود کردن میزان از دست رفتن دادهها در صورت بروز حادثه است.
در یک برنامه بازیابی پس از بحران معمولاً موضوعاتی مانند پشتیبانگیری از دادهها، Replication، زیرساخت جایگزین، اولویتبندی سامانهها، ارتباطات اضطراری، مسئولیت تیمها و روش بازگرداندن سرویسها مشخص میشود.
ارتباط Disaster Recovery با Business Continuity چیست؟
Business Continuity Management یا BCM مفهوم گستردهتری نسبت به Disaster Recovery دارد. BCM بر ادامه فعالیتهای حیاتی کسبوکار در شرایط بحران تمرکز میکند، در حالی که DR بیشتر بر بازیابی زیرساخت و سرویسهای فناوری اطلاعات متمرکز است.
برای مثال، در یک اختلال دیتاسنتر ممکن است DR مشخص کند سامانه مالی چگونه روی زیرساخت جایگزین راهاندازی شود. در مقابل، برنامه تداوم کسبوکار مشخص میکند واحد مالی تا زمان بازیابی کامل سامانهها چگونه فعالیت خود را ادامه دهد.
بنابراین یک سازمان بالغ باید DR و BCM را در کنار یکدیگر ببیند.
در یک نگاه
حوزه: زیرساخت فناوری اطلاعات و خدمات مرکز داده
مخاطب: مدیران فناوری اطلاعات، مدیران زیرساخت و مدیران سازمان
مسئله اصلی: توقف سرویسهای حیاتی در اثر اختلال دیتاسنتر
راهکار: طراحی و اجرای برنامه Disaster Recovery و تداوم کسبوکار
مزیت اصلی: کاهش زمان توقف و افزایش آمادگی سازمان در برابر بحران
چرا Disaster Recovery برای سازمانها اهمیت دارد؟
وابستگی سازمانها به سرویسهای دیجیتال باعث شده است اختلال زیرساخت فناوری اطلاعات مستقیماً بر عملیات کسبوکار تأثیر بگذارد.
قطع دسترسی به پایگاه داده، سامانههای داخلی، سرویسهای ارتباطی یا برنامههای عملیاتی میتواند بخشی از فعالیت سازمان را متوقف کند. هرچه سرویس موردنظر حیاتیتر باشد، مدت زمان قابلتحمل برای توقف آن نیز کمتر خواهد بود.
برنامه Disaster Recovery به سازمان کمک میکند پیش از وقوع حادثه، سناریوهای احتمالی را بررسی کرده و برای بازیابی سرویسهای حیاتی تصمیمگیری کند.
مزایا و دلایل طراحی برنامه Disaster Recovery
کاهش زمان توقف سرویسها
یکی از مهمترین اهداف DR کاهش Downtime است.
زمانی که فرآیند بازیابی، زیرساخت جایگزین و مسئولیت تیمها از قبل مشخص شده باشند، سازمان در زمان بحران مجبور نیست تصمیمهای اصلی را از ابتدا اتخاذ کند. این موضوع سرعت واکنش عملیاتی را افزایش میدهد.
کاهش ریسک از دست رفتن دادهها
در برنامه Disaster Recovery باید مشخص شود سازمان چه مقدار از دادههای اخیر را میتواند از دست بدهد.
این موضوع معمولاً با شاخص RPO یا Recovery Point Objective تعریف میشود. بر اساس این شاخص میتوان سیاست Backup و Replication مناسبتری برای سامانههای مختلف طراحی کرد.
تعیین زمان قابلقبول بازیابی
همه سامانهها اهمیت یکسانی ندارند.
شاخص RTO یا Recovery Time Objective مشخص میکند هر سرویس باید حداکثر در چه مدت زمانی پس از اختلال بازیابی شود. برای مثال ممکن است یک سامانه عملیاتی نیازمند بازیابی سریع باشد، در حالی که بازیابی یک سرویس جانبی بتواند با تأخیر بیشتری انجام شود.
ایجاد زیرساخت جایگزین
یکی از اجزای مهم DR پیشبینی محیطی برای ادامه یا بازیابی سرویسهاست.
این زیرساخت بسته به نیاز سازمان میتواند شامل سایت پشتیبان، منابع پردازشی جایگزین، تجهیزات شبکه، فضای ذخیرهسازی یا سایر زیرساختهای موردنیاز باشد.
انتخاب معماری مناسب باید بر اساس اهمیت سرویسها، RTO، RPO، بودجه و سطح ریسک سازمان انجام شود.
کاهش وابستگی به تصمیمگیری لحظهای
در زمان بحران، فشار عملیاتی بالا است و احتمال خطا در تصمیمگیری افزایش پیدا میکند.
Runbookها، سناریوهای بازیابی، فهرست مسئولیتها و روشهای Escalation کمک میکنند تیم فنی بر اساس یک فرآیند مشخص عمل کند.
امکان ارزیابی واقعی میزان آمادگی
داشتن مستندات DR به معنی آماده بودن سازمان نیست.
برنامه بازیابی باید بهصورت دورهای آزمایش شود. تستهای فنی، Failover، بازیابی Backup و شبیهسازی سناریوهای اختلال میتوانند نقاط ضعف برنامه را قبل از وقوع حادثه واقعی آشکار کنند.
سازمان چگونه برای اختلال دیتاسنتر آماده شود؟
اولین اقدام، شناسایی سرویسهای حیاتی و وابستگی میان آنهاست. سازمان باید بداند توقف کدام سامانهها بیشترین تأثیر را بر فعالیتهای اصلی خواهد داشت.
در مرحله بعد باید برای هر سرویس RTO و RPO مشخص شود. این دو شاخص مبنای بسیاری از تصمیمات فنی در طراحی معماری Disaster Recovery هستند.
پس از آن لازم است سناریوهای محتمل مانند قطع برق، خرابی تجهیزات، از دسترس خارج شدن شبکه، خطای انسانی، خرابی Storage یا عدم دسترسی به سایت اصلی بررسی شوند.
معماری پشتیبانگیری، Replication و زیرساخت جایگزین نیز باید متناسب با این سناریوها طراحی شود.
در نهایت، برنامه DR باید مستندسازی، آزمایش و بهصورت دورهای بازبینی شود. تغییرات در زیرساخت، سامانهها و نیازهای کسبوکار میتواند باعث شود یک برنامه قدیمی دیگر پاسخگوی شرایط واقعی سازمان نباشد.
کاربردهای Disaster Recovery
Disaster Recovery محدود به سازمانهای بسیار بزرگ نیست. هر مجموعهای که توقف سرویسهای فناوری اطلاعات برای آن هزینه عملیاتی یا ریسک قابلتوجه ایجاد کند، باید سطح مناسبی از برنامه بازیابی پس از بحران داشته باشد.
بانکها و مؤسسات مالی، شرکتهای صنعتی، اپراتورها، مراکز خدماتی، سازمانهای دولتی، مجموعههای دارای سرویسهای آنلاین و کسبوکارهایی که به دیتاسنتر اختصاصی یا زیرساخت پردازشی حیاتی وابسته هستند، از جمله نمونههای رایج محسوب میشوند.
عمق و پیچیدگی راهکار باید متناسب با اهمیت سرویسها و سطح ریسک هر سازمان تعیین شود.
نقش خدمات مرکز داده در آمادگی برای Disaster Recovery
طراحی یک راهکار DR مؤثر فقط به تهیه Backup محدود نمیشود. معماری مرکز داده، شبکه، برق، ذخیرهسازی، ظرفیت پردازشی، مانیتورینگ و زیرساخت سایت جایگزین همگی بر قابلیت بازیابی سازمان تأثیر دارند.
در این مسیر، خدمات تخصصی مرکز داده میتواند به سازمانها در ارزیابی وضعیت موجود، شناسایی نقاط تکخرابی، بررسی ظرفیت زیرساخت و طراحی سناریوهای بازیابی کمک کند.
اینوتک در حوزه زیرساخت و خدمات مرکز داده میتواند بر اساس شرایط هر سازمان، الزامات فنی و عملیاتی موردنیاز برای افزایش پایداری و آمادگی در برابر اختلال را بررسی کند. پیش از انتخاب هر راهکار نیز باید معماری فعلی، اهمیت سامانهها، سطح دسترسپذیری مورد انتظار و اهداف RTO و RPO مشخص شوند.
جمعبندی
Disaster Recovery یکی از اجزای اصلی مدیریت ریسک زیرساخت فناوری اطلاعات است. هدف آن ایجاد آمادگی برای شرایطی است که دیتاسنتر یا بخشی از زیرساخت سازمان از دسترس خارج میشود و سرویسهای حیاتی باید در مدت مشخصی بازیابی شوند.
یک برنامه مؤثر بازیابی پس از بحران باید بر شناخت سرویسهای حیاتی، تعیین RTO و RPO، طراحی زیرساخت جایگزین، Backup و Replication مناسب، مستندسازی فرآیندها و اجرای آزمونهای دورهای متکی باشد.
هرچه وابستگی کسبوکار به فناوری اطلاعات بیشتر باشد، ضرورت داشتن یک برنامه Disaster Recovery عملیاتی و آزمودهشده نیز افزایش پیدا میکند.
برای ارزیابی آمادگی زیرساخت سازمان در برابر اختلال دیتاسنتر و بررسی راهکارهای Disaster Recovery و تداوم کسبوکار، میتوانید با کارشناسان اینوتک در ارتباط باشید.