مطالعه شده

Disaster Recovery چیست؟

Disaster Recovery مجموعه‌ای از راهکارها و فرآیندهای برنامه‌ریزی‌شده برای بازیابی سرویس‌های حیاتی فناوری اطلاعات پس از اختلال دیتاسنتر است که به کاهش زمان توقف، حفاظت از داده‌ها و حفظ تداوم کسب‌وکار سازمان کمک می‌کند.

اختلال در دیتاسنتر می‌تواند دسترسی به سامانه‌های حیاتی، داده‌ها و سرویس‌های سازمان را با مشکل مواجه کند. Disaster Recovery یا «بازیابی پس از بحران» مجموعه‌ای از برنامه‌ها، فرآیندها و زیرساخت‌هایی است که به سازمان کمک می‌کند پس از وقوع یک اختلال جدی، سرویس‌های فناوری اطلاعات را در زمان قابل‌قبولی بازیابی کند. در این مقاله بررسی می‌کنیم Disaster Recovery چیست، چه ارتباطی با تداوم کسب‌وکار دارد و سازمان‌ها برای آمادگی در برابر اختلال دیتاسنتر باید چه اقداماتی انجام دهند.

 

مقدمه

امروزه بسیاری از فرآیندهای عملیاتی سازمان‌ها به زیرساخت فناوری اطلاعات وابسته هستند. توقف یک سرور، قطع ارتباطات شبکه، خرابی تجهیزات، اختلال در برق، خطای انسانی یا یک حادثه گسترده‌تر می‌تواند باعث شود بخشی از خدمات سازمان برای مدتی در دسترس نباشد.

در چنین شرایطی، داشتن نسخه پشتیبان به‌تنهایی کافی نیست. سازمان باید از قبل مشخص کرده باشد چه سرویس‌هایی باید زودتر بازیابی شوند، اطلاعات از چه نقطه‌ای قابل بازگردانی هستند، زیرساخت جایگزین کجاست و چه تیم‌هایی مسئول اجرای فرآیند بازیابی خواهند بود.

به همین دلیل Disaster Recovery باید بخشی از برنامه مدیریت ریسک و تداوم فعالیت سازمان باشد، نه اقدامی که بعد از وقوع بحران به آن فکر شود.

 

Disaster Recovery چیست؟

Disaster Recovery یا DR به مجموعه سیاست‌ها، فرآیندها، فناوری‌ها و زیرساخت‌هایی گفته می‌شود که برای بازیابی سرویس‌های فناوری اطلاعات پس از یک اختلال جدی طراحی می‌شوند.

هدف اصلی DR این نیست که وقوع تمام حوادث را متوقف کند؛ بلکه هدف آن کاهش زمان توقف سرویس‌ها و محدود کردن میزان از دست رفتن داده‌ها در صورت بروز حادثه است.

در یک برنامه بازیابی پس از بحران معمولاً موضوعاتی مانند پشتیبان‌گیری از داده‌ها، Replication، زیرساخت جایگزین، اولویت‌بندی سامانه‌ها، ارتباطات اضطراری، مسئولیت تیم‌ها و روش بازگرداندن سرویس‌ها مشخص می‌شود.

 

ارتباط Disaster Recovery با Business Continuity چیست؟

Business Continuity Management یا BCM مفهوم گسترده‌تری نسبت به Disaster Recovery دارد. BCM بر ادامه فعالیت‌های حیاتی کسب‌وکار در شرایط بحران تمرکز می‌کند، در حالی که DR بیشتر بر بازیابی زیرساخت و سرویس‌های فناوری اطلاعات متمرکز است.

برای مثال، در یک اختلال دیتاسنتر ممکن است DR مشخص کند سامانه مالی چگونه روی زیرساخت جایگزین راه‌اندازی شود. در مقابل، برنامه تداوم کسب‌وکار مشخص می‌کند واحد مالی تا زمان بازیابی کامل سامانه‌ها چگونه فعالیت خود را ادامه دهد.

بنابراین یک سازمان بالغ باید DR و BCM را در کنار یکدیگر ببیند.

 

در یک نگاه

 

حوزه: زیرساخت فناوری اطلاعات و خدمات مرکز داده
مخاطب: مدیران فناوری اطلاعات، مدیران زیرساخت و مدیران سازمان
مسئله اصلی: توقف سرویس‌های حیاتی در اثر اختلال دیتاسنتر
راهکار: طراحی و اجرای برنامه Disaster Recovery و تداوم کسب‌وکار
مزیت اصلی: کاهش زمان توقف و افزایش آمادگی سازمان در برابر بحران

 

چرا Disaster Recovery برای سازمان‌ها اهمیت دارد؟

وابستگی سازمان‌ها به سرویس‌های دیجیتال باعث شده است اختلال زیرساخت فناوری اطلاعات مستقیماً بر عملیات کسب‌وکار تأثیر بگذارد.

قطع دسترسی به پایگاه داده، سامانه‌های داخلی، سرویس‌های ارتباطی یا برنامه‌های عملیاتی می‌تواند بخشی از فعالیت سازمان را متوقف کند. هرچه سرویس موردنظر حیاتی‌تر باشد، مدت زمان قابل‌تحمل برای توقف آن نیز کمتر خواهد بود.

برنامه Disaster Recovery به سازمان کمک می‌کند پیش از وقوع حادثه، سناریوهای احتمالی را بررسی کرده و برای بازیابی سرویس‌های حیاتی تصمیم‌گیری کند.

 

 

مزایا و دلایل طراحی برنامه Disaster Recovery

 

 

کاهش زمان توقف سرویس‌ها

یکی از مهم‌ترین اهداف DR کاهش Downtime است.

زمانی که فرآیند بازیابی، زیرساخت جایگزین و مسئولیت تیم‌ها از قبل مشخص شده باشند، سازمان در زمان بحران مجبور نیست تصمیم‌های اصلی را از ابتدا اتخاذ کند. این موضوع سرعت واکنش عملیاتی را افزایش می‌دهد.

 

کاهش ریسک از دست رفتن داده‌ها

در برنامه Disaster Recovery باید مشخص شود سازمان چه مقدار از داده‌های اخیر را می‌تواند از دست بدهد.

این موضوع معمولاً با شاخص RPO یا Recovery Point Objective تعریف می‌شود. بر اساس این شاخص می‌توان سیاست Backup و Replication مناسب‌تری برای سامانه‌های مختلف طراحی کرد.

 

تعیین زمان قابل‌قبول بازیابی

همه سامانه‌ها اهمیت یکسانی ندارند.

شاخص RTO یا Recovery Time Objective مشخص می‌کند هر سرویس باید حداکثر در چه مدت زمانی پس از اختلال بازیابی شود. برای مثال ممکن است یک سامانه عملیاتی نیازمند بازیابی سریع باشد، در حالی که بازیابی یک سرویس جانبی بتواند با تأخیر بیشتری انجام شود.

 

ایجاد زیرساخت جایگزین

یکی از اجزای مهم DR پیش‌بینی محیطی برای ادامه یا بازیابی سرویس‌هاست.

این زیرساخت بسته به نیاز سازمان می‌تواند شامل سایت پشتیبان، منابع پردازشی جایگزین، تجهیزات شبکه، فضای ذخیره‌سازی یا سایر زیرساخت‌های موردنیاز باشد.

انتخاب معماری مناسب باید بر اساس اهمیت سرویس‌ها، RTO، RPO، بودجه و سطح ریسک سازمان انجام شود.

 

کاهش وابستگی به تصمیم‌گیری لحظه‌ای

در زمان بحران، فشار عملیاتی بالا است و احتمال خطا در تصمیم‌گیری افزایش پیدا می‌کند.

Runbookها، سناریوهای بازیابی، فهرست مسئولیت‌ها و روش‌های Escalation کمک می‌کنند تیم فنی بر اساس یک فرآیند مشخص عمل کند.

 

امکان ارزیابی واقعی میزان آمادگی

داشتن مستندات DR به معنی آماده بودن سازمان نیست.

برنامه بازیابی باید به‌صورت دوره‌ای آزمایش شود. تست‌های فنی، Failover، بازیابی Backup و شبیه‌سازی سناریوهای اختلال می‌توانند نقاط ضعف برنامه را قبل از وقوع حادثه واقعی آشکار کنند.

 

 

سازمان چگونه برای اختلال دیتاسنتر آماده شود؟

اولین اقدام، شناسایی سرویس‌های حیاتی و وابستگی میان آن‌هاست. سازمان باید بداند توقف کدام سامانه‌ها بیشترین تأثیر را بر فعالیت‌های اصلی خواهد داشت.

در مرحله بعد باید برای هر سرویس RTO و RPO مشخص شود. این دو شاخص مبنای بسیاری از تصمیمات فنی در طراحی معماری Disaster Recovery هستند.

پس از آن لازم است سناریوهای محتمل مانند قطع برق، خرابی تجهیزات، از دسترس خارج شدن شبکه، خطای انسانی، خرابی Storage یا عدم دسترسی به سایت اصلی بررسی شوند.

معماری پشتیبان‌گیری، Replication و زیرساخت جایگزین نیز باید متناسب با این سناریوها طراحی شود.

در نهایت، برنامه DR باید مستندسازی، آزمایش و به‌صورت دوره‌ای بازبینی شود. تغییرات در زیرساخت، سامانه‌ها و نیازهای کسب‌وکار می‌تواند باعث شود یک برنامه قدیمی دیگر پاسخ‌گوی شرایط واقعی سازمان نباشد.

 

کاربردهای Disaster Recovery

Disaster Recovery محدود به سازمان‌های بسیار بزرگ نیست. هر مجموعه‌ای که توقف سرویس‌های فناوری اطلاعات برای آن هزینه عملیاتی یا ریسک قابل‌توجه ایجاد کند، باید سطح مناسبی از برنامه بازیابی پس از بحران داشته باشد.

بانک‌ها و مؤسسات مالی، شرکت‌های صنعتی، اپراتورها، مراکز خدماتی، سازمان‌های دولتی، مجموعه‌های دارای سرویس‌های آنلاین و کسب‌وکارهایی که به دیتاسنتر اختصاصی یا زیرساخت پردازشی حیاتی وابسته هستند، از جمله نمونه‌های رایج محسوب می‌شوند.

عمق و پیچیدگی راهکار باید متناسب با اهمیت سرویس‌ها و سطح ریسک هر سازمان تعیین شود.

 

نقش خدمات مرکز داده در آمادگی برای Disaster Recovery

طراحی یک راهکار DR مؤثر فقط به تهیه Backup محدود نمی‌شود. معماری مرکز داده، شبکه، برق، ذخیره‌سازی، ظرفیت پردازشی، مانیتورینگ و زیرساخت سایت جایگزین همگی بر قابلیت بازیابی سازمان تأثیر دارند.

در این مسیر، خدمات تخصصی مرکز داده می‌تواند به سازمان‌ها در ارزیابی وضعیت موجود، شناسایی نقاط تک‌خرابی، بررسی ظرفیت زیرساخت و طراحی سناریوهای بازیابی کمک کند.

اینوتک در حوزه زیرساخت و خدمات مرکز داده می‌تواند بر اساس شرایط هر سازمان، الزامات فنی و عملیاتی موردنیاز برای افزایش پایداری و آمادگی در برابر اختلال را بررسی کند. پیش از انتخاب هر راهکار نیز باید معماری فعلی، اهمیت سامانه‌ها، سطح دسترس‌پذیری مورد انتظار و اهداف RTO و RPO مشخص شوند.

 

جمع‌بندی

Disaster Recovery یکی از اجزای اصلی مدیریت ریسک زیرساخت فناوری اطلاعات است. هدف آن ایجاد آمادگی برای شرایطی است که دیتاسنتر یا بخشی از زیرساخت سازمان از دسترس خارج می‌شود و سرویس‌های حیاتی باید در مدت مشخصی بازیابی شوند.

یک برنامه مؤثر بازیابی پس از بحران باید بر شناخت سرویس‌های حیاتی، تعیین RTO و RPO، طراحی زیرساخت جایگزین، Backup و Replication مناسب، مستندسازی فرآیندها و اجرای آزمون‌های دوره‌ای متکی باشد.

هرچه وابستگی کسب‌وکار به فناوری اطلاعات بیشتر باشد، ضرورت داشتن یک برنامه Disaster Recovery عملیاتی و آزموده‌شده نیز افزایش پیدا می‌کند.

 

برای ارزیابی آمادگی زیرساخت سازمان در برابر اختلال دیتاسنتر و بررسی راهکارهای Disaster Recovery و تداوم کسب‌وکار، می‌توانید با کارشناسان اینوتک در ارتباط باشید.

آخرین مقالات

راه‌های ارتباطی
به بالا بروید