با حوصله بخوان، مثالها را تحلیل کن و تمرینها را انجام بده؛ هدف حفظ کردن تعریفها نیست
خرابی Job را علت اصلی کن
علت اصلی، علت زیربنایی است که با حذف یا کنترل آن احتمال تکرار رخداد کم میشود؛ نشانه رفعشده را با علت اصلی یکی ندان گاهی چند علت و عامل کمککننده وجود دارد Backup زمانی ارزش عملی دارد که بازیابی آن قابل انجام و آزموده شده باشد؛ RPO مشخص میکند چه مقدار از داده از نظر زمانی میتواند از دست برود و RTO مدت قابل قبول برای بازگرداندن سرویس را بیان میکند؛ برنامه Backup باید با این دو هدف، اهمیت سرویس، محل نگهداری نسخهها و تهدیدهایی مانند خرابی، خطای انسانی و باجافزار هماهنگ شود؛ آزمون Restore، ثبت نتیجه و نگهداری نسخهای جدا یا محافظتشده بخش مهم اطمینان از قابلیت بازیابی است اگر بخواهی این بخش را از حالت تعریف به مهارت عملی تبدیل کنی، وقتی چند مشکل همزمان ارائه میشوند، اولویت را بر اساس اثر کسبوکار، امنیت و گستره خرابی تعیین کن؛ سپس کار را به واحدهای قابل کنترل تقسیم کن؛ پس از رفع هر مورد، Validation و Closure انجام بده و اگر Fix موقت است آن را صریح ثبت کن تا بهعنوان حل دائمی فراموش نشود
RPO و Retention را بررسی کن
Retention مشخص میکند نسخههای Backup چه مدت نگه داشته شوند؛ نیاز کسبوکار، قانون و ظرفیت Storage را در نظر بگیر Retention کوتاه ممکن است خرابی دیرکشفشده را بدون نسخه سالم باقی بگذارد RPO بیشترین بازه زمانی دادهای است که کسبوکار قبول میکند در حادثه از دست برود؛ اگر RPO یک ساعت است Backup روزانه کافی نیست RPO درباره مقدار از دست رفتن داده است نه زمان بازگشت سرویس Backup زمانی ارزش عملی دارد که بازیابی آن قابل انجام و آزموده شده باشد؛ RPO مشخص میکند چه مقدار از داده از نظر زمانی میتواند از دست برود و RTO مدت قابل قبول برای بازگرداندن سرویس را بیان میکند؛ برنامه Backup باید با این دو هدف، اهمیت سرویس، محل نگهداری نسخهها و تهدیدهایی مانند خرابی، خطای انسانی و باجافزار هماهنگ شود؛ آزمون Restore، ثبت نتیجه و نگهداری نسخهای جدا یا محافظتشده بخش مهم اطمینان از قابلیت بازیابی است اگر بخواهی این بخش را از حالت تعریف به مهارت عملی تبدیل کنی، در آزمون نهایی باید همان مدل کاری محیط واقعی را بهکار ببری: Asset و Dependency را بشناس، Scope رخداد را محدود کن، Evidence جمع کن، فرضیه بساز، Test کمریسک انجام بده و نتیجه را مستند کن؛ پاسخ درست فقط رسیدن اتفاقی به Fix نیست و باید بتوانی توضیح دهی چرا آن اقدام با شواهد سازگار بود
Restore واقعی اجرا کن
Restore عمل بازگرداندن داده یا سیستم از Backup است و تنها راه اثبات قابل استفاده بودن Backup است؛ بهصورت دورهای Restore آزمایشی با سناریوی واقعی انجام بده صرف دیدن وضعیت موفق Job تضمین بازیابی نیست Backup زمانی ارزش عملی دارد که بازیابی آن قابل انجام و آزموده شده باشد؛ RPO مشخص میکند چه مقدار از داده از نظر زمانی میتواند از دست برود و RTO مدت قابل قبول برای بازگرداندن سرویس را بیان میکند؛ برنامه Backup باید با این دو هدف، اهمیت سرویس، محل نگهداری نسخهها و تهدیدهایی مانند خرابی، خطای انسانی و باجافزار هماهنگ شود؛ آزمون Restore، ثبت نتیجه و نگهداری نسخهای جدا یا محافظتشده بخش مهم اطمینان از قابلیت بازیابی است نکتهای که هنگام پشتیبانی نباید از آن عبور کنی این است که در آزمون نهایی باید همان مدل کاری محیط واقعی را بهکار ببری: Asset و Dependency را بشناس، Scope رخداد را محدود کن، Evidence جمع کن، فرضیه بساز، Test کمریسک انجام بده و نتیجه را مستند کن؛ پاسخ درست فقط رسیدن اتفاقی به Fix نیست و باید بتوانی توضیح دهی چرا آن اقدام با شواهد سازگار بود
زمان Restore را اندازه بگیر
Restore عمل بازگرداندن داده یا سیستم از Backup است و تنها راه اثبات قابل استفاده بودن Backup است؛ بهصورت دورهای Restore آزمایشی با سناریوی واقعی انجام بده Backup زمانی ارزش عملی دارد که بازیابی آن قابل انجام و آزموده شده باشد؛ RPO مشخص میکند چه مقدار از داده از نظر زمانی میتواند از دست برود و RTO مدت قابل قبول برای بازگرداندن سرویس را بیان میکند؛ برنامه Backup باید با این دو هدف، اهمیت سرویس، محل نگهداری نسخهها و تهدیدهایی مانند خرابی، خطای انسانی و باجافزار هماهنگ شود؛ آزمون Restore، ثبت نتیجه و نگهداری نسخهای جدا یا محافظتشده بخش مهم اطمینان از قابلیت بازیابی است برای اینکه این مفهوم در محیط واقعی قابل استفاده شود، وقتی چند مشکل همزمان ارائه میشوند، اولویت را بر اساس اثر کسبوکار، امنیت و گستره خرابی تعیین کن؛ سپس کار را به واحدهای قابل کنترل تقسیم کن؛ پس از رفع هر مورد، Validation و Closure انجام بده و اگر Fix موقت است آن را صریح ثبت کن تا بهعنوان حل دائمی فراموش نشود برای اینکه این مفهوم در محیط واقعی قابل استفاده شود، در آزمون نهایی باید همان مدل کاری محیط واقعی را بهکار ببری: Asset و Dependency را بشناس، Scope رخداد را محدود کن، Evidence جمع کن، فرضیه بساز، Test کمریسک انجام بده و نتیجه را مستند کن؛ پاسخ درست فقط رسیدن اتفاقی به Fix نیست و باید بتوانی توضیح دهی چرا آن اقدام با شواهد سازگار بود
قابل بازیابی بودن Backup را ثابت کن
Backup نسخهای جدا از داده اصلی برای بازیابی بعد از حذف، خرابی یا حادثه است؛ موفقیت Job، محل نگهداری، Retention و Test Restore را با هم ببین کپی روی همان Storage اصلی در برابر خرابی همان Storage محافظت کافی نمیدهد Backup زمانی ارزش عملی دارد که بازیابی آن قابل انجام و آزموده شده باشد؛ RPO مشخص میکند چه مقدار از داده از نظر زمانی میتواند از دست برود و RTO مدت قابل قبول برای بازگرداندن سرویس را بیان میکند؛ برنامه Backup باید با این دو هدف، اهمیت سرویس، محل نگهداری نسخهها و تهدیدهایی مانند خرابی، خطای انسانی و باجافزار هماهنگ شود؛ آزمون Restore، ثبت نتیجه و نگهداری نسخهای جدا یا محافظتشده بخش مهم اطمینان از قابلیت بازیابی است در کار روزمره بهتر است این موضوع را اینطور بررسی کنی: وقتی چند مشکل همزمان ارائه میشوند، اولویت را بر اساس اثر کسبوکار، امنیت و گستره خرابی تعیین کن؛ سپس کار را به واحدهای قابل کنترل تقسیم کن؛ پس از رفع هر مورد، Validation و Closure انجام بده و اگر Fix موقت است آن را صریح ثبت کن تا بهعنوان حل دائمی فراموش نشود
فرض کن در شرکت مجازی آزمون نهایی مشکلی گزارش شده و احتمال میدهی به بخش عملی Backup و Restore مربوط باشد. قبل از تغییر، وضعیت فعلی را با ابزارها و روشهای کل دوره بررسی میکنی و نتیجه را با یک حالت سالم یا مستند معتبر مقایسه میکنی. اگر شواهد فرضیه را تأیید کردند، فقط همان بخش مرتبط را تغییر میدهی و بعد همان تست را دوباره اجرا میکنی تا مطمئن شوی مشکل واقعاً برطرف شده است
این اشتباهها را تکرار نکن
- RPO بیشترین بازه زمانی دادهای است که کسبوکار قبول میکند در حادثه از دست برود؛ اگر RPO یک ساعت است Backup روزانه کافی نیست
- تغییر دادن تنظیمات مرتبط با بخش عملی Backup و Restore قبل از اینکه مطمئن شوی مشکل واقعاً به همین بخش مربوط است
- نتیجهگیری درباره بخش عملی Backup و Restore فقط از روی یک نشانه و بدون انجام تست نهایی
حالا خودت انجام بده
- در یک نمونه آزمایشی مرتبط با بخش عملی Backup و Restore، فقط وضعیت فعلی را مشاهده کن و سه نکتهای را که برای تشخیص حالت سالم مهماند یادداشت کن
- با ابزارها و روشهای کل دوره وضعیت مرتبط با بخش عملی Backup و Restore را بدون تغییر بررسی کن، سه داده واقعی جمع کن و توضیح بده هرکدام چه چیزی به تو میگویند
- یک خطای فرضی مرتبط با بخش عملی Backup و Restore بنویس و مشخص کن اولین تست کمخطر تو چیست و چه نتیجهای فرضیهات را رد میکند
نکتههایی که باید با خودت ببری
- خرابی Job را علت اصلی کن
- RPO و Retention را بررسی کن
- Restore واقعی اجرا کن
- زمان Restore را اندازه بگیر
- قابل بازیابی بودن Backup را ثابت کن
- هیچ اقدام پرریسک بدون شواهد، Backup یا روش بازگشت قابل قبول نیست
قبل از رفتن به درس بعد، جواب را برای خودت توضیح بده
چرا باید خرابی Job را علت اصلی کنی و از کجا میفهمی نتیجه درست است؟
علت اصلی، علت زیربنایی است که با حذف یا کنترل آن احتمال تکرار رخداد کم میشود؛ نشانه رفعشده را با علت اصلی یکی ندان
چرا باید RPO و Retention را بررسی کنی و از کجا میفهمی نتیجه درست است؟
RPO بیشترین بازه زمانی دادهای است که کسبوکار قبول میکند در حادثه از دست برود؛ اگر RPO یک ساعت است Backup روزانه کافی نیست
چرا باید Restore واقعی اجرا کنی و از کجا میفهمی نتیجه درست است؟
Restore عمل بازگرداندن داده یا سیستم از Backup است و تنها راه اثبات قابل استفاده بودن Backup است؛ بهصورت دورهای Restore آزمایشی با سناریوی واقعی انجام بده
برای ذخیره پیشرفت، دوره را رسمی شروع کن
با ثبتنام، تکمیل درسها و نمره آزمون روی حساب ذخیره میشود