درس ۳ از ۱۰

پایش Disk و Storage

در این بخش می‌خواهیم پایش Disk و Storage را به زبان ساده یاد بگیریم؛ به‌جای حفظ کردن چند اصطلاح، می‌بینیم هر بخش چه اثری در سامانه Monitoring دارد، از کجا قابل مشاهده است و وقتی نتیجه غیرعادی بود چه چیزی را باید بررسی کرد این درس بخشی از مدل کاری یک کارشناس پشتیبانی است و هدف آن فقط شناخت یک اصطلاح نیست؛ باید بتوانی موضوع را در یک شرکت واقعی تشخیص بدهی، اثر آن را روی کاربر و سرویس بفهمی، شواهد درست جمع کنی و بدون تغییرهای عجولانه تصمیم بگیری؛ هنگام مطالعه تلاش کن هر مفهوم را به یک مثال از محیط کار، یک نشانه قابل مشاهده و یک روش بررسی امن وصل کنی

این درس برای مطالعه کامل نوشته شده است

با حوصله بخوان، مثال‌ها را تحلیل کن و تمرین‌ها را انجام بده؛ هدف حفظ کردن تعریف‌ها نیست

Free Space قبل از پر شدن Alert دهد

هشدار پیامی است که سامانه پایش پس از برآورده شدن یک شرط مهم تولید می‌کند؛ هشدار خوب مشخص می‌کند چه چیزی، کجا و از چه زمانی غیرعادی شده است هشدار زیاد و بی‌ارزش باعث می‌شود هشدار واقعی نادیده گرفته شود پایش مؤثر فقط جمع کردن عدد و Log نیست؛ باید وضعیت عادی سرویس شناخته شود، Metricهای معنادار انتخاب شوند و Alert زمانی ایجاد شود که نیاز به اقدام دارد؛ Syslog چارچوبی برای انتقال پیام‌های رویداد ارائه می‌دهد و SNMP برای مشاهده و مدیریت بسیاری از تجهیزات شبکه استفاده می‌شود؛ همگام بودن زمان سیستم‌ها برای ارتباط دادن رویدادهای چند دستگاه ضروری است و Log باید در کنار وضعیت سرویس و تغییرات همان بازه تحلیل شود برای عیب‌یابی درست، این بخش را فقط به‌عنوان یک اصطلاح حفظ نکن و توجه داشته باش که Log زمانی ارزش دارد که Timestamp درست، منبع مشخص و Context کافی داشته باشد؛ جمع‌آوری متمرکز کمک می‌کند رخدادهای چند Server و Network Device در یک Timeline دیده شوند؛ Retention نیز باید با نیاز عملیاتی و سیاست امنیتی هماهنگ باشد و Alert باید به اقدام مشخص منتهی شود نه فقط افزایش تعداد پیام‌ها

Disk Latency روی نرم‌افزار اثر دارد

Latency زمان پاسخ یک عملیات است و در Storage یا شبکه مستقیماً روی حس کندی اثر می‌گذارد؛ میانگین، اوج و زمان رخداد را مقایسه کن Bandwidth بالا مشکل Latency را لزوماً حل نمی‌کند پایش مؤثر فقط جمع کردن عدد و Log نیست؛ باید وضعیت عادی سرویس شناخته شود، Metricهای معنادار انتخاب شوند و Alert زمانی ایجاد شود که نیاز به اقدام دارد؛ Syslog چارچوبی برای انتقال پیام‌های رویداد ارائه می‌دهد و SNMP برای مشاهده و مدیریت بسیاری از تجهیزات شبکه استفاده می‌شود؛ همگام بودن زمان سیستم‌ها برای ارتباط دادن رویدادهای چند دستگاه ضروری است و Log باید در کنار وضعیت سرویس و تغییرات همان بازه تحلیل شود برای عیب‌یابی درست، این بخش را فقط به‌عنوان یک اصطلاح حفظ نکن و توجه داشته باش که Monitoring باید از سؤال «چه چیزی برای سرویس مهم است» شروع شود؛ Availability، Latency، Error Rate، Capacity و رخدادهای امنیتی نمونه‌هایی از شاخص‌هایی هستند که بسته به سرویس معنا پیدا می‌کنند؛ Threshold بدون Baseline می‌تواند Alert زیاد و بی‌ارزش تولید کند، بنابراین رفتار عادی و ساعات اوج باید شناخته شود

IOPS و صف با Workload سنجیده شوند

صف صف انتظار Packet یا عملیات است و وقتی منبع از نرخ ورود کندتر باشد رشد می‌کند؛ در شبکه یا Storage، صف طولانی همراه با Latency بالا می‌تواند نشانه فشار باشد وجود صف کوتاه طبیعی است؛ روند و اثر روی سرویس مهم است IOPS تعداد عملیات ورودی/خروجی در ثانیه است و برای Workloadهای کوچک و تصادفی مهم می‌شود؛ IOPS را همراه Latency و نوع IO بخوان عدد بالاتر همیشه به معنی تجربه بهتر نیست اگر Latency زیاد باشد پایش مؤثر فقط جمع کردن عدد و Log نیست؛ باید وضعیت عادی سرویس شناخته شود، Metricهای معنادار انتخاب شوند و Alert زمانی ایجاد شود که نیاز به اقدام دارد؛ Syslog چارچوبی برای انتقال پیام‌های رویداد ارائه می‌دهد و SNMP برای مشاهده و مدیریت بسیاری از تجهیزات شبکه استفاده می‌شود؛ همگام بودن زمان سیستم‌ها برای ارتباط دادن رویدادهای چند دستگاه ضروری است و Log باید در کنار وضعیت سرویس و تغییرات همان بازه تحلیل شود برای عیب‌یابی درست، این بخش را فقط به‌عنوان یک اصطلاح حفظ نکن و توجه داشته باش که Log زمانی ارزش دارد که Timestamp درست، منبع مشخص و Context کافی داشته باشد؛ جمع‌آوری متمرکز کمک می‌کند رخدادهای چند Server و Network Device در یک Timeline دیده شوند؛ Retention نیز باید با نیاز عملیاتی و سیاست امنیتی هماهنگ باشد و Alert باید به اقدام مشخص منتهی شود نه فقط افزایش تعداد پیام‌ها

SMART سرنخ سلامت Disk است

SMART مجموعه‌ای از شاخص‌های سلامت داخل بسیاری از Driveهاست که می‌تواند نشانه‌های خرابی یا فرسودگی را نشان دهد؛ هشدار SMART را جدی بگیر و قبل از تست سنگین از داده مهم نسخه پشتیبان داشته باش SMART تضمین نمی‌کند Drive بدون هشدار خراب نشود پایش مؤثر فقط جمع کردن عدد و Log نیست؛ باید وضعیت عادی سرویس شناخته شود، Metricهای معنادار انتخاب شوند و Alert زمانی ایجاد شود که نیاز به اقدام دارد؛ Syslog چارچوبی برای انتقال پیام‌های رویداد ارائه می‌دهد و SNMP برای مشاهده و مدیریت بسیاری از تجهیزات شبکه استفاده می‌شود؛ همگام بودن زمان سیستم‌ها برای ارتباط دادن رویدادهای چند دستگاه ضروری است و Log باید در کنار وضعیت سرویس و تغییرات همان بازه تحلیل شود نکته‌ای که هنگام پشتیبانی نباید از آن عبور کنی این است که Log زمانی ارزش دارد که Timestamp درست، منبع مشخص و Context کافی داشته باشد؛ جمع‌آوری متمرکز کمک می‌کند رخدادهای چند Server و Network Device در یک Timeline دیده شوند؛ Retention نیز باید با نیاز عملیاتی و سیاست امنیتی هماهنگ باشد و Alert باید به اقدام مشخص منتهی شود نه فقط افزایش تعداد پیام‌ها

رشد Storage برای Capacity Planning مهم است

برنامه‌ریزی ظرفیت از Trend مصرف استفاده می‌کند تا قبل از رسیدن CPU، RAM، Disk یا Bandwidth به نقطه بحرانی زمان ارتقا مشخص شود پایش مؤثر فقط جمع کردن عدد و Log نیست؛ باید وضعیت عادی سرویس شناخته شود، Metricهای معنادار انتخاب شوند و Alert زمانی ایجاد شود که نیاز به اقدام دارد؛ Syslog چارچوبی برای انتقال پیام‌های رویداد ارائه می‌دهد و SNMP برای مشاهده و مدیریت بسیاری از تجهیزات شبکه استفاده می‌شود؛ همگام بودن زمان سیستم‌ها برای ارتباط دادن رویدادهای چند دستگاه ضروری است و Log باید در کنار وضعیت سرویس و تغییرات همان بازه تحلیل شود برای عیب‌یابی درست، این بخش را فقط به‌عنوان یک اصطلاح حفظ نکن و توجه داشته باش که Log زمانی ارزش دارد که Timestamp درست، منبع مشخص و Context کافی داشته باشد؛ جمع‌آوری متمرکز کمک می‌کند رخدادهای چند Server و Network Device در یک Timeline دیده شوند؛ Retention نیز باید با نیاز عملیاتی و سیاست امنیتی هماهنگ باشد و Alert باید به اقدام مشخص منتهی شود نه فقط افزایش تعداد پیام‌ها برای اینکه این مفهوم در محیط واقعی قابل استفاده شود، Monitoring باید از سؤال «چه چیزی برای سرویس مهم است» شروع شود؛ Availability، Latency، Error Rate، Capacity و رخدادهای امنیتی نمونه‌هایی از شاخص‌هایی هستند که بسته به سرویس معنا پیدا می‌کنند؛ Threshold بدون Baseline می‌تواند Alert زیاد و بی‌ارزش تولید کند، بنابراین رفتار عادی و ساعات اوج باید شناخته شود

مثال محیط واقعی

فرض کن در سامانه Monitoring مشکلی گزارش شده و احتمال می‌دهی به پایش Disk و Storage مربوط باشد. قبل از تغییر، وضعیت فعلی را با Dashboard پایش، Syslog/Event Viewer و SNMP بررسی می‌کنی و نتیجه را با یک حالت سالم یا مستند معتبر مقایسه می‌کنی. اگر شواهد فرضیه را تأیید کردند، فقط همان بخش مرتبط را تغییر می‌دهی و بعد همان تست را دوباره اجرا می‌کنی تا مطمئن شوی مشکل واقعاً برطرف شده است

اشتباهات رایج

این اشتباه‌ها را تکرار نکن

  • هشدار پیامی است که سامانه پایش پس از برآورده شدن یک شرط مهم تولید می‌کند؛ هشدار خوب مشخص می‌کند چه چیزی، کجا و از چه زمانی غیرعادی شده است
  • هشدار زیاد و بی‌ارزش باعث می‌شود هشدار واقعی نادیده گرفته شود
  • تغییر دادن تنظیمات مرتبط با پایش Disk و Storage قبل از اینکه مطمئن شوی مشکل واقعاً به همین بخش مربوط است
تمرین عملی

حالا خودت انجام بده

  1. در یک نمونه آزمایشی مرتبط با پایش Disk و Storage، فقط وضعیت فعلی را مشاهده کن و سه نکته‌ای را که برای تشخیص حالت سالم مهم‌اند یادداشت کن
  2. با Dashboard پایش، Syslog/Event Viewer و SNMP وضعیت مرتبط با پایش Disk و Storage را بدون تغییر بررسی کن، سه داده واقعی جمع کن و توضیح بده هرکدام چه چیزی به تو می‌گویند
  3. یک خطای فرضی مرتبط با پایش Disk و Storage بنویس و مشخص کن اولین تست کم‌خطر تو چیست و چه نتیجه‌ای فرضیه‌ات را رد می‌کند

نکته‌هایی که باید با خودت ببری

  • Free Space قبل از پر شدن Alert دهد
  • Disk Latency روی نرم‌افزار اثر دارد
  • IOPS و صف با Workload سنجیده شوند
  • SMART سرنخ سلامت Disk است
  • رشد Storage برای Capacity Planning مهم است
  • هشدارها را طوری تنظیم کن که معنی‌دار باشند و تیم را با Alert بی‌ارزش خسته نکنند
خودسنجی

قبل از رفتن به درس بعد، جواب را برای خودت توضیح بده

این نکته را با یک مثال توضیح بده: Free Space قبل از پر شدن Alert دهد. بعد بگو در عمل چطور آن را بررسی می‌کنی.

هشدار پیامی است که سامانه پایش پس از برآورده شدن یک شرط مهم تولید می‌کند؛ هشدار خوب مشخص می‌کند چه چیزی، کجا و از چه زمانی غیرعادی شده است

این نکته را با یک مثال توضیح بده: Disk Latency روی نرم‌افزار اثر دارد. بعد بگو در عمل چطور آن را بررسی می‌کنی.

Latency زمان پاسخ یک عملیات است و در Storage یا شبکه مستقیماً روی حس کندی اثر می‌گذارد؛ میانگین، اوج و زمان رخداد را مقایسه کن

این نکته را با یک مثال توضیح بده: IOPS و صف با Workload سنجیده شوند. بعد بگو در عمل چطور آن را بررسی می‌کنی.

صف صف انتظار Packet یا عملیات است و وقتی منبع از نرخ ورود کندتر باشد رشد می‌کند؛ در شبکه یا Storage، صف طولانی همراه با Latency بالا می‌تواند نشانه فشار باشد

مطالعه درس همیشه عمومی است

برای ذخیره پیشرفت، دوره را رسمی شروع کن

با ثبت‌نام، تکمیل درس‌ها و نمره آزمون روی حساب ذخیره می‌شود

ثبت‌نام و شروع رسمی