با حوصله بخوان، مثالها را تحلیل کن و تمرینها را انجام بده؛ هدف حفظ کردن تعریفها نیست
Free Space قبل از پر شدن Alert دهد
هشدار پیامی است که سامانه پایش پس از برآورده شدن یک شرط مهم تولید میکند؛ هشدار خوب مشخص میکند چه چیزی، کجا و از چه زمانی غیرعادی شده است هشدار زیاد و بیارزش باعث میشود هشدار واقعی نادیده گرفته شود پایش مؤثر فقط جمع کردن عدد و Log نیست؛ باید وضعیت عادی سرویس شناخته شود، Metricهای معنادار انتخاب شوند و Alert زمانی ایجاد شود که نیاز به اقدام دارد؛ Syslog چارچوبی برای انتقال پیامهای رویداد ارائه میدهد و SNMP برای مشاهده و مدیریت بسیاری از تجهیزات شبکه استفاده میشود؛ همگام بودن زمان سیستمها برای ارتباط دادن رویدادهای چند دستگاه ضروری است و Log باید در کنار وضعیت سرویس و تغییرات همان بازه تحلیل شود برای عیبیابی درست، این بخش را فقط بهعنوان یک اصطلاح حفظ نکن و توجه داشته باش که Log زمانی ارزش دارد که Timestamp درست، منبع مشخص و Context کافی داشته باشد؛ جمعآوری متمرکز کمک میکند رخدادهای چند Server و Network Device در یک Timeline دیده شوند؛ Retention نیز باید با نیاز عملیاتی و سیاست امنیتی هماهنگ باشد و Alert باید به اقدام مشخص منتهی شود نه فقط افزایش تعداد پیامها
Disk Latency روی نرمافزار اثر دارد
Latency زمان پاسخ یک عملیات است و در Storage یا شبکه مستقیماً روی حس کندی اثر میگذارد؛ میانگین، اوج و زمان رخداد را مقایسه کن Bandwidth بالا مشکل Latency را لزوماً حل نمیکند پایش مؤثر فقط جمع کردن عدد و Log نیست؛ باید وضعیت عادی سرویس شناخته شود، Metricهای معنادار انتخاب شوند و Alert زمانی ایجاد شود که نیاز به اقدام دارد؛ Syslog چارچوبی برای انتقال پیامهای رویداد ارائه میدهد و SNMP برای مشاهده و مدیریت بسیاری از تجهیزات شبکه استفاده میشود؛ همگام بودن زمان سیستمها برای ارتباط دادن رویدادهای چند دستگاه ضروری است و Log باید در کنار وضعیت سرویس و تغییرات همان بازه تحلیل شود برای عیبیابی درست، این بخش را فقط بهعنوان یک اصطلاح حفظ نکن و توجه داشته باش که Monitoring باید از سؤال «چه چیزی برای سرویس مهم است» شروع شود؛ Availability، Latency، Error Rate، Capacity و رخدادهای امنیتی نمونههایی از شاخصهایی هستند که بسته به سرویس معنا پیدا میکنند؛ Threshold بدون Baseline میتواند Alert زیاد و بیارزش تولید کند، بنابراین رفتار عادی و ساعات اوج باید شناخته شود
IOPS و صف با Workload سنجیده شوند
صف صف انتظار Packet یا عملیات است و وقتی منبع از نرخ ورود کندتر باشد رشد میکند؛ در شبکه یا Storage، صف طولانی همراه با Latency بالا میتواند نشانه فشار باشد وجود صف کوتاه طبیعی است؛ روند و اثر روی سرویس مهم است IOPS تعداد عملیات ورودی/خروجی در ثانیه است و برای Workloadهای کوچک و تصادفی مهم میشود؛ IOPS را همراه Latency و نوع IO بخوان عدد بالاتر همیشه به معنی تجربه بهتر نیست اگر Latency زیاد باشد پایش مؤثر فقط جمع کردن عدد و Log نیست؛ باید وضعیت عادی سرویس شناخته شود، Metricهای معنادار انتخاب شوند و Alert زمانی ایجاد شود که نیاز به اقدام دارد؛ Syslog چارچوبی برای انتقال پیامهای رویداد ارائه میدهد و SNMP برای مشاهده و مدیریت بسیاری از تجهیزات شبکه استفاده میشود؛ همگام بودن زمان سیستمها برای ارتباط دادن رویدادهای چند دستگاه ضروری است و Log باید در کنار وضعیت سرویس و تغییرات همان بازه تحلیل شود برای عیبیابی درست، این بخش را فقط بهعنوان یک اصطلاح حفظ نکن و توجه داشته باش که Log زمانی ارزش دارد که Timestamp درست، منبع مشخص و Context کافی داشته باشد؛ جمعآوری متمرکز کمک میکند رخدادهای چند Server و Network Device در یک Timeline دیده شوند؛ Retention نیز باید با نیاز عملیاتی و سیاست امنیتی هماهنگ باشد و Alert باید به اقدام مشخص منتهی شود نه فقط افزایش تعداد پیامها
SMART سرنخ سلامت Disk است
SMART مجموعهای از شاخصهای سلامت داخل بسیاری از Driveهاست که میتواند نشانههای خرابی یا فرسودگی را نشان دهد؛ هشدار SMART را جدی بگیر و قبل از تست سنگین از داده مهم نسخه پشتیبان داشته باش SMART تضمین نمیکند Drive بدون هشدار خراب نشود پایش مؤثر فقط جمع کردن عدد و Log نیست؛ باید وضعیت عادی سرویس شناخته شود، Metricهای معنادار انتخاب شوند و Alert زمانی ایجاد شود که نیاز به اقدام دارد؛ Syslog چارچوبی برای انتقال پیامهای رویداد ارائه میدهد و SNMP برای مشاهده و مدیریت بسیاری از تجهیزات شبکه استفاده میشود؛ همگام بودن زمان سیستمها برای ارتباط دادن رویدادهای چند دستگاه ضروری است و Log باید در کنار وضعیت سرویس و تغییرات همان بازه تحلیل شود نکتهای که هنگام پشتیبانی نباید از آن عبور کنی این است که Log زمانی ارزش دارد که Timestamp درست، منبع مشخص و Context کافی داشته باشد؛ جمعآوری متمرکز کمک میکند رخدادهای چند Server و Network Device در یک Timeline دیده شوند؛ Retention نیز باید با نیاز عملیاتی و سیاست امنیتی هماهنگ باشد و Alert باید به اقدام مشخص منتهی شود نه فقط افزایش تعداد پیامها
رشد Storage برای Capacity Planning مهم است
برنامهریزی ظرفیت از Trend مصرف استفاده میکند تا قبل از رسیدن CPU، RAM، Disk یا Bandwidth به نقطه بحرانی زمان ارتقا مشخص شود پایش مؤثر فقط جمع کردن عدد و Log نیست؛ باید وضعیت عادی سرویس شناخته شود، Metricهای معنادار انتخاب شوند و Alert زمانی ایجاد شود که نیاز به اقدام دارد؛ Syslog چارچوبی برای انتقال پیامهای رویداد ارائه میدهد و SNMP برای مشاهده و مدیریت بسیاری از تجهیزات شبکه استفاده میشود؛ همگام بودن زمان سیستمها برای ارتباط دادن رویدادهای چند دستگاه ضروری است و Log باید در کنار وضعیت سرویس و تغییرات همان بازه تحلیل شود برای عیبیابی درست، این بخش را فقط بهعنوان یک اصطلاح حفظ نکن و توجه داشته باش که Log زمانی ارزش دارد که Timestamp درست، منبع مشخص و Context کافی داشته باشد؛ جمعآوری متمرکز کمک میکند رخدادهای چند Server و Network Device در یک Timeline دیده شوند؛ Retention نیز باید با نیاز عملیاتی و سیاست امنیتی هماهنگ باشد و Alert باید به اقدام مشخص منتهی شود نه فقط افزایش تعداد پیامها برای اینکه این مفهوم در محیط واقعی قابل استفاده شود، Monitoring باید از سؤال «چه چیزی برای سرویس مهم است» شروع شود؛ Availability، Latency، Error Rate، Capacity و رخدادهای امنیتی نمونههایی از شاخصهایی هستند که بسته به سرویس معنا پیدا میکنند؛ Threshold بدون Baseline میتواند Alert زیاد و بیارزش تولید کند، بنابراین رفتار عادی و ساعات اوج باید شناخته شود
فرض کن در سامانه Monitoring مشکلی گزارش شده و احتمال میدهی به پایش Disk و Storage مربوط باشد. قبل از تغییر، وضعیت فعلی را با Dashboard پایش، Syslog/Event Viewer و SNMP بررسی میکنی و نتیجه را با یک حالت سالم یا مستند معتبر مقایسه میکنی. اگر شواهد فرضیه را تأیید کردند، فقط همان بخش مرتبط را تغییر میدهی و بعد همان تست را دوباره اجرا میکنی تا مطمئن شوی مشکل واقعاً برطرف شده است
این اشتباهها را تکرار نکن
- هشدار پیامی است که سامانه پایش پس از برآورده شدن یک شرط مهم تولید میکند؛ هشدار خوب مشخص میکند چه چیزی، کجا و از چه زمانی غیرعادی شده است
- هشدار زیاد و بیارزش باعث میشود هشدار واقعی نادیده گرفته شود
- تغییر دادن تنظیمات مرتبط با پایش Disk و Storage قبل از اینکه مطمئن شوی مشکل واقعاً به همین بخش مربوط است
حالا خودت انجام بده
- در یک نمونه آزمایشی مرتبط با پایش Disk و Storage، فقط وضعیت فعلی را مشاهده کن و سه نکتهای را که برای تشخیص حالت سالم مهماند یادداشت کن
- با Dashboard پایش، Syslog/Event Viewer و SNMP وضعیت مرتبط با پایش Disk و Storage را بدون تغییر بررسی کن، سه داده واقعی جمع کن و توضیح بده هرکدام چه چیزی به تو میگویند
- یک خطای فرضی مرتبط با پایش Disk و Storage بنویس و مشخص کن اولین تست کمخطر تو چیست و چه نتیجهای فرضیهات را رد میکند
نکتههایی که باید با خودت ببری
- Free Space قبل از پر شدن Alert دهد
- Disk Latency روی نرمافزار اثر دارد
- IOPS و صف با Workload سنجیده شوند
- SMART سرنخ سلامت Disk است
- رشد Storage برای Capacity Planning مهم است
- هشدارها را طوری تنظیم کن که معنیدار باشند و تیم را با Alert بیارزش خسته نکنند
قبل از رفتن به درس بعد، جواب را برای خودت توضیح بده
این نکته را با یک مثال توضیح بده: Free Space قبل از پر شدن Alert دهد. بعد بگو در عمل چطور آن را بررسی میکنی.
هشدار پیامی است که سامانه پایش پس از برآورده شدن یک شرط مهم تولید میکند؛ هشدار خوب مشخص میکند چه چیزی، کجا و از چه زمانی غیرعادی شده است
این نکته را با یک مثال توضیح بده: Disk Latency روی نرمافزار اثر دارد. بعد بگو در عمل چطور آن را بررسی میکنی.
Latency زمان پاسخ یک عملیات است و در Storage یا شبکه مستقیماً روی حس کندی اثر میگذارد؛ میانگین، اوج و زمان رخداد را مقایسه کن
این نکته را با یک مثال توضیح بده: IOPS و صف با Workload سنجیده شوند. بعد بگو در عمل چطور آن را بررسی میکنی.
صف صف انتظار Packet یا عملیات است و وقتی منبع از نرخ ورود کندتر باشد رشد میکند؛ در شبکه یا Storage، صف طولانی همراه با Latency بالا میتواند نشانه فشار باشد
برای ذخیره پیشرفت، دوره را رسمی شروع کن
با ثبتنام، تکمیل درسها و نمره آزمون روی حساب ذخیره میشود