Cisco CCNA · 200-301 v2.0

Troubleshooting جامع HSRP و VRRP

مشکل Gateway Redundancy اغلب با جمله مبهم «HSRP کار نمی‌کند» یا «VRRP Failover نکرد» گزارش می‌شود. برای حل واقعی باید مسئله را به Evidence تبدیل کنی. ابتدا مشخص کن Client چه Gatewayی دارد و آیا VIP Reachable است؛ سپس State هر دو Peer و Layer 2 مشترک را ببین؛ بعد Priority/Preempt/Tracking و در نهایت Routing Upstream را بررسی کن. این ترتیب مشخص می‌کند مشکل قبل از FHRP، داخل FHRP یا بعد از آن است.

در پایان این درس باید بتوانی
  • Ticket مبهم FHRP را به تست‌های مشخص تبدیل کنی
  • Split-Brain را تشخیص بدهی
  • VIP Reachable ولی Remote Down را جدا کنی
  • Tracking/Preempt Failure را تحلیل کنی
  • پس از Fix Failover و Recovery را کامل Verify کنی

مرحله اول: Client و VIP

از Client واقعی شروع کن: IP، Mask، VLAN و Default Gateway را ثبت کن. اگر Gateway به‌جای VIP روی Physical IP قدیمی تنظیم شده، Failover برای آن Client کار نمی‌کند. سپس VIP را Ping و ARP Table را بررسی کن.

سمت Client
ipconfig /all
ping <VIP>
arp -a

اگر Client حتی در Subnet درست نیست، FHRP مرحله بعدی نیست. DHCP Scope، Access VLAN و IP Addressing را اصلاح یا حداقل Evidence آن را جمع کن.

مرحله دوم: State هر دو Peer

برای HSRP show standby brief و برای VRRP show vrrp brief را روی هر دو Device اجرا کن. انتظار Roleهای مکمل داری. هر دو Primary Role می‌تواند Split-Brain باشد؛ هیچ Standby/Backup نیز می‌تواند Peer Communication Failure باشد.

State دوطرفه
HSRP: show standby brief
VRRP: show vrrp brief

Group، VIP، Interface و Version را مقایسه کن. اگر Deviceها روی VLAN متفاوت یا Trunk ناقص‌اند، Control Message به هم نمی‌رسد. این Root Cause ممکن است در Switching باشد، نه خود FHRP.

برای Split-Brain، MAC Table و VLAN Path بین Distributionها را هم بررسی کن.

مرحله سوم: Priority، Preempt و Track

اگر Roleها با Design نمی‌خوانند، Priority Effective را بررسی کن. Tracking می‌تواند Priority را کاهش دهد. سپس Preempt Policy را ببین تا بفهمی آیا Device ترجیحی اجازه پس گرفتن Role را دارد یا نه.

Policy و State
show standby
show vrrp
show track
show running-config interface Vlan20

Track Down یک علامت است؛ Object را تا Root Cause دنبال کن. اگر Uplink Down شده، دلیل Upstream را حل کن. اگر Track اشتباه تعریف شده، HSRP/VRRP قربانی Configuration Tracking است.

مرحله چهارم: Routing و Data Plane

VIP Reachable و Role درست است ولی مقصد دور قطع است: Routing Table Gateway فعال، Default/OSPF Route، ACL و Return Path را بررسی کن. از Ping با Source VLAN برای تست مسیر واقعی استفاده کن.

بعد از FHRP
show ip route <remote-prefix>
ping <remote-ip> source Vlan20
traceroute <remote-ip> source Vlan20

اگر Gateway دوم پس از Failover Route لازم را ندارد، مشکل High Availability طراحی است. FHRP Role را منتقل کرده ولی Device Backup آماده Forwarding End-to-End نبوده است.

در چنین سناریویی Tracking یا Routing Convergence Design ممکن است نیازمند اصلاح باشد.

Verification نهایی و Fault Injection

پس از Fix، Normal State، Failure و Recovery را هر سه تست کن. برای Failure می‌توان Object مشخص طراحی را به‌صورت کنترل‌شده Down کرد. Packet Loss، Role Timeline و Remote Reachability را ثبت کن.

چرخه کامل
Normal verify
Controlled failure
Observe role + traffic
Restore
Verify failback
Document

اگر فقط Current State را ببینی، ممکن است Fix زیر Failure واقعی دوباره شکست بخورد. High Availability باید با Failure Test ثابت شود.

سناریوی عملی

کاربران VLAN 40 پس از خرابی Uplink R1 قطع می‌شوند. VIP همچنان Ping می‌شود و R1 Active مانده است. show track نشان می‌دهد Object مربوط به Interface اشتباه Gi0/2 است، در حالی که Uplink واقعی Gi0/1 است. پس HSRP از Failure خبر ندارد. Tracking اصلاح، Failover دوباره تست و R2 در خرابی واقعی Active می‌شود.

اشتباهات رایج

اشتباه‌های رایج و علت آن‌ها

  • Reset کردن Protocol قبل از دیدن Client Gateway
  • دیدن فقط یک Peer
  • اعلام مشکل FHRP وقتی VIP سالم ولی Route Upstream خراب است
  • اعتماد به Tracking بدون بررسی Object واقعی
تمرین عملی

تمرین عملی

  1. سه Fault ایجاد کن: Gateway Client اشتباه، Split-Brain Layer2 و Track اشتباه
  2. برای هر Fault مشخص کن کدام Command آن را تأیید می‌کند
  3. Failure/Recovery را با Timestamp ثبت کن
  4. یک Incident Report یک‌صفحه‌ای برای FHRP بنویس

نکته‌هایی که باید با خودت ببری

  • Troubleshooting از Client و VIP شروع می‌شود
  • State باید روی هر دو Peer دیده شود
  • Priority/Preempt/Tracking رفتار Role را توضیح می‌دهند
  • VIP سالم لزوماً Remote Routing را ثابت نمی‌کند
  • HA فقط با Fault Injection کنترل‌شده Verify می‌شود
خودسنجی

خودسنجی

هر دو HSRP Router Active هستند؛ یک Root Cause مهم چیست؟

قطع HSRP Hello/Layer 2 Path بین Peerها.

VIP سالم ولی Remote Down است؛ بعد چه می‌بینی؟

Routing/ACL/Return Path روی Gateway فعال.

Track Down ولی Object اشتباه است؛ مشکل کجاست؟

Design/Configuration Tracking.

Verification HA چه سه حالت دارد؟

Normal، Failure و Recovery.

منابع رسمی

منابع مرجع این درس

مطالعه همیشه آزاد است

برای ذخیره پیشرفت وارد حساب شو

حساب کاربری برای آزمون و ثبت مرحله‌ها استفاده می‌شود

ورود یا ثبت‌نام