عمليات تقنية المعلومات تاريخ النشر دقيقة واحدة للقراءة

ماذا تراقب في نظام حساس؟ الإشارات الذهبية الأربع

بدل مئات التنبيهات المزعجة، ابدأ بأربع إشارات تكشف أغلب المشاكل من منظور المستخدم.

فرق كثيرة تراقب كل شيء: المعالج والذاكرة والقرص لكل خادم. والنتيجة مئات التنبيهات يوميًا، يتجاهلها الجميع حتى تفوتهم الحادثة الحقيقية.

كتاب Site Reliability Engineering من Google يقترح البدء بأربع إشارات للخدمات التي يستخدمها الناس مباشرة:

1. زمن الاستجابة (Latency)

كم تستغرق الطلبات؟ راقب النسب المئوية مثل p95 وp99، لا المتوسط فقط، لأن المتوسط يخفي تجربة أسوأ المستخدمين. وافصل زمن الطلبات الناجحة عن الفاشلة.

2. حجم الحركة (Traffic)

كم طلبًا تستقبل الخدمة؟ هبوط مفاجئ في الحركة قد يعني عطلًا قبل أن يبلّغ أحد.

3. الأخطاء (Errors)

نسبة الطلبات الفاشلة، سواء أخطاء صريحة أو استجابات خاطئة أو بطيئة جدًا بحيث تُعد فاشلة.

4. التشبّع (Saturation)

مدى امتلاء المورد الأكثر ضغطًا: اتصالات قاعدة البيانات، أو مساحة القرص، أو الطوابير. التشبّع يتنبأ بالمشكلة قبل وقوعها.

نصائح عملية

  • اجعل التنبيه على الأعراض التي يشعر بها المستخدم، واجعل مؤشرات الموارد للتشخيص.
  • كل تنبيه يجب أن يتطلب إجراءً. التنبيه الذي لا يتطلب شيئًا يُحذف أو يتحول إلى تقرير.
  • أضف فحصًا خارجيًا يحاكي المستخدم من خارج شبكتك.