MTTR و MTBF: كيف تقيس موثوقية نظامك؟

نسبة التوفّر تخبرك كم توقّفت. MTTR وMTBF تخبرانك لماذا، وأيّهما يجب أن تصلحه أولاً.

آخر تحديث: 6 دقائق قراءةالمراقبة

MTTR (Mean Time To Recovery) هو متوسط الزمن من بداية العطل حتى عودة الخدمة، ويُحسب بقسمة إجمالي زمن التوقّف على عدد الحوادث. MTBF (Mean Time Between Failures) هو متوسط زمن التشغيل السليم بين عطل وآخر. MTTD هو متوسط زمن اكتشاف العطل، وMTTA متوسط زمن الاستجابة له. تقليل MTTD هو أرخص تحسين متاح، لأنه لا يحتاج تغيير بنيتك بل تحسين مراقبتك فقط.

لماذا لا تكفي نسبة التوفّر؟

تخيّل موقعين، كلاهما بنسبة توفّر 99.9% خلال الشهر. الأول توقّف مرة واحدة لمدة 43 دقيقة. الثاني توقّف 43 مرة لدقيقة واحدة في كل مرة. الرقم واحد، والتجربة مختلفة تماماً: الأول عانى حادثاً كبيراً واحداً، والثاني يعاني خللاً مزمناً متكرراً يقضم ثقة المستخدم كل يوم. المقاييس التالية هي ما يفرّق بينهما.

MTTR: متوسط زمن التعافي

MTTR = إجمالي زمن التوقّف ÷ عدد الحوادث. لو توقّف نظامك 3 مرات بمجموع 90 دقيقة، فـ MTTR = 30 دقيقة. هذا الرقم يقيس كفاءة استجابتك: كم تستغرق من لحظة العطل حتى عودة الخدمة. تحسينه يأتي من أتمتة النشر والتراجع (rollback)، ومن كتيّبات تشغيل واضحة، ومن معرفة الفريق بمن يتصرّف ومتى.

MTBF: متوسط الزمن بين الأعطال

MTBF = إجمالي زمن التشغيل السليم ÷ عدد الأعطال. يقيس استقرار نظامك بنيوياً: كلما ارتفع، كان نظامك أمتن. MTTR منخفض مع MTBF منخفض يعني أنك سريع في الإصلاح لكن نظامك يتعطّل كثيراً — وهذا نمط استنزاف يحرق الفريق. المشكلة هنا في البنية لا في الاستجابة.

MTTD و MTTA: الرقمان المنسيّان

MTTD (Mean Time To Detect) هو الزمن من لحظة العطل الفعلية حتى لحظة معرفتك به. MTTA (Mean Time To Acknowledge) هو الزمن من التنبيه حتى بدء شخص فعلياً بالعمل عليه. في أغلب الفرق التي لا تراقب بشكل صحيح، MTTD هو الجزء الأكبر من MTTR كله: ساعات تمرّ قبل أن يشتكي عميل. وهذا خبر جيد، لأن تقليله لا يحتاج إعادة بناء نظامك.

أيّها تصلح أولاً؟

ابدأ دائماً بـ MTTD. تقليل زمن الاكتشاف من ساعتين إلى 15 ثانية تغيير في أداة المراقبة لا في معماريتك، وأثره على MTTR فوري ومباشر. بعده حسّن MTTA بقنوات تنبيه تصل فعلاً إلى جوّال شخص مسؤول، لا بريد يُقرأ صباحاً. أما رفع MTBF فهو المشروع الهندسي الطويل: تكرار الخوادم، اختبارات أفضل، إزالة نقاط الفشل الواحدة.

كيف تقرأ الأرقام معاً

MTBF مرتفع + MTTR منخفض: نظام ناضج، حافظ عليه. MTBF مرتفع + MTTR مرتفع: أعطال نادرة لكنها تصيبك بالشلل حين تقع، استثمر في كتيّبات التشغيل والتدريب. MTBF منخفض + MTTR منخفض: فريق يطفئ الحرائق بمهارة، لكنه سينهار، أصلح البنية. MTBF منخفض + MTTR مرتفع: حالة حرجة تستدعي تجميد الميزات الجديدة.

أسئلة شائعة

ما فرق MTTR عن MTTF؟

MTTR يخص أنظمة قابلة للإصلاح ويقيس زمن العودة للعمل. MTTF (Mean Time To Failure) يخص المكوّنات غير القابلة للإصلاح ويقيس عمرها حتى العطل النهائي، مثل قرص صلب.

من أين آتي بهذه الأرقام؟

من سجل الحوادث في أداة المراقبة. كل حادثة تحمل وقت فتحها ووقت إغلاقها، وبهما يُحسب MTTR وMTBF آلياً. من دون سجل حوادث منظّم تبقى الأرقام تخميناً.

ما MTTR الجيد؟

لا يوجد رقم مطلق؛ الجيد هو أن يتحسّن رقمك عن الربع السابق. للخدمات الحرجة على الويب يُعدّ MTTR أقل من 30 دقيقة هدفاً معقولاً.

فريق مراقب

الفريق الذي يبني ويشغّل منصة مراقب: مهندسو المراقبة الذين يديرون محرّك الفحص في الإنتاج، وكتّاب المحتوى التقني العربي. كل ما يُنشر هنا مبني على ما نراه فعلياً في بيانات المراقبة، لا على ترجمة مقالات أجنبية.

تعرّف علينا

طبّق ما تعلّمته مع مراقب

راقب موقعك وبريدك تلقائياً وابدأ مجاناً خلال دقائق.

ابدأ مجاناً

اقرأ أيضاً