Supervision de l’état de santé Ceph


Vue d’ensemble

XorMon-NG collecte les données d’état de santé depuis le module Prometheus du manager Ceph (port par défaut 9283).

Domaine Comportement
Page Health Status   Montre les contrôles de santé Ceph actifs et les démons cephadm en erreur
État de l’équipement Piloté par les contrôles de référence par défaut ci-dessous
(plus les démons en erreur), sauf personnalisation dans les Advanced settings

Références officielles :


Comportement par défaut (sans Advanced settings)

Domaine Comportement
Interface Tous les contrôles de santé actifs et les démons en erreur sont visibles sur la page Health Status
État de l’équipement Contrôles de référence par défaut (voir la table ci-dessous) et tout démon cephadm en erreur
Ignoré par défaut   CEPHADM_PAUSED n’entre pas dans l’état de l’équipement

Référence par défaut

Ces noms de contrôle doivent correspondre au name label dans Prometheus ceph_health_detail exactement.

Nom du contrôle Signification habituelle Documentation Ceph
CEPHADM_FAILED_DAEMON   Un ou plusieurs démons cephadm ont échoué (par exemple un osd en état d’erreur)   CEPHADM_FAILED_DAEMON
OSD_DOWN L’OSD est down OSD_DOWN
OSD_FULL L’OSD est plein OSD_FULL
POOL_FULL Le pool est plein POOL_FULL
PG_DAMAGED Placement groups endommagés PG_DAMAGED
MON_DOWN Le monitor est down MON_DOWN
MDS_ALL_DOWN Tous les démons MDS sont down MDS_ALL_DOWN
PG_RECOVERY_FULL Reprise bloquée parce que le cluster ou l’OSD est plein PG_RECOVERY_FULL

Défaillance cephadm typique : HEALTH_WARN avec CEPHADM_FAILED_DAEMON et un démon en état d’erreur sont couverts par la référence par défaut, aucun Advanced settings n’est nécessaire.


Advanced settings (par équipement Ceph)

À configurer dans Settings → Device → Storage → votre équipement Ceph → Advanced settings (paires clé/valeur enregistrées par équipement).

Clé Objet Exemple de valeur
health_extra_checks Ajouter des noms de contrôle à la référence par défaut PG_NOT_SCRUBBED,PG_DEGRADED,POOL_NEAR_FULL
health_ignore_checks Retirer des noms de contrôle de l’ensemble effectif OSD_DOWN
health_alert_checks Remplacer la référence par défaut : seuls les contrôles listés  
(plus les démons en erreur) entrent dans l’état de l’équipement  
CEPHADM_FAILED_DAEMON  

Le nom de clé health_alert_checks est fixé dans le produit ; il désigne les contrôles qui influent sur l’état de l’équipement, et non une interface d’alertes distincte sur cette page.

Format des valeurs

  • Employez les noms de contrôle exacts de Ceph (majuscules, chiffres, tirets bas), par exemple CEPHADM_FAILED_DAEMON.
  • Ne collez pas les messages de la CLI (par exemple daemon osd.31 on node).
  • Séparez plusieurs noms par des virgules.
  • Découvrez les noms sur votre Ceph :
curl -s http://<mgr-host>:9283/metrics | grep 'ceph_health_detail{name='

Exemples de configuration

Par défaut (premier essai recommandé)

Aucun Advanced settings. La référence comprend CEPHADM_FAILED_DAEMON et d’autres contrôles critiques.

Ajouter la supervision du retard de scrub

Clé Valeur
health_extra_checks   PG_NOT_SCRUBBED,PG_NOT_DEEP_SCRUBBED

Exclure OSD_DOWN de l’état de l’équipement, pour cet équipement

Clé Valeur
health_ignore_checks   OSD_DOWN

Ne superviser que les défaillances cephadm

Clé Valeur
health_alert_checks   CEPHADM_FAILED_DAEMON

Contrôles optionnels suggérés (hors référence)

Souvent ajoutés par health_extra_checks quand un site veut plus de sensibilité. Voir Ceph Health Checks pour les descriptions complètes.

Nom du contrôle Note
PG_NOT_SCRUBBED   WARN de longue durée sur les clusters chargés ; candidat courant au faux positif
PG_NOT_DEEP_SCRUBBED   Comme ci-dessus, pour le deep scrub
PG_DEGRADED Normal pendant une reprise ; peut osciller
SLOW_OPS Souvent transitoire sous charge
POOL_NEAR_FULL Planification de capacité ; en général WARN

Références