Supervision de l’état de santé Ceph
XorMon-NG collecte les données d’état de santé depuis le module Prometheus du manager Ceph (port par défaut 9283).
| Domaine | Comportement |
|---|---|
| Page Health Status | Montre les contrôles de santé Ceph actifs et les démons cephadm en erreur |
| État de l’équipement | Piloté par les contrôles de référence par défaut ci-dessous (plus les démons en erreur), sauf personnalisation dans les Advanced settings |
Références officielles :
| Domaine | Comportement |
|---|---|
| Interface | Tous les contrôles de santé actifs et les démons en erreur sont visibles sur la page Health Status |
| État de l’équipement | Contrôles de référence par défaut (voir la table ci-dessous) et tout démon cephadm en erreur |
| Ignoré par défaut | CEPHADM_PAUSED n’entre pas dans l’état de l’équipement |
Ces noms de contrôle doivent correspondre au name label dans Prometheus ceph_health_detail exactement.
| Nom du contrôle | Signification habituelle | Documentation Ceph |
|---|---|---|
CEPHADM_FAILED_DAEMON |
Un ou plusieurs démons cephadm ont échoué (par exemple un osd en état d’erreur) | CEPHADM_FAILED_DAEMON |
OSD_DOWN |
L’OSD est down | OSD_DOWN |
OSD_FULL |
L’OSD est plein | OSD_FULL |
POOL_FULL |
Le pool est plein | POOL_FULL |
PG_DAMAGED |
Placement groups endommagés | PG_DAMAGED |
MON_DOWN |
Le monitor est down | MON_DOWN |
MDS_ALL_DOWN |
Tous les démons MDS sont down | MDS_ALL_DOWN |
PG_RECOVERY_FULL |
Reprise bloquée parce que le cluster ou l’OSD est plein | PG_RECOVERY_FULL |
Défaillance cephadm typique :
HEALTH_WARN avec CEPHADM_FAILED_DAEMON et un démon en état d’erreur sont couverts par la référence
par défaut, aucun Advanced settings n’est nécessaire.
À configurer dans Settings → Device → Storage → votre équipement Ceph → Advanced settings (paires clé/valeur enregistrées par équipement).
| Clé | Objet | Exemple de valeur |
|---|---|---|
health_extra_checks |
Ajouter des noms de contrôle à la référence par défaut | PG_NOT_SCRUBBED,PG_DEGRADED,POOL_NEAR_FULL |
health_ignore_checks |
Retirer des noms de contrôle de l’ensemble effectif | OSD_DOWN |
health_alert_checks |
Remplacer la référence par défaut : seuls les contrôles listés (plus les démons en erreur) entrent dans l’état de l’équipement |
CEPHADM_FAILED_DAEMON |
Le nom de clé health_alert_checks est fixé dans le produit ; il désigne les contrôles qui influent sur l’état de l’équipement, et non
une interface d’alertes distincte sur cette page.
CEPHADM_FAILED_DAEMON.
daemon osd.31 on node).curl -s http://<mgr-host>:9283/metrics | grep 'ceph_health_detail{name='
Aucun Advanced settings. La référence comprend CEPHADM_FAILED_DAEMON et d’autres contrôles critiques.
| Clé | Valeur |
|---|---|
health_extra_checks |
PG_NOT_SCRUBBED,PG_NOT_DEEP_SCRUBBED |
| Clé | Valeur |
|---|---|
health_ignore_checks |
OSD_DOWN |
| Clé | Valeur |
|---|---|
health_alert_checks |
CEPHADM_FAILED_DAEMON |
Souvent ajoutés par health_extra_checks quand un site veut plus de sensibilité.
Voir Ceph
Health Checks pour les descriptions complètes.
| Nom du contrôle | Note |
|---|---|
PG_NOT_SCRUBBED |
WARN de longue durée sur les clusters chargés ; candidat courant au faux positif |
PG_NOT_DEEP_SCRUBBED |
Comme ci-dessus, pour le deep scrub |
PG_DEGRADED |
Normal pendant une reprise ; peut osciller |
SLOW_OPS |
Souvent transitoire sous charge |
POOL_NEAR_FULL |
Planification de capacité ; en général WARN |