Supervision CPU VMware

  • Utilisation CPU en cœurs CPU
  • Utilisation CPU en %
  • Utilisation CPU en GHz

Cœurs CPU

VMware CPU monitoring : core

CPU %

VMware CPU monitoring : percent

CPU GHz

VMware CPU monitoring : GHz

CPU Ready

Le temps CPU Ready est une métrique plus complexe, aux causes souvent variées, et qui peut peser lourdement sur les performances de vos VM. Elle exprime le pourcentage de temps pendant lequel la machine virtuelle est prête mais ne peut pas être ordonnancée sur un CPU physique. Dans ESXTOP (ESXTOP est un outil en ligne de commande qui donne l’utilisation des ressources en temps réel sur un hôte vSphere ESXi), cette métrique s’appelle « %RDY » ; dans le vSphere Client, elle s’appelle « Readiness », à ne pas confondre avec « CPU Ready », qui en donne la somme en ms plutôt que le pourcentage. Vous pouvez calculer le pourcentage à partir de la somme en ms avec la formule suivante :
(CPU summation value / ( * 1000)) * 100 = CPU ready % 
Un pourcentage de ready time inférieur à 5 % ne pose en général pas de problème et ne devrait pas peser sur les performances. En revanche, au-delà de 10 %, l’effet devient tout à fait significatif. Je vais passer en revue les deux causes les plus courantes du ready time, et la façon de les repérer et de les résoudre.

  1. Le graphe « CPU Ready » d’une VM porte la légende « CPU Ready/vCPU »
    Cela signifie qu’il s’agit du CPU Ready par vCPU : le CPU Ready total de toute la VM (la somme du CPU Ready de tous ses cœurs vCPU), divisé par le nombre de vCPU.
    VMWare recommande un CPU Ready inférieur à 5 %.

    VMware CPU monitoring

    VMware CPU monitoring

  2. Le graphe « VM CPU » avec le CPU ready
    Sa légende est CPU Ready/VM : c’est donc le CPU Ready total de toute la VM (en fait la somme du CPU Ready de tous ses cœurs vCPU).
    Ce graphe est conçu pour ressembler au graphe équivalent du vCenter vSphere en version récente (la 8).
    VMware CPU monitoring
Pour plus de détails, voir CPU Ready

CPU Co-Stop

Le Co-Stop exprime le pourcentage de temps pendant lequel une machine virtuelle vSMP (Virtual Symmetric Multi-Processing) était prête à s’exécuter mais a subi un retard dû à la contention d’ordonnancement entre ses vCPU (100 % = %RUN + %RDY + %CSTP + %WAIT). Cette métrique concerne toutes les VM auxquelles plus d’un vCPU est alloué, et elle signifie en somme que les processeurs physiques n’offrent pas assez d’occasions d’ordonnancement CPU. Selon la situation, il peut y avoir plusieurs façons d’y remédier.

Il faut d’abord déterminer si le problème touche de nombreuses VM ou seulement quelques grosses. Une ou plusieurs grosses VM peuvent par exemple se voir attribuer tant de vCPU, au regard du nombre de cœurs physiques de l’hôte, qu’il devient difficile d’ordonnancer tous leurs vCPU exactement au même instant. On y remédie en réduisant le nombre de vCPU alloués à ces VM, ou en les déplaçant vers un hôte offrant plus de cœurs physiques par processeur.

À l’inverse, il se peut que la quasi-totalité de vos VM connaisse du temps Co-Stop. Cela peut indiquer un facteur de surallocation CPU trop élevé, qui conduit au même problème. Vous pouvez calculer ce facteur en divisant le nombre de vCPU alloués par le nombre de cœurs physiques de la plateforme ou de l’hôte. En général, un facteur de 3:1 ne pose pas de problème. Au-delà, la dégradation des performances peut commencer, et au-dessus de 5:1 un effet significatif est très probable.

  1. Graphe « CPU Co-Stop » d’une VM, en millisecondes
    VMware CPU  monitoring

  2. Graphe « CPU Co-Stop » d’une VM, en %
    VMware CPU  monitoring percent