← Toutes les situations

SP2 — Supervision du parc avec Zabbix et Grafana

Projet personnalisé encadré (PPE)
Contexte / organisation
Projet mené en cours, en binôme, sur l'infrastructure de la salle réseau de l'établissement.
Période
Trimestre / semestre AAAA
Épreuve(s) visée(s)
E6 (supervision, analyse d'indicateurs, détection d'anomalies), E4 (dossier de choix, recette)
Environnement technique
Debian 12, Zabbix Server 6 LTS, agent Zabbix, SNMP v2c/v3, Grafana, VMware / Proxmox
Outils
Zabbix (serveur, frontend, agent), Grafana, SNMP, SSH, navigateur

1. Contexte et besoin

Les pannes (service arrêté, disque plein, lien réseau coupé) n'étaient constatées qu'au moment où un utilisateur se plaignait. Il n'existait aucune visibilité sur la disponibilité ni sur la charge des serveurs et des équipements réseau.

Objectifs :

  • Mettre en place un outil de supervision centralisé et open source.
  • Surveiller : état des hôtes (ping), CPU / RAM / disque, services critiques, ports réseau, trafic.
  • Définir des seuils et des alertes par courriel.
  • Produire des tableaux de bord lisibles pour un non-spécialiste.

2. Étude et choix de la solution

CritèreNagios CoreZabbixCentreon
ConfigurationFichiers texteInterface web + templatesInterface web
Découverte automatiqueLimitéeOui (règles LLD)Oui
Métriques & historisationAdd-onsIntégrée (BDD)Intégrée
Courbe d'apprentissageÉlevéeMoyenneMoyenne
CoûtGratuitGratuitGratuit (édition libre)

Décision : Zabbix, pour la découverte automatique, les modèles prêts à l'emploi (Linux, Windows, SNMP) et l'historisation native, complété par Grafana pour des tableaux de bord soignés.

3. Solution mise en œuvre

  1. Installation de Zabbix Server + frontend + base de données sur Debian, accès HTTPS.
  2. Déploiement de l'agent Zabbix sur les serveurs Linux et Windows (modèles officiels).
  3. Activation de SNMP sur le switch et le routeur, ajout via le modèle « Network Generic SNMP ».
  4. Règles de découverte réseau sur le sous-réseau d'administration pour l'ajout automatique des hôtes.
  5. Définition des déclencheurs : hôte injoignable 3 min, disque > 85 %, CPU > 90 % pendant 5 min, service arrêté.
  6. Actions et notifications par courriel (média SMTP) avec escalade après 15 min.
  7. Connexion de Grafana à la source de données Zabbix, création d'un tableau de bord « Vue d'ensemble ».

Extrait — déclencheur Zabbix (syntaxe d'expression)

Nom      : Disque / presque plein sur {HOST.NAME}
Sévérité : Haute
Expression :
  last(/{HOST.NAME}/vfs.fs.size[/,pused]) > 85
Récupération :
  last(/{HOST.NAME}/vfs.fs.size[/,pused]) < 80

Captures à insérer : assets/img/sp2-zabbix-map.png, assets/img/sp2-grafana.png.

4. Tests et recette

ScénarioAttenduRésultat
Arrêt volontaire d'une VM superviséeAlerte « hôte injoignable » + courriel < 5 minConforme (3 min 40)
Remplissage d'un disque de test à 90 %Déclencheur « disque presque plein » HauteConforme
Arrêt du service webProblème signalé, retour auto après redémarrageConforme
Coupure d'un port du switchVariation de trafic visible dans GrafanaConforme

5. Difficultés rencontrées et solutions

  • Agent Windows « no active checks » : port 10051 bloqué par le pare-feu. Règle entrante ajoutée.
  • SNMP muet sur le switch : communauté erronée ; passage en SNMP v3 (authentification + chiffrement) pour la sécurité.
  • Courriels non reçus : relais SMTP exigeant une authentification ; configuration du média avec compte dédié.
  • Faux positifs la nuit (sauvegardes) : ajout d'une période de maintenance planifiée.

6. Compétences mobilisées

  • Superviser l'activité et les performances d'un dispositif d'infrastructure
  • Analyser des indicateurs, détecter et qualifier une anomalie
  • Élaborer un dossier de choix et le présenter
  • Réaliser des tests d'intégration et d'acceptation
  • Installer et configurer un service (Linux, SNMP)
  • Rédiger une documentation d'exploitation

7. Bilan

La supervision permet désormais d'anticiper les incidents (disques, services) au lieu de les subir. J'ai appris à doser les seuils pour éviter la « fatigue d'alerte » et à sécuriser la collecte (SNMP v3). Perspectives : superviser les onduleurs, ajouter une sonde externe pour tester la disponibilité depuis l'extérieur, et exporter un rapport mensuel de disponibilité (SLA).

À personnaliser : nombre d'hôtes réellement supervisés, captures de vos tableaux de bord, vrais temps de détection mesurés, et la solution que vous avez vraiment retenue si ce n'est pas Zabbix.