Serverele nu se defectează pentru că sunt vechi, ci pentru că nimeni nu s-a uitat la ele o perioadă lungă. Actualizările au fost amânate pentru că exista riscul unei întreruperi, jurnalele au umplut partiția de sistem, discul dintr-un RAID a picat acum patru luni și nimeni nu a văzut alerta, iar procedura de repornire există doar în memoria unui coleg. Administrarea serverelor înseamnă, în cea mai mare parte, disciplină aplicată constant, nu intervenții spectaculoase.
Cum administrăm
Primul pas este inventarul, pentru că surprizele apar aproape întotdeauna aici. Documentăm fiecare server cu rolul pe care îl are, serviciile care rulează pe el, dependențele față de alte sisteme, versiunea sistemului de operare, termenul de expirare al suportului producătorului și al garanției hardware. Sistemele fără proprietar identificat le semnalăm separat, pentru că sunt cel mai frecvent uitate la actualizări.
Configurația o standardizăm și o descriem în Ansible. Serverele instalate manual, fiecare cu particularitățile lui, sunt greu de administrat și imposibil de reconstruit rapid după un incident. Odată ce configurația este în cod, un server nou se aduce la standardul agreat într-o oră, iar abaterile de la configurația de referință sunt detectate automat.
Actualizările urmează un calendar previzibil. Le aplicăm întâi în mediul de test, apoi în producție într-o fereastră agreată, nod cu nod acolo unde există cluster. Pentru vulnerabilitățile critice, cu exploatare activă, aplicăm procedura de urgență, cu notificare prealabilă. Raportul lunar arată ce a fost actualizat, ce a rămas neactualizat și motivul.
Ce include serviciul
Acoperim instalarea și configurarea sistemelor de operare Linux și Windows, întărirea configurației conform CIS Benchmarks, administrarea utilizatorilor și a accesului privilegiat, gestionarea certificatelor, configurarea serviciilor de bază, rotirea jurnalelor și verificarea copiilor de siguranță. Monitorizarea este parte integrantă, nu opțiune separată: un server administrat, dar nesupravegheat, este doar un server care se va defecta fără martori.
Pentru echipamentele fizice adăugăm componenta hardware. Urmărim starea discurilor, a surselor de alimentare și a modulelor de memorie prin interfețele de administrare la distanță, planificăm înlocuirile înainte de expirarea suportului producătorului și menținem un buget realist pentru ciclul de viață. Gestionăm relația cu centrul de date pentru colocare, inclusiv intervențiile fizice și extinderea de spațiu sau de alimentare.
Ce urmărim între incidente
Cea mai mare parte a activității se desfășoară înainte ca ceva să se strice. Urmărim consumul de spațiu pe disc și estimăm momentul în care va deveni o problemă, nu doar pragul de nouăzeci la sută atins deja. Verificăm dacă serviciile pornesc corect după o repornire, pentru că multe configurații aplicate manual funcționează până la primul restart planificat. Testăm restaurarea din copiile de siguranță, întrucât un backup care rulează fără eroare nu garantează că datele pot fi recuperate.
Menținem și evidența ciclului de viață al software-ului. Sistemele de operare ies din suport la date cunoscute în avans, iar o migrare planificată cu șase luni înainte costă o fracțiune dintr-o migrare forțată de încetarea actualizărilor de securitate. Raportăm aceste termene din timp, cu estimarea efortului necesar, astfel încât să poată intra în bugetul anual.
Pentru companiile care intră sub incidența NIS2, disciplina de actualizare și evidența configurațiilor produc direct dovezile solicitate la audit: ce sistem a fost actualizat, când, de către cine și ce a rămas neremediat, cu justificare. Aceste informații există oricum în procesul nostru de lucru, deci nu presupun un efort suplimentar de documentare.
Pentru cine este potrivit
Serviciul este potrivit companiilor cu între zece și câteva sute de servere, care nu justifică o echipă internă dedicată de administrare, dar au nevoie de rigoare. Este util și organizațiilor care au un administrator intern competent și doresc acoperire pentru concedii, plus o a doua opinie pe deciziile importante.
Un caz frecvent este compania în care persoana care știa toate serverele a plecat, iar succesorul a moștenit un mediu nedocumentat. Preluarea unei astfel de situații, cu documentarea completă a ceea ce există, este o parte constantă din munca noastră.
Ce se schimbă în practică
După câteva luni de administrare disciplinată, tabloul arată diferit. Serverele sunt actualizate la zi, configurațiile sunt în Git și se pot reconstrui, defecțiunile hardware sunt detectate la apariție și nu la a doua defecțiune, iar planificarea înlocuirilor se face din timp, nu sub presiunea unei avarii. Documentația există și este actualizată, astfel încât plecarea unui om nu mai reprezintă un risc pentru continuitatea activității.