Rețea pentru producție
Convenience
Diagnosticarea unei rețele instabile fără a opri producția
Am găsit cauza unei rețele instabile, am înlocuit echipamentele care ascundeau problema și am introdus alerte care nu trimit zeci de e-mailuri identice.

Conectivitatea devenise intermitentă în mai multe zone. Simptomele indicau aparent Wi-Fi sau DHCP, dar cauza era în topologia fizică și în echipamentele de acces fără vizibilitate.
Situația
Când mai multe dispozitive pierd simultan accesul la servere și internet, este tentant să fie schimbate adrese, repornite servicii sau adăugate puncte de acces. În acest caz, capacitatea DHCP era suficientă, iar semnalul radio era puternic. Instabilitatea venea dintr-o zonă mai joasă a rețelei.
Rețeaua deservea atât birourile, cât și producția, așa că nu puteam opri totul pentru teste. Am început doar prin a citi configurațiile și starea echipamentelor, fără să schimbăm nimic. Apoi am desenat legăturile și am separat faptele măsurate de presupuneri.
Diagnosticul
Am urmărit traficul transmis către toate dispozitivele, schimbările de legături, viteza negociată și erorile fiecărui port. Testele au indicat un echipament de rețea care nu putea fi administrat sau monitorizat și care producea instabilitate.
Diferența contează. O problemă DHCP împiedică dispozitivul să primească o adresă IP. O problemă în rețeaua cablată poate întrerupe aleatoriu și dispozitive care au deja o adresă corectă.
- măsurare înainte de schimbare
- izolare pe segmente, cu verificare după fiecare pas
- verificare prin trafic real, nu doar din interfața de administrare
- o variantă de revenire pentru fiecare modificare importantă
Remedierea
Am înlocuit echipamentele care nu puteau fi urmărite cu switch-uri administrabile și am configurat porturile după rol. Legăturile dintre switch-uri au primit alte reguli decât porturile pentru calculatoare și utilaje, astfel încât protecțiile rețelei să nu blocheze trafic legitim.
După stabilizare am introdus un sistem de monitorizare care ține minte dacă problema este nouă, încă activă sau rezolvată. Trimite o notificare când apare incidentul, când revine la normal ori când rămâne nerezolvat prea mult timp. Pentru aceeași stare nu mai trimite e-mailuri repetate.
Ce rămâne după incident
Rezultatul nu este doar o rețea care funcționează din nou. Clientul are acum o schemă ușor de urmărit, un tabel al porturilor, reguli pentru mutarea echipamentelor și alerte care fac diferența între o defecțiune și o lucrare planificată.

