1. O que significa pronto
Um servidor pronto não é apenas um servidor que responde. Outra pessoa precisa conseguir entender suas portas, reiniciar serviços, localizar logs e recuperar dados sem depender da memória de quem o configurou.
2. Identidade e acesso
- Usuário operacional nominal
- SSH por chave
- Root desabilitado
- Privilégio mínimo
- Registro de acessos
3. Serviço e observabilidade
systemctl --failed
systemctl is-enabled irn-worker
journalctl -u irn-worker --since today
ss -lntpDocumente a unidade, dependências, variáveis e comportamento esperado. Defina o que é alerta e o que é apenas informação.
4. Rede e backup
sudo ufw status numbered
sudo fail2ban-client status sshd
restic snapshotsListe cada porta liberada com sua justificativa. O backup deve ter destino externo, retenção e restauração ensaiada.
5. Rollback e evidências
Registre a versão implantada, arquivos alterados, comando de rollback e responsável pela mudança. Guarde evidências do healthcheck e do último restore.
6. Checklist de entrega
- Acesso validado
- Firewall revisado
- Serviço reinicia sozinho
- Logs consultáveis
- Backup restaurado
- Rollback testado
7. Operação contínua
O runbook deve ser revisado após incidentes, upgrades e mudanças de arquitetura. Inclua contatos, janela de manutenção, dependências externas e critérios para escalar o problema.
# coleta rápida de evidências
hostnamectl
uptime
systemctl --failed
df -h
free -h
8. Comandos explicados
| Comando | O que faz |
|---|---|
systemctl --failed | Lista as units do systemd que falharam. Se não listar nada, está tudo bem. |
systemctl is-enabled irn-worker | Diz se o serviço inicia no boot (enabled) ou não (disabled). |
journalctl -u irn-worker --since today | Mostra os logs do serviço desde a meia-noite. |
ss -lntp | Lista as portas TCP em escuta e o processo dono de cada uma. |
sudo ufw status numbered | Mostra as regras do firewall numeradas, o que facilita removê-las com ufw delete N. |
sudo fail2ban-client status sshd | Mostra a jail do SSH e os IPs bloqueados. |
restic snapshots | Lista os backups existentes, com data e caminhos. |
hostnamectl | Mostra nome do servidor, sistema operacional e versão do kernel. |
uptime | Mostra há quanto tempo o servidor está ligado e a carga média de 1, 5 e 15 minutos. |
df -h | Mostra o espaço em disco de cada partição, em unidades legíveis (-h). |
free -h | Mostra o uso de memória e de swap. |
9. Como ler a coleta rápida de evidências
O bloco final do artigo (hostnamectl, uptime, systemctl --failed, df -h, free -h) serve para registrar o estado do servidor. Veja o que observar em cada saída:
| Comando | O que observar | Sinal de alerta |
|---|---|---|
uptime | carga média comparada ao número de CPUs | carga muito acima do número de CPUs por muito tempo |
df -h | coluna Use%, principalmente em / | partição perto de 100% |
free -h | memória disponível (available) e swap | swap em uso crescente |
systemctl --failed | units listadas | qualquer serviço na lista |
10. Modelo de registro de mudança
O artigo pede versão implantada, arquivos alterados, comando de rollback e responsável. Uma forma prática de preencher (os valores são ilustrativos):
| Campo | Exemplo |
|---|---|
| Versão implantada | v1.4.2 (commit 3f2a91c) |
| Arquivos alterados | /etc/systemd/system/irn-worker.service |
| Comando de rollback | git checkout v1.4.1 && sudo systemctl restart irn-worker |
| Responsável e data | nome e data da mudança |
| Evidência | saída do healthcheck e do systemctl status após a mudança |