🚀 GPS IT - NOC NextGen

Roadmap Estratégico

Transformação Digital em Observabilidade e Automação de TI com Arquitetura Híbrida Evolutiva.

BUs Engenharia e Serviços Gerenciados

🔄 Fluxo Híbrido (Implementação Inicial)
  • 1

    Abertura Omnichannel

    Cliente abre chamado via WhatsApp integrado ao GLPI

  • 2

    Triagem Inteligente

    Sistema categoriza automaticamente e direciona para especialista N1

  • 3

    Resolução N1

    Tentativa de resolução com procedimentos padrão, base de conhecimento e treinamento interno GPS IT.

  • 4

    Escalonamento Inteligente

    Escalonamento automático para N2/N3 baseado em contexto

  • 5

    Resolução & Feedback

    Conclusão com coleta de satisfação e atualização da base de conhecimento

ðŸĪ– Fluxo Automatizado (Meta: 80%)
  • 1

    Detecção Proativa

    Zabbix + Prometheus identificam incidentes antes do cliente.

  • 2

    Análise Inteligente

    Logs "brutos" do Zabbix enviados para o Loki, realizar análise e padronização automática, seguem para o Grafana. Métricas do Prometheus são enviadas direto para o Grafana.

  • 3

    Execução de Playbooks

    Ansible/AWX executa correções automáticas via IaC.

    Entraremos em fase de pesquisa para incrementar no Stack

    um SOAR integrado com ML/IA. Orquestrações inteligentes para automaçs˃o e correlação de incidentes otimizados.

  • 4

    Validação & Aprendizado (Estado da Arte)

    Buscamos evoluir continuamente a maturidade do ambiente, adotando uma abordagem baseada em aprendizado contínuo do sistema, validação proativa de correções aplicadas. Nosso objetivo é implementar práticas de CI/CD e DevSecOps, permitindo que integrações, atualizações e melhorias sejam automatizadas, testadas e validadas antes da aplicação em ambientes produtivos. Isso garante maior confiabilidade, agilidade e segurança nas entregas.

📅 Timeline de Implementação

Fase 1A (Quick Wins) : Resolução de Pendências & Melhorias Rápidas 

Maio / Junho 2025
  • Estruturação do time de intervenção e definição de papéis (Luiza, Sabino, Amândio, Tavares).
  • Resolução de pendências junto aos clientes já  com o novo time.
  • Otimizações de configurações como Webservices, deploy do Syslog Server, configurações de monitoramento via SNMP e SysLog em Storages da GRB e e documentações inciciais ja nas primeiras duas semanas.
  • Assessment documentado do ambiente Zabbix da GPS IT.
  • Configuração de aberturas de chamados auomatizados no GLPI  (Helpdesk), imediatamente após o Zabbix identificar algum incidente.
  • Criação do Plano de Comunicação interno de atividades de infraestrutura.
  • Elaboração de formulários inteligentes do NOC e mapeamento de processos.
  • Mudança drástica na abordagem do atendimento no Helpdesk, iniciando com a Luiza, primeira N1 do time para resoluções de incidentes rápidos, sem necessidade em escalar chamados, já se especializando em observabilidade com foco em segurança da informação.

Fase 1B (Em Paralelo): Planejamento & Deploy da Nova Arquitetura

Maio / Junho 2025
  • Análise de requisitos e definição conceitual da transformação gradual do serviço baseado em uma tecnologia, um produto (Zabbix), para um serviço com fundamentos sólidos em uma arquitetura de Observabilidade em Stack. Formado com as tecnologias opensource mais testadas, consolidadas há anos no mercaado, com comunidades gigantes e muito ativas. 
  • Pesquisas, leituras aprofundadas, seleção e análise das tecnologias principais do stack.
  • Definição do plano de ação de implementação, sempre com as premissas de segurança da informação  e escalabilidade.
  • Deploy do PostgreSQL integrado ao TimescaleDB oferecendo uma solução avançada e altamente eficiente para tratamento de séries temporais, ideal para ambientes de observabilidade. Essa abordagem proporciona redução de até 90% no armazenamento de dados, acelera consultas em até 20 vezes e garante escalabilidade para operações multi-tenant. Além disso, contribui diretamente para a diminuição dos custos com infraestrutura e backup.Essa arquitetura alia alta performance a economia.
  • Deploy do Zabbix  distribuído com configurações de segurança avançadas (Frontend em MicroK8s para segmentação e otimização de recursos, proxy reverso e MFA com Cisco Duo).
  • Deploy do Prometheus e configuração otimizada com Alertmanager.
  • Deploy e configuração do Loki para centralização, análise e padronização dos logs "brutos" do Zabbix enviados ao Grafana. São boas práticas oficiais do Grafana Labs (Empresa), com intuito em criações de dashboards com dados de qualidade e confiáveis, evitando "ruídos" nos gráficos.
  • Deploy do Grafana e configuração otimizada com a integração do Loki em conjunto com o Alloy para logs e do Prometheus para métricas.
  • Deploy e setup do Ansible integrado ao AWX, para automação IaC de forma remota via API acionados no Zabbix.

Fase 2: Transição Gradual para Nova Arquitetura em Stack

Junho / Outubro 2025

  • Aprimoramento do Helpdesk/GLPI com automações na triagem de tickets, base de conhecimento integrada, alertas inteligentes e dashboards em tempo real no Grafana. Utilizaremos plugins nativos, APIs, Webhooks e ferramentas low-code/no-code para automatizar fluxos e garantir métricas estruturadas e maior confiabilidade operacional.
  • Plano de transição gradual dos clientes para a nova arquitetura com o Zabbix distribuído, totalmente integrado ao seu stack de tecnologias, agregando valor ao serviço.
  • Início das transições com monitoramento constante, validações exaustivas, ajustes finos, acompanhados de análises proativas para mitigação de riscos. Todo o processo será documentado de forma rotineira, registrando resultados alcançados e também lições aprendidas a partir de falhas não previstas.
  • Início das automações em produção para resoluções de incidentes simples e de forma gradual, monitorando, documentando e aumentando a complexidade dos playbooks com muita prudência.

Fase 3: Incremento no Stack com Ciberseguraça e Diretrizes Internas

 Junho / Outubro 2025

  • Deploy e configuração do Wazuh, SIEM/XDR, com integração nativa à matriz MITRE ATT&CK e ao VirusTotal. Oferece detecção avançada de ameaças, melhora significativamente os processos de resposta a incidentes de cibersegurança e fortalece a visibilidade sobre comportamentos maliciosos em tempo real, com capacidade analítica ampliada.
  • Deploy e configuração do Graylog voltado para cibersegurança, com foco no enriquecimento de logs, correlação de eventos e auditoria contínua. A solução centraliza a análise contextual e apoia investigações forenses com agilidade e precisão. Em conjunto com o Wazuh, forma um stack complementar de segurança. Ambos atuam como SIEMs, mas com abordagens técnicas distintas que se reforçam mutuamente.
  • Propostas para elaboração de Diretrizes Internas de Segurança da Informação, buscando se adequar a normas e frameworks já consolidados. 
  • Operação e Arquitetura de Observablidade Zero-Trust.

Fase 4: IA & Automação Avançada (Nossa Meta)

Novembro 2025 / Março 2026
  • SOAR, IA e Machine Learning para predição de incidentes.
  • Auto-resolução inteligente de 70-80% dos chamados.
  • Análise preditiva de capacidade e performance.
  • Implantação gradual de práticas CI/CD para entregas automatizadas, seguras e contínuas.
  • Dashboards no Grafana, voltados para Governança em TI e relatórios executivos automatizados com insights.

Fase 5: Transição do NOC ou Integração do SOC (Nossa Meta)

Q2 2026
  • Avaliação contínua do nosso grau de maturidade para verificar se atingimos os níveis esperados de eficiência operacional, identificando oportunidades de melhoria e consolidando práticas eficazes.
  • APM (Application Performance Monitoring) no Stack de Observabilidade.
  • Security Operations Center (SOC) em processo de transição ou integração ao NOC.
  • ROI e métricas de valor comercial bem consolidadas.

🏗ïļ Arquitetura Modular do Stack de Observabilidade com Foco em Cibersegurança e Escalabilidade Horizontal

🔍 Detecção

Zabbix Distribuído, Preparado para Escalablidade Muti-Tenant
Monitoramento de infraestrutura, aplicações e serviços.

📊 Métricas e Alertas

Prometheus com Alertmanager
Coleta e armazenamento de métricas aprofundadas de aplicações web, Kubernetes, microsserviços e multi-cloud em tempo real.

📝 Análise de Logs

Loki com Alloy
Centralização, análise e padronização de logs  "brutos'. Sem necessidade de utilização alta de recursos, RAM e arnazenamento.

📈 Visualização em Tempo Real de Vários Dashboards

Grafana
Dashboards e alertas visuais integrados com ingestão de logs esrututurados,

ðŸĪ– Automação

Ansible/AWX
A solução utiliza Playbooks de IaC acionados automaticamente via API REST pelas triggers do Zabbix. Ao detectar incidentes como falhas ou degradação de performance, o sistema executa correções imediatas, como reinício de serviços ou ajustes de configuração.

ðŸŽŊ Resolução

Auto-Healing com SOAR, ML/IA
Análise Preditiva, antes do incidente ocorrer e correção sem intervenção humana. Com a integraçao de um SOAR correlacionado a ML/IA. incrementantado ao Stack, é completamente viável essa automação.

🔒 Cibersegurança

SIEM Moderno
Integração do Wazuh com o Graylog para ampliar a visibilidade de segurança, aprimorar o diagnóstico de possíveis vulnerabilidades nos ambientes dos clientes e agregar valor ao serviço prestado.

⚡ Banco de Dados Otimizado ao Máximo

Porque PostgreSQL + TimescaleDB?
O TimescaleDB é uma extensão do PostgreSQL que o torna ideal para dados de séries temporais, como logs, métricas e monitoramento. Na prática: até 90% de redução no tamanho do banco e consultas até 20x mais rápidas.

Redução Downtime
Diminuição significativa em tempo de indisponibilidade através de monitoramento proativo e automação de resposta.
MTTR Reduzido
Tempo médio de resolução drasticamente reduzido através de automação e inteligência preditiva.
SLA
Garantido
Garantia de disponibilidade através de monitoramento 24/7 e resposta automatizada.
Economia Anual
ROI através de prevenção de falhas, otimização de recursos e redução de custos operacionais