Analista Pleno De Observabilidade E Operações De Ia

Há 6 dias

Arapongas, Paraná, Brasil Vertis Solutions Tempo integral R$ 120.000 - R$ 180.000 Contrato

Analista Pleno de Observabilidade e Operações de IA (AIOps) Vertis Solutions arapongas, estado do paraná, BR

Descrição da vaga

Missão da posição

Atuar na sustentação e monitoração de soluções de IA e automação utilizadas em ambientes operacionais, garantindo disponibilidade, desempenho, qualidade e confiabilidade dos serviços. O profissional será responsável por acompanhar o funcionamento dos fluxos de automação, identificar falhas, apoiar a resolução de incidentes e contribuir para a evolução contínua das práticas de observabilidade e operação.

Principais responsabilidades

  • - Operação e Sustentação - Monitorar aplicações, serviços e componentes utilizados pelas soluções de IA e automação.
  • - Atuar na análise e resolução de incidentes operacionais.
  • - Investigar falhas de integração, comunicação entre sistemas, APIs e fontes de dados.
  • - Acompanhar logs, métricas, alertas e indicadores de desempenho.
  • - Executar procedimentos operacionais de recuperação, restart e validação dos serviços.
  • - Documentar ocorrências, soluções e procedimentos operacionais.
  • - Observabilidade - Analisar logs, traces e métricas para identificação de problemas.
  • - Apoiar a criação e manutenção de dashboards e alertas.
  • - Monitorar indicadores de disponibilidade, latência, taxa de erro e utilização dos serviços.
  • - Apoiar iniciativas de melhoria da observabilidade das aplicações.
  • - Participar de análises de causa raiz de incidentes.
  • - Suporte às Soluções de IA - Apoiar a investigação de comportamentos inesperados em aplicações que utilizam IA Generativa.
  • - Identificar se uma ocorrência está relacionada a dados, integração, configuração ou comportamento do modelo.
  • - Reproduzir cenários reportados pelos usuários e registrar evidências.
  • - Trabalhar em conjunto com equipes de desenvolvimento, dados e infraestrutura na resolução dos problemas.
  • - Melhoria Contínua - Identificar oportunidades de automação operacional.
  • - Criar scripts simples de diagnóstico e apoio à operação.
  • - Contribuir para melhoria da confiabilidade e desempenho dos serviços.
  • - Participar de revisões pós-incidente e definição de ações preventivas.

Conhecimentos técnicos obrigatórios

Infraestrutura e Plataforma

  • - Linux
  • - Containers Docker
  • - Conceitos de Kubernetes ou OpenShift
  • - APIs REST e JSON
  • - Git
  • - Conhecimento básico de CI/CD

Observabilidade

Experiência com pelo menos algumas das ferramentas abaixo:

  • - Grafana
  • - Prometheus
  • - Elastic / Kibana
  • - OpenTelemetry
  • - Jaeger

Desenvolvimento e Automação

  • - Python para automação e troubleshooting
  • - SQL
  • - Shell Script
  • - Testes e validação de APIs

IA e Automação

  • - IA Generativa
  • - LLMs
  • - Conceitos de prompts
  • - RAG (desejável)
  • - Tool Calling (desejável)

Conhecimentos desejáveis

  • - OpenShift
  • - Langfuse
  • - LangChain ou LangGraph
  • - MCP (Model Context Protocol)
  • - PostgreSQL
  • - Kafka
  • - Airflow
  • - Ambientes de telecomunicações
  • - Processos ITIL
  • - Monitoramento de aplicações distribuídas

Competências comportamentais

Buscamos uma pessoa com perfil investigativo e proativo, capaz de atuar em ambientes dinâmicos e colaborativos.

Competências desejadas

  • - Capacidade analítica
  • - Facilidade para troubleshooting
  • - Organização
  • - Comunicação clara
  • - Trabalho em equipe
  • - Senso de prioridade
  • - Responsabilidade operacional
  • - Curiosidade e interesse por novas tecnologias

Formação

  • - Ciência da Computação
  • - Sistemas de Informação
  • - Engenharia da Computação
  • - Engenharia de Telecomunicações
  • - Análise e Desenvolvimento de Sistemas
  • - Áreas correlatas

Experiência desejada

  • - Entre 2 e 4 anos em sustentação de aplicações, observabilidade, DevOps, NOC avançado, SRE júnior ou operações de TI.
  • - Experiência com ambientes Linux e aplicações em produção.
  • - Vivência com monitoramento, análise de incidentes e troubleshooting.
  • - Diferencial ter atuado em projetos de IA Generativa ou automação inteligente.