Resumo
Referência técnica de sustentação dentro do TI da TMB, em ambiente financeiro regulado. O time é enxuto e composto apenas por pessoas sêniores, sem camada de N1/N2: a triagem automatizada faz a classificação inicial e a pessoa assume o chamado do primeiro contato até a correção definitiva. Isso significa atender o solicitante, investigar causa raiz, corrigir dados e código, validar integrações e decidir o que precisa virar mudança estrutural. Não há rede de apoio abaixo, então a vaga exige autonomia real, julgamento sobre risco em produção e disciplina de registro. Cada pessoa do time é dona de um conjunto de domínios e responde por sua saúde operacional.
Responsabilidades e Atribuições
- Assumir chamados de sustentação de ponta a ponta, do contato com o solicitante até a entrega da correção, sem repasse intermediário
- Ser dona da saúde operacional de um conjunto de domínios do sistema: conhecer o comportamento normal, saber onde costuma quebrar e reduzir progressivamente o volume de incidentes daquela área
- Conduzir incidentes críticos em produção: coordenar o diagnóstico, decidir entre mitigação imediata e correção definitiva, comunicar impacto para negócio e liderança, e fechar com post-mortem e ações rastreadas
- Investigar causa raiz em cenários com evidência incompleta, correlacionando logs, payloads, comportamento de integração e estado de banco
- Escrever SQL de diagnóstico e correção em PostgreSQL/SQL Server, incluindo correções em massa com script reversível, transação controlada, evidência de antes/depois e validação posterior
- Depurar e corrigir defeitos em .NET/C# no legado e na plataforma nova, abrindo pull requests com teste que cubra a regressão
- Revisar os pull requests e as investigações dos pares, já que a revisão cruzada entre sêniores é o único controle de qualidade do time
- Analisar problemas de performance e concorrência: plano de execução, índice ausente, lock e deadlock, timeout, esgotamento de pool, jobs sobrepostos
- Construir e manter a observabilidade da sustentação: log estruturado com correlação, métricas por domínio e alertas acionáveis, com o objetivo de parar de descobrir incidente pelo chamado do usuário
- Garantir a confiabilidade das integrações e webhooks com parceiros: idempotência, política de retry, reprocessamento seguro e tratamento de divergência
- Alimentar e curar a base de conhecimento no Wiki (Azure DevOps) com qualidade suficiente para a triagem automatizada classificar e responder bem. A base é insumo de produto, não documentação de arquivo
- Automatizar o trabalho repetitivo (n8n, Power Automate, scripts, rotinas de reprocessamento) para que o time enxuto absorva o volume sem crescer proporcionalmente
- Analisar o backlog com dados, identificar os maiores ofensores de volume e esforço e negociar com as squads de produto a correção na origem, no lugar do contorno manual
- Trazer a visão de operabilidade para o desenho de novas funcionalidades: o que vai quebrar, como será monitorado e como será corrigido em produção
- Acionar squad dona, fornecedor ou parceiro externo no momento certo, com o diagnóstico já pronto
Requisitos e Qualificações
- Experiência em desenvolvimento e/ou sustentação de sistemas em produção, com pelo menos 2 anos de responsabilidade direta sobre ambiente crítico
- Histórico de atuação com autonomia, em time pequeno ou como único responsável técnico por uma área, sem depender de camada de filtro ou de escalonamento interno
- Condução comprovada de incidentes de alta severidade e de análise de causa raiz que resultou em correção estrutural
- Vivência com domínio financeiro (meios de pagamento, cobrança, conciliação) ou outro ambiente regulado e auditado
- Experiência com sistema legado e com contexto de coexistência ou migração entre plataformas
- Diferencial: ter atuado como ponte entre sustentação e times de produto, negociando priorização de dívida técnica
Competências Técnicas
Obrigatórias:
- SQL avançado em PostgreSQL e/ou SQL Server: JOINs complexos, CTE, window functions, leitura de plano de execução, estratégia de índice, níveis de isolamento, e manipulação de dados em produção com controle transacional e plano de reversão
- .NET/C# em profundidade: depuração de fluxo real, tratamento de exceção, assíncrono, e os problemas típicos de ORM/Entity Framework (N+1, tracking indevido, timeout, migração mal aplicada)
- Diagnóstico de performance e concorrência em aplicação e banco
- Integrações: REST, JSON, autenticação, webhooks, idempotência, retry com backoff, filas e mensageria, jobs agendados
- Observabilidade: log estruturado, correlação de requisição, métricas e definição de alerta útil
- Git com fluxo de branch e pull request, e prática consistente de code review
- Azure DevOps (Boards, Repos, Pipelines, Wiki)
- Segurança e compliance no acesso a dados de produção: mínimo privilégio, trilha de auditoria, cuidado com dado sensível e LGPD
Desejáveis:
- Cloud (Azure) e containers
- Ferramentas de BI e consulta analítica (Metabase, Power BI), incluindo governança de acesso
- Automação de fluxos (n8n, Power Automate)
- Testes automatizados e estratégia de deploy segura (feature flag, rollback, canary)
- Conhecimento de domínio financeiro: conciliação, boleto, PIX, cobrança, régua de renegociação
- Noções de IA aplicada a triagem e busca em base de conhecimento
Competências Comportamentais
- Ownership do problema até o fim, inclusive quando o escopo não é estritamente seu e o cliente interno está parado
- Autonomia real, com bom julgamento de quando decidir sozinha e quando trazer o Tech Lead ou a squad dona para a mesa
- Julgamento sob pressão: decidir com informação incompleta e escolher conscientemente entre estancar agora e corrigir certo
- Comunicação em dois registros: técnica com engenharia, e de impacto e risco com negócio e liderança, mantendo o solicitante informado sem precisar ser cobrado
- Influência sem autoridade formal, para conseguir que a correção definitiva entre no backlog da squad certa
- Disciplina de rastreabilidade: em ambiente regulado, o que não está registrado não aconteceu
- Disposição para compartilhar contexto com os pares, porque em time pequeno o conhecimento concentrado em uma pessoa vira risco operacional
- Perfil investigativo com paciência para o problema que não reproduz
Outros Requisitos
- Disponibilidade para trabalho 100% presencial em São José dos Campos/SP. (Requisito não flexível)
- Regime de contratação PJ. (Requisito não flexível)