
Site Reliability Engineer
Feedzaihá mais de um mês
- Remoto
- Tempo inteiro
- Intermédio
Descrição
Feedzai está à procura de um Site Reliability Engineer para integrar a equipa de Platform Engineering Performance & Reliability. Nesta posição, será responsável por otimizar sistemas existentes, construir infraestrutura e eliminar trabalho através de automação. Trabalhará com sistemas distribuídos de alta performance que operam 24/7 com latências ultra-baixas, enfrentando desafios únicos de escala relacionados com a missão de detecção de fraude da Feedzai.
No seu dia a dia, fornecerá recomendações sobre alocação de capacidade, colaborará com equipas de produto para melhorar a performance e fiabilidade dos sistemas, desenvolvará em Go ou Python, automatizará infraestrutura cloud e resposta a incidentes, e participará em investigações de causa raiz. Terá a oportunidade de trabalhar com engenheiros talentosos em análise de complexidade e design de sistemas em larga escala, desenvolvendo a automação, ferramentas e plataformas que suportam o serviço cloud de topo da Feedzai.
Esta é uma posição remota que oferece um ambiente rápido, seguro e colaborativo que encoraja aprendizagem contínua e descoberta de potencial. Será imerso na marca Feedzai com treino, conexões e tempo individual com o seu gestor durante os primeiros 30 dias.
Competências
- Go
- Python
- Estruturas de dados
- Algoritmos
- Desenho assíncrono e multi-thread
- Serviços cloud escaláveis
- Sistemas distribuídos
- Ambientes de produção
- Infraestrutura como código
- Monitorização e observabilidade
- Grafana
- Prometheus
- Kubernetes
- AWS
- GCP
- Hashicorp
- Resposta a incidentes
- Análise de causa raiz
- Comunicação escrita e verbal
Responsabilidades
- Fornecer recomendações sobre alocação de capacidade considerando custo, resiliência e performance
- Colaborar com equipas de produto para apoiar melhores práticas e impulsionar melhorias na performance e fiabilidade dos sistemas
- Desenvolvimento com Go, Python ou linguagens similares
- Automatizar todos os aspetos da infraestrutura cloud e resposta a incidentes
- Desenvolver playbooks relacionados com alertas acionáveis
- Participar em resposta a incidentes, investigação de causa raiz e resolução
- Manter e desenvolver infraestrutura como código para gerir e operar operações de ciclo de vida end-to-end em ambientes de produção
- Utilizar experiência e capacidades de resolução de problemas para ajudar a prevenir e investigar problemas de produção
Benefícios
- Ambiente seguro, aberto e colaborativo
- Aprendizagem contínua
- Treino e onboarding durante os primeiros 30 dias
- Suporte através da jornada Feedzai
- Acesso a informações, história e contexto sobre a empresa
Empregos semelhantes
