Pessoa Engenheira de Dados Sênior
Descrição da vaga
A Caju é uma empresa brasileira de tecnologia, que busca dar mais sabor à vida profissional, transformando a relação entre empresas e colaboradores por meio de soluções mais inovadoras e seguras como o Cartão Multi Benefícios, Solução em Despesas Corporativas, Premiações e Caju Ciclos.
Aqui na Caju, aprendemos sempre, e nos tornamos cada vez melhores em um ambiente colaborativo e divertido!
São muito bem-vindas candidaturas de pessoas negras/pretas, mulheres, indígenas, LGBTQIA+, ou outros grupos minorizados.
Inscreva-se e conheça mais sobre nosso time 🧡
Responsabilidades e atribuições
- Integração, Ingestão e Orquestração Multi-Source: Projetar e manter pipelines de integração heterogênea utilizando ferramentas como Apache Airflow, Dagster, Airbyte, AWS DMS, DBT, Kubernetes, APIs REST, SFTP e conectores diversos para ingestão contínua.
- Otimização de Performance, I/O e Custo (AWS & Databricks): Aplicar técnicas avançadas de particionamento, indexação (Z-Ordering/Liquid Clustering), otimização de layout de arquivos e estratégias de escrita/leitura no Amazon S3, Databricks e dbt, visando eliminar varreduras excessivas (full table scans), diminuir custos de requisições S3 (GET/LIST) e acelerar o consumo de consultas.
- Arquitetura Event-Driven & Streaming: Projetar e implementar ingestão de dados em tempo real por tópicos e eventos (ex: Apache Kafka, AWS Kinesis, Event Hubs), eliminando a dependência direta de consultas e cargas massivas em bancos relacionais (PostgreSQL, MySQL).
- Automação de Engenharia com IA: Implementar ferramentas, agentes e pipelines de GenAI/LLMs para automatizar tarefas operacionais da engenharia (ex: geração automática de documentação, pipelines, data quality checks, tradução/refatoração de SQL, análise de causa raiz de falhas, PRs).
- Pipelines End-to-End e Modelagem: Projetar, construir e manter pipelines robustos, aplicando modelagem dimensional e arquitetura Medallion para entregar dados limpos, agregados e otimizados tanto no processo de ingestão quanto no de consumo.
- Governança, Segurança e Qualidade: Garantir compliance (LGPD/GDPR), mascaramento de dados sensíveis, lineage, controle de acesso granular e monitoramento proativo de data freshness e data quality.
- Alinhamento e Documentação: Realizar levantamento de necessidades junto às áreas de negócio, documentar arquiteturas, definir data contracts e assegurar a governança e manutenibilidade dos pipelines.
Requisitos e qualificações
- Tempo de Experiência: Experiência sólida em engenharia de dados, atuando em ambientes de produção de grande volume e alta criticidade.
- Otimização de I/O, Particionamento e Performance: Domínio prático de estratégias de particionamento, otimização de layouts de dados (Small File Problem, compactação, Z-Ordering) e otimização de consultas para prevenir leituras excessivas no Amazon S3 e garantir baixo tempo de resposta no Databricks e dbt.
- Orquestração e Ingestão Heterogênea: Experiência prática na integração e orquestração de dados utilizando Airflow, Dagster, Airbyte, AWS DMS, dbt, Kubernetes, APIs REST, SFTP e conectores customizados.
- Event-Driven & Ingestão por Tópicos: Vivência prática na arquitetura de ingestão baseada em eventos/tópicos (Kafka, Kinesis, Pulsar, RabbitMQ) para substituir a dependência de bancos relacionais.
- Stack Principal: Domínio avançado de Python, PySpark e SQL otimizado para processamento massivo e distribuído.
- Plataforma Databricks & Lakehouse: Experiência profunda no ecossistema Databricks (Delta Lake, Auto Loader, Structured Streaming, Jobs/Workflows, Medallion Architecture).
- Nuvem AWS: Vivência em serviços AWS voltados a dados (S3, IAM, Redshift, DynamoDB, Data Catalog, AWS DMS).
- Automação com IA: Conhecimento prático ou forte interesse em utilizar ferramentas/LLMs para automação de tarefas de desenvolvimento e engenharia de dados.
- Engenharia de Software: Vivência com testes automatizados, controle de versão (Git/GitHub), revisão de PRs e pipelines de CI/CD.
- Modelagem e Governança: Domínio em modelagem de dados (Dimensional, Star/Snowflake) e diretrizes de segurança e privacidade (LGPD/GDPR).
Diferenciais:
- IA/GenAI para Dados: Experiência com pipelines para suporte a IA (ingestão, chunking e embeddings para Vector Search, Feature Stores, governança via Unity Catalog).
- Governança Avançada & IaC: Experiência com Unity Catalog, Terraform e Databricks Asset Bundles (DAB).
- Data Contracts & Data Quality: Implementação de contratos de dados na origem e uso de frameworks de qualidade/observabilidade (Great Expectations, Soda, dbt tests, Datadog).
- FinOps e Observabilidade: Gestão proativa e alertas de anomalias de custos em nuvem/Databricks por tabela e pipeline, alinhada à detecção estatística de data drift.
- Pipelines Financeiros: Vivência em idempotência, conciliação de saldos e reprocessamento financeiro.
- Setores Regulados: Experiência prévia em ambientes fintech, meios de pagamento ou saúde, lidando com compliance e auditorias de dados.
Informações adicionais
💳 Cartão Caju, com mais liberdade para usar seus benefícios (Refeição, Alimentação, Mobilidade, Saúde, Home Office, Cultura e Educação);
🏥 Plano de Saúde sem coparticipação (Unimed, Sulamerica ou Alice);
🧘🏿♀️ Zenklub, com consultas onlines com terapeutas e coaches para cuidar da sua saúde mental;
🏋🏿♀️ Wellhub;
🗣️ Aqui também estimulamos o aprendizado de idiomas, com a parceria da Rosetta Stone;
💆🏽 Dia de recarregar - day off;
🧑🏿⚕️ Conexa Saúde - consulta médica online;
👶🏿 Auxílio Creche;
📚 Parceria com Alura;
👨🏿💻 Trabalho Remoto, para você trabalhar de onde quiser dentro do Brasil;
💻 Oferecemos equipamento de trabalho;
🚀 Muitas possibilidades de crescimento - temos muito a crescer e esperamos fortemente que você nos ajude com isso!
A Caju é uma empresa brasileira e aceita pessoas de todas as regiões do país.
Trabalhamos em um modelo 100% remoto(quem tiver interesse de conhecer ou trabalhar no escritório, localizado em São Paulo, estaremos de portas abertas)
Se interessou? #VemSerCaju 🧡
Etapas do processo
- Etapa 1: Cadastro
- Etapa 2: Entrevista com GG
- Etapa 3: Entrevista com Liderança
- Etapa 4: Case Caju
- Etapa 5: Proposta
- Etapa 6: Contratação
Prazer, nós somos a Caju
Caju é uma empresa de tecnologia, fruto do empreendedorismo brasileiro, criada para transformar a relação entre empresas e colaboradores, com soluções inovadoras e flexíveis.
Desenvolvemos uma plataforma para que as empresas possam fazer a gestão de diversas soluções no mesmo lugar, e para os colabores um único cartão com diversas possibilidades.
Nossos Produtos:
Cartão Multibenefícios: Solução para a gestão de até 8 categorias, no mesmo cartão Caju bandeira Visa. Ele conta com um aplicativo fácil de usar para o colaborador, e uma plataforma intuitiva para o RH gerenciar todo o serviço.
Caju Despesas: Fluxo de adiantamento mais ágil, gestão de gastos corporativos (viagens, material de escritório, serviços terceirizados, e outras despesas do dia a dia) e cartões Caju vinculados. Tudo na mesma plataforma.. Adeus reembolso, olá facilidade no bolso!
Caju Premiações: É a solução para presentear as pessoas colaboradoras com um saldo extra no cartão, em uma carteira específica.
Caju Ciclos: Acompanhamento da jornada do colaborador de ponta a ponta, em uma única plataforma para admissão e gestão de dados.
Caju Mais: Para empresas que querem melhorar a saúde e bem-estar dos seus colaboradores, em parceria com a Gympass, Conexa Saúde e Psicologia Viva.
Feirinha da Caju: Ofertas exclusivas e cupons nas lojas parceiras da Caju para a pessoa colaboradora e para RH.
Temos sonhos grandes aqui dentro, e temos orgulho de ter raízes espalhadas por várias partes do Brasil e pessoas que nutrem e colhem frutos com um gostinho único, que só a gente tem.
🆘Está com dificuldade para realizar a inscrição ou qualquer outro problema com a plataforma da Gupy? Acesse o suporte aqui.
Que tal construir junto o nosso cajueiro?
#VemProCajueiro 🧡
Conheça mais sobre nós