Pular para o conteúdo principal

Pessoa Engenheira de Dados Sênior

Descrição da vaga

A Caju é uma empresa brasileira de tecnologia, que busca dar mais sabor à vida profissional, transformando a relação entre empresas e colaboradores por meio de soluções mais inovadoras e seguras como o Cartão Multi Benefícios, Solução em Despesas Corporativas, Premiações e Caju Ciclos.

Aqui na Caju, aprendemos sempre, e nos tornamos cada vez melhores em um ambiente colaborativo e divertido!

São muito bem-vindas candidaturas de pessoas negras/pretas, mulheres, indígenas, LGBTQIA+, ou outros grupos minorizados.

Inscreva-se e conheça mais sobre nosso time 🧡

Responsabilidades e atribuições

  • Integração, Ingestão e Orquestração Multi-Source: Projetar e manter pipelines de integração heterogênea utilizando ferramentas como Apache Airflow, Dagster, Airbyte, AWS DMS, DBT, Kubernetes, APIs REST, SFTP e conectores diversos para ingestão contínua.
  • Otimização de Performance, I/O e Custo (AWS & Databricks): Aplicar técnicas avançadas de particionamento, indexação (Z-Ordering/Liquid Clustering), otimização de layout de arquivos e estratégias de escrita/leitura no Amazon S3, Databricks e dbt, visando eliminar varreduras excessivas (full table scans), diminuir custos de requisições S3 (GET/LIST) e acelerar o consumo de consultas.
  • Arquitetura Event-Driven & Streaming: Projetar e implementar ingestão de dados em tempo real por tópicos e eventos (ex: Apache Kafka, AWS Kinesis, Event Hubs), eliminando a dependência direta de consultas e cargas massivas em bancos relacionais (PostgreSQL, MySQL).
  • Automação de Engenharia com IA: Implementar ferramentas, agentes e pipelines de GenAI/LLMs para automatizar tarefas operacionais da engenharia (ex: geração automática de documentação, pipelines, data quality checks, tradução/refatoração de SQL, análise de causa raiz de falhas, PRs).
  • Pipelines End-to-End e Modelagem: Projetar, construir e manter pipelines robustos, aplicando modelagem dimensional e arquitetura Medallion para entregar dados limpos, agregados e otimizados tanto no processo de ingestão quanto no de consumo.
  • Governança, Segurança e Qualidade: Garantir compliance (LGPD/GDPR), mascaramento de dados sensíveis, lineage, controle de acesso granular e monitoramento proativo de data freshness e data quality.
  • Alinhamento e Documentação: Realizar levantamento de necessidades junto às áreas de negócio, documentar arquiteturas, definir data contracts e assegurar a governança e manutenibilidade dos pipelines.

Requisitos e qualificações

  • Tempo de Experiência: Experiência sólida em engenharia de dados, atuando em ambientes de produção de grande volume e alta criticidade.
  • Otimização de I/O, Particionamento e Performance: Domínio prático de estratégias de particionamento, otimização de layouts de dados (Small File Problem, compactação, Z-Ordering) e otimização de consultas para prevenir leituras excessivas no Amazon S3 e garantir baixo tempo de resposta no Databricks e dbt.
  • Orquestração e Ingestão Heterogênea: Experiência prática na integração e orquestração de dados utilizando Airflow, Dagster, Airbyte, AWS DMS, dbt, Kubernetes, APIs REST, SFTP e conectores customizados.
  • Event-Driven & Ingestão por Tópicos: Vivência prática na arquitetura de ingestão baseada em eventos/tópicos (Kafka, Kinesis, Pulsar, RabbitMQ) para substituir a dependência de bancos relacionais.
  • Stack Principal: Domínio avançado de PythonPySpark e SQL otimizado para processamento massivo e distribuído.
  • Plataforma Databricks & Lakehouse: Experiência profunda no ecossistema Databricks (Delta Lake, Auto Loader, Structured Streaming, Jobs/Workflows, Medallion Architecture).
  • Nuvem AWS: Vivência em serviços AWS voltados a dados (S3, IAM, Redshift, DynamoDB, Data Catalog, AWS DMS).
  • Automação com IA: Conhecimento prático ou forte interesse em utilizar ferramentas/LLMs para automação de tarefas de desenvolvimento e engenharia de dados.
  • Engenharia de Software: Vivência com testes automatizados, controle de versão (Git/GitHub), revisão de PRs e pipelines de CI/CD.
  • Modelagem e Governança: Domínio em modelagem de dados (Dimensional, Star/Snowflake) e diretrizes de segurança e privacidade (LGPD/GDPR).

Diferenciais:

  • IA/GenAI para Dados: Experiência com pipelines para suporte a IA (ingestão, chunking e embeddings para Vector Search, Feature Stores, governança via Unity Catalog).
  • Governança Avançada & IaC: Experiência com Unity Catalog, Terraform e Databricks Asset Bundles (DAB).
  • Data Contracts & Data Quality: Implementação de contratos de dados na origem e uso de frameworks de qualidade/observabilidade (Great Expectations, Soda, dbt tests, Datadog).
  • FinOps e Observabilidade: Gestão proativa e alertas de anomalias de custos em nuvem/Databricks por tabela e pipeline, alinhada à detecção estatística de data drift.
  • Pipelines Financeiros: Vivência em idempotência, conciliação de saldos e reprocessamento financeiro.
  • Setores Regulados: Experiência prévia em ambientes fintech, meios de pagamento ou saúde, lidando com compliance e auditorias de dados.

Informações adicionais

💳 Cartão Caju, com mais liberdade para usar seus benefícios (Refeição, Alimentação, Mobilidade, Saúde, Home Office, Cultura e Educação);

🏥 Plano de Saúde sem coparticipação (Unimed, Sulamerica ou Alice);

🧘🏿‍♀️ Zenklub, com consultas onlines com terapeutas e coaches para cuidar da sua saúde mental;

🏋🏿‍♀️ Wellhub;

🗣️ Aqui também estimulamos o aprendizado de idiomas, com a parceria da Rosetta Stone;

💆🏽 Dia de recarregar - day off; 

🧑🏿‍⚕️ Conexa Saúde - consulta médica online;

👶🏿 Auxílio Creche;

📚 Parceria com Alura;

👨🏿‍💻 Trabalho Remoto, para você trabalhar de onde quiser dentro do Brasil;

💻 Oferecemos equipamento de trabalho;

🚀 Muitas possibilidades de crescimento - temos muito a crescer e esperamos fortemente que você nos ajude com isso!


A Caju é uma empresa brasileira e aceita pessoas de todas as regiões do país.

Trabalhamos em um modelo 100% remoto(quem tiver interesse de conhecer ou trabalhar no escritório, localizado em São Paulo, estaremos de portas abertas)


Se interessou? #VemSerCaju 🧡

Etapas do processo

  1. Etapa 1: Cadastro
  2. Etapa 2: Entrevista com GG
  3. Etapa 3: Entrevista com Liderança
  4. Etapa 4: Case Caju
  5. Etapa 5: Proposta
  6. Etapa 6: Contratação

Prazer, nós somos a Caju

Caju é uma empresa de tecnologia, fruto do empreendedorismo brasileiro, criada para transformar a relação entre empresas e colaboradores, com soluções inovadoras e flexíveis.

Desenvolvemos uma plataforma para que as empresas possam fazer a gestão de diversas soluções no mesmo lugar, e para os colabores um único cartão com diversas possibilidades. 


Nossos Produtos: 

Cartão Multibenefícios: Solução para a gestão de até 8 categorias, no mesmo cartão Caju bandeira Visa. Ele conta com um aplicativo fácil de usar para o colaborador, e uma plataforma intuitiva para o RH gerenciar todo o serviço.

Caju Despesas: Fluxo de adiantamento mais ágil, gestão de gastos corporativos (viagens, material de escritório, serviços terceirizados, e outras despesas do dia a dia) e cartões Caju vinculados. Tudo na mesma plataforma.. Adeus reembolso, olá facilidade no bolso!

Caju Premiações: É a solução para presentear as pessoas colaboradoras com um saldo extra no cartão, em uma carteira específica.

Caju Ciclos: Acompanhamento da jornada do colaborador de ponta a ponta, em uma única plataforma para admissão e gestão de dados.

Caju Mais: Para empresas que querem melhorar a saúde e bem-estar dos seus colaboradores, em parceria com a Gympass, Conexa Saúde e Psicologia Viva.

Feirinha da Caju: Ofertas exclusivas e cupons nas lojas parceiras da Caju para a pessoa colaboradora e para RH.


Temos sonhos grandes aqui dentro, e temos orgulho de ter raízes espalhadas por várias partes do Brasil e pessoas que nutrem e colhem frutos com um gostinho único, que só a gente tem.


🆘Está com dificuldade para realizar a inscrição ou qualquer outro problema com a plataforma da Gupy? Acesse o suporte aqui.


Que tal construir junto o nosso cajueiro?

#VemProCajueiro 🧡