Descrição da vaga

Texto agregado para leitura rápida. Confira sempre a fonte original ao enviar a candidatura.

A Caju é uma empresa brasileira de tecnologia, que busca dar mais sabor à vida profissional, transformando a relação entre empresas e colaboradores por meio de soluções mais inovadoras e seguras como o Cartão Multi Benefícios, Solução em Despesas Corporativas, Premiações e Caju Ciclos.

Aqui na Caju, aprendemos sempre, e nos tornamos cada vez melhores em um ambiente colaborativo e divertido!

São muito bem-vindas candidaturas de pessoas negras/pretas, mulheres, indígenas, LGBTQIA+, ou outros grupos minorizados.

Inscreva-se e conheça mais sobre nosso time 🧡

Responsabilidades e atribuições

  • Integração, Ingestão e Orquestração Multi-Source: Projetar e manter pipelines de integração heterogênea utilizando ferramentas como Apache Airflow, Dagster, Airbyte, AWS DMS, DBT, Kubernetes, APIs REST, SFTP e conectores diversos para ingestão contínua.
  • Otimização de Performance, I/O e Custo (AWS & Databricks): Aplicar técnicas avançadas de particionamento, indexação (Z-Ordering/Liquid Clustering), otimização de layout de arquivos e estratégias de escrita/leitura no Amazon S3, Databricks e dbt, visando eliminar varreduras excessivas (full table scans), diminuir custos de requisições S3 (GET/LIST) e acelerar o consumo de consultas.
  • Arquitetura Event-Driven & Streaming: Projetar e implementar ingestão de dados em tempo real por tópicos e eventos (ex: Apache Kafka, AWS Kinesis, Event Hubs), eliminando a dependência direta de consultas e cargas massivas em bancos relacionais (PostgreSQL, MySQL).
  • Automação de Engenharia com IA: Implementar ferramentas, agentes e pipelines de GenAI/LLMs para automatizar tarefas operacionais da engenharia (ex: geração automática de documentação, pipelines, data quality checks, tradução/refatoração de SQL, análise de causa raiz de falhas, PRs).
  • Pipelines End-to-End e Modelagem: Projetar, construir e manter pipelines robustos, aplicando modelagem dimensional e arquitetura Medallion para entregar dados limpos, agregados e otimizados tanto no processo de ingestão quanto no de consumo.
  • Governança, Segurança e Qualidade: Garantir compliance (LGPD/GDPR), mascaramento de dados sensíveis, lineage, controle de acesso granular e monitoramento proativo de data freshness e data quality.
  • Alinhamento e Documentação: Realizar levantamento de necessidades junto às áreas de negócio, documentar arquiteturas, definir data contracts e assegurar a governança e manutenibilidade dos pipelines.


Requisitos e qualificações

  • Tempo de Experiência: Experiência sólida em engenharia de dados, atuando em ambientes de produção de grande volume e alta criticidade.
  • Otimização de I/O, Particionamento e Performance: Domínio prático de estratégias de particionamento, otimização de layouts de dados (Small File Problem, compactação, Z-Ordering) e otimização de consultas para prevenir leituras excessivas no Amazon S3 e garantir baixo tempo de resposta no Databricks e dbt.
  • Orquestração e Ingestão Heterogênea: Experiência prática na integração e orquestração de dados utilizando Airflow, Dagster, Airbyte, AWS DMS, dbt, Kubernetes, APIs REST, SFTP e conectores customizados.
  • Event-Driven & Ingestão por Tópicos: Vivência prática na arquitetura de ingestão baseada em eventos/tópicos (Kafka, Kinesis, Pulsar, RabbitMQ) para substituir a dependência de bancos relacionais.
  • Stack Principal: Domínio avançado de Python, PySpark e SQL otimizado para processamento massivo e distribuído.
  • Plataforma Databricks & Lakehouse: Experiência profunda no ecossistema Databricks (Delta Lake, Auto Loader, Structured Streaming, Jobs/Workflows, Medallion Architecture).
  • Nuvem AWS: Vivência em serviços AWS voltados a dados (S3, IAM, Redshift, DynamoDB, Data Catalog, AWS DMS).
  • Automação com IA: Conhecimento prático ou forte interesse em utilizar ferramentas/LLMs para automação de tarefas de desenvolvimento e engenharia de dados.
  • Engenharia de Software: Vivência com testes automatizados, controle de versão (Git/GitHub), revisão de PRs e pipelines de CI/CD.
  • Modelagem e Governança: Domínio em modelagem de dados (Dimensional, Star/Snowflake) e diretrizes de segurança e privacidade (LGPD/GDPR).


Diferenciais:

  • IA/GenAI para Dados: Experiência com pipelines para suporte a IA (ingestão, chunking e embeddings para Vector Search, Feature Stores, governança via Unity Catalog).
  • Governança Avançada & IaC: Experiência com Unity Catalog, Terraform e Databricks Asset Bundles (DAB).
  • Data Contracts & Data Quality: Implementação de contratos de dados na origem e uso de frameworks de qualidade/observabilidade (Great Expectations, Soda, dbt tests, Datadog).
  • FinOps e Observabilidade: Gestão proativa e alertas de anomalias de custos em nuvem/Databricks por tabela e pipeline, alinhada à detecção estatística de data drift.
  • Pipelines Financeiros: Vivência em idempotência, conciliação de saldos e reprocessamento financeiro.
  • Setores Regulados: Experiência prévia em ambientes fintech, meios de pagamento ou saúde, lidando com compliance e auditorias de dados.


Informações adicionais

💳 Cartão Caju, com mais liberdade para usar seus benefícios (Refeição, Alimentação, Mobilidade, Saúde, Home Office, Cultura e Educação);

🏥 Plano de Saúde sem coparticipação (Unimed, Sulamerica ou Alice);

🧘🏿‍♀️ Zenklub, com consultas onlines com terapeutas e coaches para cuidar da sua saúde mental;

🏋🏿‍♀️ Wellhub;

🗣️ Aqui também estimulamos o aprendizado de idiomas, com a parceria da Rosetta Stone;

💆🏽 Dia de recarregar - day off;

🧑🏿‍⚕️ Conexa Saúde - consulta médica online;

👶🏿 Auxílio Creche;

📚 Parceria com Alura;

👨🏿‍💻 Trabalho Remoto, para você trabalhar de onde quiser dentro do Brasil;

💻 Oferecemos equipamento de trabalho;

🚀 Muitas possibilidades de crescimento - temos muito a crescer e esperamos fortemente que você nos ajude com isso!

A Caju é uma empresa brasileira e aceita pessoas de todas as regiões do país.

Trabalhamos em um modelo 100% remoto(quem tiver interesse de conhecer ou trabalhar no escritório, localizado em São Paulo, estaremos de portas abertas)

Se interessou? #VemSerCaju 🧡

Vagas relacionadas

Seleção por stack em comum com esta oportunidade

Remoto LinkedIn

IT Analyst III (Java)

F1RST Digital Services • São Paulo • 25 candidaturas Hoje

Salário estimado

R$ 9k - 13k/mês

Pleno CLT

Country: Brazil# QUEM SOMOSA F1RST é o futuro e sua carreira está aqui! Nossa cultura é baseada em “Pessoas, Inovação e Resultados”. Aqui promovemos serviços e experiência para os mais de 60 milhões de clientes de todo o ecossistema Santander. Venha fazer parte do time que tem como propósito apoiar ...

Ver Detalhes →
Remoto LinkedIn

Sr Software Engineer, Frontend (Web)

Uber • São Paulo • 25 candidaturas Hoje

Salário estimado

R$ 15k - 23k/mês

Sênior CLT

About The Role Please note: this hybrid position is based in São Paulo or Rio de Janeiro, Brazil - welcoming both local professionals and those open to relocating. At Uber, Frontend Engineers build web experiences that power the way people move and receive things around the world. As part of our eng...

Ver Detalhes →
LinkedIn Hot

Desenvolvedor de back end

MBRAS • São Paulo • 25 candidaturas Hoje

Salário estimado

R$ 14k - 22k/mês

Sênior CLT

Sobre a EmpresaMBRAS é referência no mercado imobiliário de alto padrão em São Paulo. Estamos construindo internamente as plataformas que sustentam nossa operação — dos sistemas de gestão de portfólio às experiências digitais que conectam clientes aos imóveis mais exclusivos da cidade.Sobre o PapelP...

Ver Detalhes →