Descrição da vaga

Texto agregado para leitura rápida. Confira sempre a fonte original ao enviar a candidatura.

Responsabilidades técnicas


1. Modelagem matemática, estatística e análise de dados

• Realizar análise exploratória, tratamento, avaliação de qualidade e visualização de dados, distinguindo os mecanismos de ausência de dados e seus impactos na análise.

• Desenvolver modelos matemáticos, estatísticos e probabilísticos.

• Desenvolver modelos de séries temporais, considerando tendência, sazonalidade, autocorrelação, diagnóstico de estacionariedade e validação por separação temporal.

• Aplicar inferência estatística e testes de hipóteses, com atenção a poder estatístico, erros do tipo I e II e correção para comparações múltiplas.

• Aplicar inferência causal, incluindo escore de propensão, diferenças em diferenças, variáveis instrumentais e controle sintético, explicitando as premissas de identificação e as condições que podem invalidá-las.

• Desenvolver modelos aplicados ao marketing e negócio, incluindo propensão, evasão de clientes (churn), valor do cliente ao longo do tempo (customer lifetime value), efeito incremental de tratamento (uplift), atribuição, segmentação e modelagem do mix de marketing (marketing mix modeling).

• Executar engenharia de atributos (feature engineering), seleção de variáveis, definição de métricas e estratégias de validação, com controle de vazamento de informação (data leakage) temporal e por identificador.

• Avaliar a incerteza, a estabilidade, o viés, a calibração e a capacidade de generalização dos modelos.

• Observar as obrigações da Lei Geral de Proteção de Dados relativas aos dados pessoais utilizados na modelagem, incluindo a base legal, a minimização e os limites ao trânsito de dados por meio de serviços de terceiros.


2. Inteligência artificial

• Aprendizado de máquina (machine learning): classificação, regressão, agrupamento (clustering), recomendação, ordenação (ranking), previsão e detecção de anomalias.

• Redes neurais e aprendizado profundo (deep learning): desenvolvimento, treinamento, ajuste e avaliação de arquiteturas neurais, incluindo diagnóstico de problemas de convergência.

• Processamento de linguagem natural: representação e classificação de textos, representações vetoriais (embeddings), recuperação de informação, análise semântica e extração de entidades nomeadas.

• Inteligência artificial generativa (arquiteturas): modelos de linguagem, geração aumentada por recuperação (retrieval-augmented generation), agentes e sistemas multiagentes.

• Inteligência artificial generativa (mecanismos): definição e encadeamento de ferramentas (tool use), engenharia de contexto e de instrução, projeto e controle dos ciclos de execução de agentes, incluindo critérios de parada, orçamento de iterações e tratamento de falhas em cadeia, integração por meio do protocolo de contexto de modelo (Model Context Protocol) e mitigação da injeção de instrução (prompt injection).

• Realizar seleção de modelos, otimização de hiperparâmetros, validação, análise de erros e comparação de desempenho, incluindo avaliação de saídas generativas sem referência única e separação entre falhas de recuperação e falhas de geração.


3. Implantação e monitoramento de modelos

• Implantar modelos de execução por lote e em linha, respeitando os requisitos acordados de latência, disponibilidade e custo.

• Monitorar o desempenho, a estabilidade e a qualidade das predições.

• Identificar desvio da distribuição dos dados (data drift), desvio da relação estatística (concept drift) e degradação do desempenho.

• Monitorar sistemas generativos quanto a regressões decorrentes de mudanças nos modelos de terceiros, alterações nas instruções, custo por chamada e taxa de respostas não fundamentadas.

• Definir métricas, limiares (thresholds), alertas e critérios de retreinamento.

• Comparar versões de modelos e manter rastreabilidade entre código, dados, parâmetros, modelos e resultados.

• Responder pela validação e atualização dos modelos em produção, dentro da fronteira de responsabilidade acordada com as áreas de infraestrutura e engenharia.


Habilidades técnicas

• Raciocínio matemático, estatístico e analítico, sustentado por fundamentos de álgebra linear, de otimização e de teoria da probabilidade.

• Inferência estatística formal, incluindo estimação, intervalos de confiança, testes de hipóteses, erros do tipo I e do tipo II e poder estatístico.

• Formulação e decomposição de problemas quantitativos em perguntas com métricas verificáveis e critérios objetivos de avaliação.

• Construção e avaliação de hipóteses, distinguindo claramente a análise exploratória da confirmatória.

• Desenho de experimentos e de estratégias de validação, considerando a unidade de aleatorização, o tamanho da amostra, a contaminação entre unidades, os critérios de parada e os riscos associados à interrupção antecipada.

• Interpretação crítica dos resultados e identificação de limitações metodológicas, incluindo a calibração de probabilidades e a análise de erros por subgrupos.

• Programação para análise de dados, computação científica e desenvolvimento de modelos, considerando o custo computacional e o uso de memória.

• Linguagens de consulta e manipulação de dados, incluindo junções, funções de janela, agregações e análise de eficiência de consultas.

• Uso de bibliotecas e arcabouços (frameworks) de computação científica, de modelagem estatística e de aprendizado de máquina.

• Uso de arcabouços para redes neurais e aprendizado profundo, incluindo diagnóstico de treinamento e otimização.

• Uso de ferramentas e arcabouços de processamento de linguagem natural e inteligência artificial generativa, incluindo fragmentação, indexação, recuperação, reordenação e avaliação de resultados.

• Visualização e comunicação de dados, resultados, incertezas e limitações metodológicas.

• Desenvolvimento de código modular, legível, testável e reprodutível, com testes automatizados, gestão de ambientes, dependências e versões.

• Documentação técnica de código, modelos, experimentos, premissas e decisões metodológicas em nível suficiente para reprodução por terceiros.

• Versionamento de código e colaboração em repositórios, incluindo ramificação, revisão de código e manutenção de um histórico legível.

• Computação em nuvem e arquiteturas de dados, incluindo data lake, data warehouse, particionamento e formatos colunares.

• Processamento distribuído de dados, considerando particionamento, movimentação de dados e custo de operações em grande volume.

• Automação e execução de rotinas, incluindo funções serverless e processamento orientado a eventos.

• Agendamento e orquestração de fluxos de processamento (pipelines), incluindo dependências entre tarefas, novas tentativas e reprocessamento.

• Rastreamento, versionamento e gestão de experimentos e modelos, mantendo vínculo entre código, dados, parâmetros, modelos e resultados.

• Revisão técnica de código, modelos, experimentos e metodologias.


Exemplos de tecnologias e ferramentas

A relação abaixo é apenas indicativa e não constitui requisito fechado de stack.

• Linguagens e consulta: Python, SQL.

• Computação científica e análise de dados: NumPy, pandas, SciPy.

• Estatística e aprendizado de máquina: statsmodels, scikit-learn, XGBoost, LightGBM.

• Redes neurais e aprendizado profundo: PyTorch, TensorFlow.

• Processamento de linguagem natural e IA generativa: Transformers, Sentence Transformers, LangChain, LlamaIndex.

• Visualização e BI: Matplotlib, Plotly, Power BI.

• Processamento distribuído: Apache Spark, PySpark.

• Computação em nuvem: AWS, Azure, Google Cloud.

• Armazenamento e plataformas de dados: Amazon S3, Azure Data Lake Storage, BigQuery, Snowflake, Databricks.

• Automação e computação serverless: AWS Lambda, Azure Functions, Google Cloud Functions.

• Orquestração: Apache Airflow.

• Rastreamento de experimentos e modelos: MLflow.

• Versionamento e colaboração: Git, GitHub, GitLab.

• Containerização: Docker.


As tecnologias, ferramentas, bibliotecas e arcabouços utilizados podem variar conforme o problema, a arquitetura da solução e o ambiente tecnológico da organização; experiência equivalente com tecnologias comparáveis é aceita.

Vagas relacionadas

Seleção por stack em comum com esta oportunidade

Remoto LinkedIn

IT Analyst III (Java)

F1RST Digital Services • São Paulo • 25 candidaturas Hoje

Salário estimado

R$ 9k - 13k/mês

Pleno CLT

Country: Brazil# QUEM SOMOSA F1RST é o futuro e sua carreira está aqui! Nossa cultura é baseada em “Pessoas, Inovação e Resultados”. Aqui promovemos serviços e experiência para os mais de 60 milhões de clientes de todo o ecossistema Santander. Venha fazer parte do time que tem como propósito apoiar ...

Ver Detalhes →
Remoto LinkedIn

Sr Software Engineer, Frontend (Web)

Uber • São Paulo • 25 candidaturas Hoje

Salário estimado

R$ 15k - 23k/mês

Sênior CLT

About The Role Please note: this hybrid position is based in São Paulo or Rio de Janeiro, Brazil - welcoming both local professionals and those open to relocating. At Uber, Frontend Engineers build web experiences that power the way people move and receive things around the world. As part of our eng...

Ver Detalhes →
LinkedIn Hot

Desenvolvedor de back end

MBRAS • São Paulo • 25 candidaturas Hoje

Salário estimado

R$ 14k - 22k/mês

Sênior CLT

Sobre a EmpresaMBRAS é referência no mercado imobiliário de alto padrão em São Paulo. Estamos construindo internamente as plataformas que sustentam nossa operação — dos sistemas de gestão de portfólio às experiências digitais que conectam clientes aos imóveis mais exclusivos da cidade.Sobre o PapelP...

Ver Detalhes →