Descrição da vaga

Texto agregado para leitura rápida. Confira sempre a fonte original ao enviar a candidatura.

Responsabilidades técnicas


1. Modelagem matemática, estatística e análise de dados

• Realizar análise exploratória, tratamento, avaliação de qualidade e visualização de dados, distinguindo os mecanismos de ausência de dados e seus impactos na análise.

• Desenvolver modelos matemáticos, estatísticos e probabilísticos.

• Desenvolver modelos de séries temporais, considerando tendência, sazonalidade, autocorrelação, diagnóstico de estacionariedade e validação por separação temporal.

• Aplicar inferência estatística e testes de hipóteses, com atenção a poder estatístico, erros do tipo I e II e correção para comparações múltiplas.

• Aplicar inferência causal, incluindo escore de propensão, diferenças em diferenças, variáveis instrumentais e controle sintético, explicitando as premissas de identificação e as condições que podem invalidá-las.

• Desenvolver modelos aplicados ao marketing e negócio, incluindo propensão, evasão de clientes (churn), valor do cliente ao longo do tempo (customer lifetime value), efeito incremental de tratamento (uplift), atribuição, segmentação e modelagem do mix de marketing (marketing mix modeling).

• Executar engenharia de atributos (feature engineering), seleção de variáveis, definição de métricas e estratégias de validação, com controle de vazamento de informação (data leakage) temporal e por identificador.

• Avaliar a incerteza, a estabilidade, o viés, a calibração e a capacidade de generalização dos modelos.

• Observar as obrigações da Lei Geral de Proteção de Dados relativas aos dados pessoais utilizados na modelagem, incluindo a base legal, a minimização e os limites ao trânsito de dados por meio de serviços de terceiros.


2. Inteligência artificial

• Aprendizado de máquina (machine learning): classificação, regressão, agrupamento (clustering), recomendação, ordenação (ranking), previsão e detecção de anomalias.

• Redes neurais e aprendizado profundo (deep learning): desenvolvimento, treinamento, ajuste e avaliação de arquiteturas neurais, incluindo diagnóstico de problemas de convergência.

• Processamento de linguagem natural: representação e classificação de textos, representações vetoriais (embeddings), recuperação de informação, análise semântica e extração de entidades nomeadas.

• Inteligência artificial generativa (arquiteturas): modelos de linguagem, geração aumentada por recuperação (retrieval-augmented generation), agentes e sistemas multiagentes.

• Inteligência artificial generativa (mecanismos): definição e encadeamento de ferramentas (tool use), engenharia de contexto e de instrução, projeto e controle dos ciclos de execução de agentes, incluindo critérios de parada, orçamento de iterações e tratamento de falhas em cadeia, integração por meio do protocolo de contexto de modelo (Model Context Protocol) e mitigação da injeção de instrução (prompt injection).

• Realizar seleção de modelos, otimização de hiperparâmetros, validação, análise de erros e comparação de desempenho, incluindo avaliação de saídas generativas sem referência única e separação entre falhas de recuperação e falhas de geração.


3. Implantação e monitoramento de modelos

• Implantar modelos de execução por lote e em linha, respeitando os requisitos acordados de latência, disponibilidade e custo.

• Monitorar o desempenho, a estabilidade e a qualidade das predições.

• Identificar desvio da distribuição dos dados (data drift), desvio da relação estatística (concept drift) e degradação do desempenho.

• Monitorar sistemas generativos quanto a regressões decorrentes de mudanças nos modelos de terceiros, alterações nas instruções, custo por chamada e taxa de respostas não fundamentadas.

• Definir métricas, limiares (thresholds), alertas e critérios de retreinamento.

• Comparar versões de modelos e manter rastreabilidade entre código, dados, parâmetros, modelos e resultados.

• Responder pela validação e atualização dos modelos em produção, dentro da fronteira de responsabilidade acordada com as áreas de infraestrutura e engenharia.


Habilidades técnicas

• Raciocínio matemático, estatístico e analítico, sustentado por fundamentos de álgebra linear, de otimização e de teoria da probabilidade.

• Inferência estatística formal, incluindo estimação, intervalos de confiança, testes de hipóteses, erros do tipo I e do tipo II e poder estatístico.

• Formulação e decomposição de problemas quantitativos em perguntas com métricas verificáveis e critérios objetivos de avaliação.

• Construção e avaliação de hipóteses, distinguindo claramente a análise exploratória da confirmatória.

• Desenho de experimentos e de estratégias de validação, considerando a unidade de aleatorização, o tamanho da amostra, a contaminação entre unidades, os critérios de parada e os riscos associados à interrupção antecipada.

• Interpretação crítica dos resultados e identificação de limitações metodológicas, incluindo a calibração de probabilidades e a análise de erros por subgrupos.

• Programação para análise de dados, computação científica e desenvolvimento de modelos, considerando o custo computacional e o uso de memória.

• Linguagens de consulta e manipulação de dados, incluindo junções, funções de janela, agregações e análise de eficiência de consultas.

• Uso de bibliotecas e arcabouços (frameworks) de computação científica, de modelagem estatística e de aprendizado de máquina.

• Uso de arcabouços para redes neurais e aprendizado profundo, incluindo diagnóstico de treinamento e otimização.

• Uso de ferramentas e arcabouços de processamento de linguagem natural e inteligência artificial generativa, incluindo fragmentação, indexação, recuperação, reordenação e avaliação de resultados.

• Visualização e comunicação de dados, resultados, incertezas e limitações metodológicas.

• Desenvolvimento de código modular, legível, testável e reprodutível, com testes automatizados, gestão de ambientes, dependências e versões.

• Documentação técnica de código, modelos, experimentos, premissas e decisões metodológicas em nível suficiente para reprodução por terceiros.

• Versionamento de código e colaboração em repositórios, incluindo ramificação, revisão de código e manutenção de um histórico legível.

• Computação em nuvem e arquiteturas de dados, incluindo data lake, data warehouse, particionamento e formatos colunares.

• Processamento distribuído de dados, considerando particionamento, movimentação de dados e custo de operações em grande volume.

• Automação e execução de rotinas, incluindo funções serverless e processamento orientado a eventos.

• Agendamento e orquestração de fluxos de processamento (pipelines), incluindo dependências entre tarefas, novas tentativas e reprocessamento.

• Rastreamento, versionamento e gestão de experimentos e modelos, mantendo vínculo entre código, dados, parâmetros, modelos e resultados.

• Revisão técnica de código, modelos, experimentos e metodologias.


Exemplos de tecnologias e ferramentas

A relação abaixo é apenas indicativa e não constitui requisito fechado de stack.

• Linguagens e consulta: Python, SQL.

• Computação científica e análise de dados: NumPy, pandas, SciPy.

• Estatística e aprendizado de máquina: statsmodels, scikit-learn, XGBoost, LightGBM.

• Redes neurais e aprendizado profundo: PyTorch, TensorFlow.

• Processamento de linguagem natural e IA generativa: Transformers, Sentence Transformers, LangChain, LlamaIndex.

• Visualização e BI: Matplotlib, Plotly, Power BI.

• Processamento distribuído: Apache Spark, PySpark.

• Computação em nuvem: AWS, Azure, Google Cloud.

• Armazenamento e plataformas de dados: Amazon S3, Azure Data Lake Storage, BigQuery, Snowflake, Databricks.

• Automação e computação serverless: AWS Lambda, Azure Functions, Google Cloud Functions.

• Orquestração: Apache Airflow.

• Rastreamento de experimentos e modelos: MLflow.

• Versionamento e colaboração: Git, GitHub, GitLab.

• Containerização: Docker.


As tecnologias, ferramentas, bibliotecas e arcabouços utilizados podem variar conforme o problema, a arquitetura da solução e o ambiente tecnológico da organização; experiência equivalente com tecnologias comparáveis é aceita.

Vagas relacionadas

Seleção por stack em comum com esta oportunidade

Remoto LinkedIn

Desenvolvedor(a) Back End (Júnior/Pleno)

IEBT Innovation Belo Horizonte 85 candidaturas Hoje

Salário estimado

R$ 4k - 7k/mês

Júnior CLT

Buscamos uma pessoa desenvolvedora em início de consolidação de carreira, com experiência prática no desenvolvimento de software e interesse em evoluir continuamente. A pessoa atuará na construção, manutenção e evolução de serviços e aplicações, participando da investigação de problemas, implementaç...

Ver Detalhes
LinkedIn

Senior Software Engineer Python

Thomson Reuters Brasil São Paulo 25 candidaturas Hoje

Salário estimado

R$ 15k - 23k/mês

Sênior CLT

The AI Platform team has been established to build, develop, and run the Enterprise AI Platform. The Enterprise AI Platform serves as a comprehensive ecosystem of collaborative services, tools, and infrastructure, empowering both technical and non-technical users to seamlessly develop, evaluate, dep...

Ver Detalhes
LinkedIn

Analista de desenvolvimento de software Sênior

Serasa Experian Blumenau, Santa Catarina, Brazil 25 candidaturas Hoje

Salário estimado

R$ 11k - 16k/mês

Sênior CLT

Company DescriptionA Experian é uma empresa global de dados e tecnologia que impulsiona oportunidades para pessoas e empresas ao redor do mundo. Atuamos em diversos mercados, como serviços financeiros, saúde, automotivo, agronegócio, seguros, entre outros. A Experian investe em pessoas e em novas te...

Ver Detalhes