Cientista de Dados SR
Salário estimado
R$ 16k - 23k/mês
Salário estimado
R$ 16k - 23k/mês
Texto agregado para leitura rápida. Confira sempre a fonte original ao enviar a candidatura.
Responsabilidades técnicas
1. Modelagem matemática, estatística e análise de dados
• Realizar análise exploratória, tratamento, avaliação de qualidade e visualização de dados, distinguindo os mecanismos de ausência de dados e seus impactos na análise.
• Desenvolver modelos matemáticos, estatísticos e probabilísticos.
• Desenvolver modelos de séries temporais, considerando tendência, sazonalidade, autocorrelação, diagnóstico de estacionariedade e validação por separação temporal.
• Aplicar inferência estatística e testes de hipóteses, com atenção a poder estatístico, erros do tipo I e II e correção para comparações múltiplas.
• Aplicar inferência causal, incluindo escore de propensão, diferenças em diferenças, variáveis instrumentais e controle sintético, explicitando as premissas de identificação e as condições que podem invalidá-las.
• Desenvolver modelos aplicados ao marketing e negócio, incluindo propensão, evasão de clientes (churn), valor do cliente ao longo do tempo (customer lifetime value), efeito incremental de tratamento (uplift), atribuição, segmentação e modelagem do mix de marketing (marketing mix modeling).
• Executar engenharia de atributos (feature engineering), seleção de variáveis, definição de métricas e estratégias de validação, com controle de vazamento de informação (data leakage) temporal e por identificador.
• Avaliar a incerteza, a estabilidade, o viés, a calibração e a capacidade de generalização dos modelos.
• Observar as obrigações da Lei Geral de Proteção de Dados relativas aos dados pessoais utilizados na modelagem, incluindo a base legal, a minimização e os limites ao trânsito de dados por meio de serviços de terceiros.
2. Inteligência artificial
• Aprendizado de máquina (machine learning): classificação, regressão, agrupamento (clustering), recomendação, ordenação (ranking), previsão e detecção de anomalias.
• Redes neurais e aprendizado profundo (deep learning): desenvolvimento, treinamento, ajuste e avaliação de arquiteturas neurais, incluindo diagnóstico de problemas de convergência.
• Processamento de linguagem natural: representação e classificação de textos, representações vetoriais (embeddings), recuperação de informação, análise semântica e extração de entidades nomeadas.
• Inteligência artificial generativa (arquiteturas): modelos de linguagem, geração aumentada por recuperação (retrieval-augmented generation), agentes e sistemas multiagentes.
• Inteligência artificial generativa (mecanismos): definição e encadeamento de ferramentas (tool use), engenharia de contexto e de instrução, projeto e controle dos ciclos de execução de agentes, incluindo critérios de parada, orçamento de iterações e tratamento de falhas em cadeia, integração por meio do protocolo de contexto de modelo (Model Context Protocol) e mitigação da injeção de instrução (prompt injection).
• Realizar seleção de modelos, otimização de hiperparâmetros, validação, análise de erros e comparação de desempenho, incluindo avaliação de saídas generativas sem referência única e separação entre falhas de recuperação e falhas de geração.
3. Implantação e monitoramento de modelos
• Implantar modelos de execução por lote e em linha, respeitando os requisitos acordados de latência, disponibilidade e custo.
• Monitorar o desempenho, a estabilidade e a qualidade das predições.
• Identificar desvio da distribuição dos dados (data drift), desvio da relação estatística (concept drift) e degradação do desempenho.
• Monitorar sistemas generativos quanto a regressões decorrentes de mudanças nos modelos de terceiros, alterações nas instruções, custo por chamada e taxa de respostas não fundamentadas.
• Definir métricas, limiares (thresholds), alertas e critérios de retreinamento.
• Comparar versões de modelos e manter rastreabilidade entre código, dados, parâmetros, modelos e resultados.
• Responder pela validação e atualização dos modelos em produção, dentro da fronteira de responsabilidade acordada com as áreas de infraestrutura e engenharia.
Habilidades técnicas
• Raciocínio matemático, estatístico e analítico, sustentado por fundamentos de álgebra linear, de otimização e de teoria da probabilidade.
• Inferência estatística formal, incluindo estimação, intervalos de confiança, testes de hipóteses, erros do tipo I e do tipo II e poder estatístico.
• Formulação e decomposição de problemas quantitativos em perguntas com métricas verificáveis e critérios objetivos de avaliação.
• Construção e avaliação de hipóteses, distinguindo claramente a análise exploratória da confirmatória.
• Desenho de experimentos e de estratégias de validação, considerando a unidade de aleatorização, o tamanho da amostra, a contaminação entre unidades, os critérios de parada e os riscos associados à interrupção antecipada.
• Interpretação crítica dos resultados e identificação de limitações metodológicas, incluindo a calibração de probabilidades e a análise de erros por subgrupos.
• Programação para análise de dados, computação científica e desenvolvimento de modelos, considerando o custo computacional e o uso de memória.
• Linguagens de consulta e manipulação de dados, incluindo junções, funções de janela, agregações e análise de eficiência de consultas.
• Uso de bibliotecas e arcabouços (frameworks) de computação científica, de modelagem estatística e de aprendizado de máquina.
• Uso de arcabouços para redes neurais e aprendizado profundo, incluindo diagnóstico de treinamento e otimização.
• Uso de ferramentas e arcabouços de processamento de linguagem natural e inteligência artificial generativa, incluindo fragmentação, indexação, recuperação, reordenação e avaliação de resultados.
• Visualização e comunicação de dados, resultados, incertezas e limitações metodológicas.
• Desenvolvimento de código modular, legível, testável e reprodutível, com testes automatizados, gestão de ambientes, dependências e versões.
• Documentação técnica de código, modelos, experimentos, premissas e decisões metodológicas em nível suficiente para reprodução por terceiros.
• Versionamento de código e colaboração em repositórios, incluindo ramificação, revisão de código e manutenção de um histórico legível.
• Computação em nuvem e arquiteturas de dados, incluindo data lake, data warehouse, particionamento e formatos colunares.
• Processamento distribuído de dados, considerando particionamento, movimentação de dados e custo de operações em grande volume.
• Automação e execução de rotinas, incluindo funções serverless e processamento orientado a eventos.
• Agendamento e orquestração de fluxos de processamento (pipelines), incluindo dependências entre tarefas, novas tentativas e reprocessamento.
• Rastreamento, versionamento e gestão de experimentos e modelos, mantendo vínculo entre código, dados, parâmetros, modelos e resultados.
• Revisão técnica de código, modelos, experimentos e metodologias.
Exemplos de tecnologias e ferramentas
A relação abaixo é apenas indicativa e não constitui requisito fechado de stack.
• Linguagens e consulta: Python, SQL.
• Computação científica e análise de dados: NumPy, pandas, SciPy.
• Estatística e aprendizado de máquina: statsmodels, scikit-learn, XGBoost, LightGBM.
• Redes neurais e aprendizado profundo: PyTorch, TensorFlow.
• Processamento de linguagem natural e IA generativa: Transformers, Sentence Transformers, LangChain, LlamaIndex.
• Visualização e BI: Matplotlib, Plotly, Power BI.
• Processamento distribuído: Apache Spark, PySpark.
• Computação em nuvem: AWS, Azure, Google Cloud.
• Armazenamento e plataformas de dados: Amazon S3, Azure Data Lake Storage, BigQuery, Snowflake, Databricks.
• Automação e computação serverless: AWS Lambda, Azure Functions, Google Cloud Functions.
• Orquestração: Apache Airflow.
• Rastreamento de experimentos e modelos: MLflow.
• Versionamento e colaboração: Git, GitHub, GitLab.
• Containerização: Docker.
As tecnologias, ferramentas, bibliotecas e arcabouços utilizados podem variar conforme o problema, a arquitetura da solução e o ambiente tecnológico da organização; experiência equivalente com tecnologias comparáveis é aceita.
Seleção por stack em comum com esta oportunidade
Salário estimado
R$ 4k - 7k/mês
Buscamos uma pessoa desenvolvedora em início de consolidação de carreira, com experiência prática no desenvolvimento de software e interesse em evoluir continuamente. A pessoa atuará na construção, manutenção e evolução de serviços e aplicações, participando da investigação de problemas, implementaç...
Salário estimado
R$ 15k - 23k/mês
The AI Platform team has been established to build, develop, and run the Enterprise AI Platform. The Enterprise AI Platform serves as a comprehensive ecosystem of collaborative services, tools, and infrastructure, empowering both technical and non-technical users to seamlessly develop, evaluate, dep...
Salário estimado
R$ 11k - 16k/mês
Company DescriptionA Experian é uma empresa global de dados e tecnologia que impulsiona oportunidades para pessoas e empresas ao redor do mundo. Atuamos em diversos mercados, como serviços financeiros, saúde, automotivo, agronegócio, seguros, entre outros. A Experian investe em pessoas e em novas te...