Pessoa Engenheira de HPC
Salve esta vaga e mantenha sua pesquisa organizada
Crie uma conta gratuita para salvar vagas, criar alertas e retornar a esta listagem a partir do seu painel.
PcDs são sempre bem-vindas.Buscamos um(a) profissional sênior para atuar na arquitetura, administração, automação, sustentação e otimização de ambientes HPC e infraestrutura para IA/Deep Learning.A posição exige forte experiência prática em ambientes Linux, administração de cluster e troubleshooting de ambientes de alta performance, atuando desde o sistema operacional, rede, storage, GPUs, headnode e tunning de aplicações cientificas e corporativas.Responsabilidades e atribuiçõesImplantar, administrar e otimizar ambientes de virtualização free e de mercado, como QEMU, Proxmox, Hyper-V, VMWare.Administração de sistemas operacionais Linux, desde configuração, hardening, troubleshooting, performance tuning, serviços, kernel, drivers, filesystem, networking e automação.Maximizar a eficiência de clusters de computação de alto desempenho através da configuração de partições e políticas de prioridade utilizando o Slurm ou soluções de mercado como PBS Professional e LSFVivência no ecossistema LiCO para gerenciamento de clusters, monitoramento de infraestrutura e gerenciamento de templates de IA.Conhecimento em alternativas ao LiCO, familiaridade com ferramentas concorrentes de portais e orquestração de HPC/IA, como Open OnDemand, Run:ai, ou frameworks baseados em Kubernetes para HPCAutomatizar provisionamento e operação de infraestrutura utilizando Ansible, Shell Script e Python, aplicando práticas de infrastructure as code.Administrar nós com GPUs NVIDIA/AMD, incluindo drivers CUDA, DCGM, MIG, NVLink, NCCL.Realizar monitoramento constante de infraestrutura e aplicações, identificando gargalos de CPU, GPU, memória, storage e rede.Atuar junto a pesquisadores e engenheiros no diagnóstico e otimização de workloads MPI/OpenMP, IA e Deep Learning.Contribuir para segurança, documentação, capacity planning, governança e evolução da arquitetura HPC.Requisitos e qualificaçõesGraduação completa em Ciência da Computação, Engenharia de Software, Sistemas de Informação, Engenharia da Computação ou áreas correlatas;Experiência sênior e hands-on em Linux, preferencialmente RHEL/Rocky/ Ubuntu ServerDomínio de administração e troubleshooting Linux em ambientes de alta performance e/ou larga escala.Experiência avançada na administração de SlurmForte conhecimento de Shell Scripting, Python, Ansible e Git.Experiência prática com pelo menos uma solução de storage paralelo (Lustre, BeeGFS, GPFS/Spectrum Scale ou equivalente).Conhecimentos sólidos de redes, Linux e autenticação centralizada (LDAP/FreeIPA/Kerberos ou equivalente).Capacidade de atuar de forma independente em troubleshooting complexo, análise de performance e resolução de problemas de infraestrutura.Informações adicionais“O Instituto de Pesquisas Eldorado valoriza um ambiente diversificado e se orgulha de ser uma organização que oferece oportunidades de forma igualitária. Todos que se candidatarem serão avaliados, independentemente de raça, deficiência, cor, religião, sexo, identidade ou expressão de gênero, orientação sexual, nacionalidade ou idade”.
Formação Acadêmica:
Não informado
Salário:
A combinar
Cargo:
Outros
Empresa:
Instituto de pesquisas eldorado
Pesquisa e desenvolvimento experimental em ciências físicas e naturais
Ramo:
Pesquisas
(FB)