Trabalho técnico orientado a medições
A Inferux existe para ajudar equipes de engenharia a entenderem, com clareza, onde o desempenho de inferência pode ser melhorado — e o que muda depois do trabalho.
← Página inicialPor que a Inferux foi criada
A Inferux surgiu de uma percepção direta: muitas equipes de engenharia em empresas brasileiras implantam modelos de linguagem e visão em produção sem ter um processo estruturado para medir e ajustar o desempenho de inferência ao longo do tempo.
O hardware Nvidia — da linha A100 à H100 — oferece uma série de opções de configuração que afetam latência e throughput de formas nem sempre intuitivas. Batching dinâmico, quantização de pesos, layout de memória KV-cache, configurações de servidor: cada camada tem espaço para ajuste, e esse espaço raramente é explorado de forma sistemática.
A Inferux preenche essa lacuna. Não como uma consultoria de TI generalista, mas como uma equipe técnica que entra no detalhe do seu stack, mede o que está acontecendo e documenta o que muda depois de cada intervenção.
Missão
Tornar o processo de ajuste de inferência acessível e documentado para equipes técnicas no Brasil — com foco em resultados verificáveis, não em promessas.
Visão
Ser a referência técnica para equipes de IA em produção que precisam de orientação prática sobre performance de inferência em GPUs Nvidia no mercado nacional.
Valores
Clareza técnica, medições antes e depois, documentação que permanece útil para a equipe e sem exagero nas afirmações sobre o que o trabalho entrega.
Quem faz o trabalho
Profissionais com formação em sistemas distribuídos, ML engineering e infraestrutura de GPU.
Rafael Costa
Fundador & Eng. de Inferência
Trabalhou com sistemas de serving em larga escala antes de fundar a Inferux. Especialidade em TensorRT-LLM e configurações de batching dinâmico.
Marina Figueiredo
Engenheira de ML Systems
Experiência em quantização de modelos, análise de memória e profiling de GPU. Contribui para os guias técnicos e entregáveis escritos dos engajamentos.
Thiago Mendes
Engenheiro de Infraestrutura
Foco em configurações de servidor de inferência (vLLM, Triton), rede e armazenamento. Apoia a parte de monitoramento do serviço contínuo.
Como conduzimos cada engajamento
Baseline antes de tudo
Todo engajamento começa com medições do estado atual — latência p50/p95, throughput e utilização de GPU — para que as mudanças tenham uma referência clara.
Privacidade de dados
Não acessamos dados de produção dos clientes. O trabalho é conduzido com base em metadados de configuração e métricas de performance, sem contato com conteúdo sensível.
Documentação escrita
Cada engajamento produz documentação técnica — sumário de achados, técnicas aplicadas e comparativo de métricas — que a equipe do cliente retém após a conclusão.
Iteração colaborativa
As sessões de trabalho envolvem a equipe de engenharia do cliente. As mudanças são discutidas antes de implementadas, não impostas unilateralmente.
Acordos de confidencialidade
Engajamentos incluem acordo de não divulgação para proteger informações técnicas e arquiteturais compartilhadas durante o trabalho.
Escopo claro desde o início
Antes de começar, alinhamos em detalhes o que será coberto, quais modelos e workloads serão avaliados, e qual o formato dos entregáveis.
Otimização de inferência no Brasil: onde estamos e o que fazemos
A adoção de modelos de linguagem de grande escala (LLMs) e modelos de visão em produção acelerou significativamente no Brasil nos últimos dois anos. Equipes de engenharia em empresas de tecnologia, financeiras e de saúde digital estão operando workloads de inferência que precisam de latência previsível e throughput adequado para sustentar produtos de IA em funcionamento real.
A Inferux atua especificamente nessa interseção: entre o modelo treinado e o usuário final. Nosso trabalho cobre a camada de serving — onde configurações de batching, precisão numérica (FP16, INT8, FP8), layout de cache de atenção e parâmetros de servidor determinam a diferença entre um serviço funcional e um serviço que escala com qualidade.
Com base em Manaus, AM, trabalhamos de forma remota com equipes em todo o território nacional. Nosso modelo de engajamento foi desenhado para times que já possuem infraestrutura operando, mas que precisam de revisão técnica externa e documentação estruturada para tornar o processo de ajuste de performance parte da rotina de engenharia.
Não oferecemos treinamento de modelos, MLOps generalista ou desenvolvimento de aplicações. Nosso foco é estrito: desempenho de inferência em hardware Nvidia, com metodologia documentada e medições verificáveis.
Conheça o trabalho na prática
Uma conversa de 30 minutos é suficiente para entender se existe encaixe entre o que a Inferux faz e o que sua equipe precisa.
Falar com a equipe