Nexus AI
Plataforma SaaS de IA unificada — chat multimodal, geração de mídia, planilhas e memória — sobre 200+ modelos via uma API.

Oferecer IA generativa de verdade como produto exige resolver vários problemas ao mesmo tempo: dar acesso a muitos modelos sem refazer a integração a cada novo, escolher o modelo certo para cada pedido, transmitir a resposta em tempo real, controlar custo e cota por cliente sem expor números, e manter contexto entre conversas — tudo com tipagem segura de ponta a ponta para um time pequeno se mover rápido sem quebrar contratos.
SPA React conversa com a API tRPC por SSE; o orquestrador roteia entre 200+ LLMs (OpenRouter) e SLMs específicas, enquanto a API integra mídia, dados (MySQL/S3) e assinaturas via Stripe.
- 01Orquestrador automático de modelos
Um orquestrador escolhe o LLM por heurística: um caminho rápido com regras determinísticas e, quando não casa, um classificador por IA (via OpenRouter, com timeout de 1,2s). O usuário nunca vê qual modelo respondeu, e um fallback hardcoded protege contra falha do banco.
- 02Streaming de tokens via SSE
O chat transmite a resposta em tempo real por Server-Sent Events: busca o histórico, o orquestrador escolhe o modelo e os eventos (delta, artifact_created, done) vão chegando — com tokens e custo calculados e persistidos ao final.
- 03Tipagem ponta a ponta com tRPC
Full-stack TypeScript com tRPC: o contrato entre front e back é tipado de ponta a ponta, com schemas Zod compartilhados — um time pequeno evolui rápido sem quebrar a API silenciosamente.
- 04Custo e cota sem expor números
Custo (USD/BRL) e markup vivem só no servidor; a cota mensal por plano é aplicada no back sem revelar números ao cliente, com bypass auditável para admins. O preço real fica protegido da borda.
- 05Usuários e assinaturas com Stripe
A gestão de usuários, planos e assinaturas roda no Stripe: ciclo de vida da assinatura, cobrança e upgrades/downgrades de plano — integrado à cota e ao billing internos, sem expor o custo real ao cliente.
Ecossistema de SLMs específicas
Além dos 200+ modelos gerais via OpenRouter, montei um ecossistema de SLMs (small language models) específicas para tarefas pontuais — mais rápidas e baratas onde a tarefa é bem definida. O orquestrador roteia para a SLM certa quando faz sentido, equilibrando custo, latência e qualidade.
Artifacts: da conversa ao arquivo
Um parser em máquina de estados detecta blocos <nexus_artifact> no fluxo do LLM, valida (Zod, no caso de planilhas) e salva. O resultado aparece em um painel split no chat e é exportável — planilhas em .xlsx via ExcelJS, com download por URL S3 assinada.
Memória persistente com RAG
Um serviço extrai fatos automaticamente das conversas; a busca semântica (similaridade de cosseno, com cache LRU) recupera o que importa e injeta no system prompt. Cada usuário só acessa a própria memória — isolamento por usuário (LGPD).
O Nexus entrega IA generativa multimodal como um produto coeso: 200+ modelos atrás de uma API única, resposta em streaming, geração de mídia e planilhas, e memória que aprende com o usuário — com custo e cota governados no servidor e tipagem segura de ponta a ponta. Está em produção em nexusia.org, deployado na Railway com migrations e healthcheck.