Converse com modelos Apertus (Swiss AI) sem servidores, sem custos e com privacidade total. Os pesos ficam em cache no seu próprio dispositivo.
Sem cadastro. Sem cartão. Roda via WebGPU no Chrome / Edge.
Tecnologia por baixo do capô
Nada sai do seu dispositivo. Nada chega a nenhum servidor.
Os modelos rodam inteiramente no seu GPU via WebGPU. Suas mensagens nunca saem do seu dispositivo — sem logs, sem analytics de conversa, sem serviço de terceiros.
Inferência diretamente na GPU do dispositivo. Download único, cache no navegador — nas próximas visitas carrega em segundos.
Pesos quantizados em 4 bits no formato ONNX. Máxima compatibilidade com mínimo uso de memória.
Apertus é treinado com dados em múltiplos idiomas, incluindo português. Responde no idioma que você usar.
Ajuste temperatura, top-p, penalidade de repetição e tamanho da resposta diretamente no painel.
Todos da família Apertus (Swiss AI Initiative), abertos, Apache-2.0. O 0.5B baixa primeiro para uma entrada rápida; o 1.5B é ativado em seguida.
O mais leve. Sobe rápido e serve para conversas simples. Baixado automaticamente na primeira visita.
Usar agora →Melhor equilíbrio entre qualidade e tamanho. Modelo padrão do MouseBox, ativado automaticamente após o 0.5B.
Usar agora →Mais poderoso. Requer GPU com bastante memória (~4–6 GB VRAM). Indicado para respostas mais elaboradas.
Usar agora →O navegador verifica se WebGPU está disponível e inicia o download automático do modelo leve (0.5B).
Os pesos ONNX/INT4 são carregados diretamente na GPU via WebGPU. Na segunda visita, sai do cache — sem nova rede.
Tokens gerados em streaming direto no seu dispositivo. Histórico salvo em localStorage, configurações ajustáveis.
Abra o chat, aguarde o modelo carregar uma vez, e comece a conversar com IA local e privada.