Documentação técnica

A arquitetura completa por trás do Nyeera.

Hardware, sistema operacional, motor de inferência, orquestração de RAG e as linguagens que sustentam cada camada — tudo em um só lugar, com o repositório aberto para inspeção.

Ilustração do Projeto Nyeera: um vulto sopra um sopro que se transforma em símbolos de conhecimento e circuitos digitais

A máquina que estava abandonada

O único componente adicionado foi o SSD. O objetivo do estudo era medir o que essa configuração específica consegue sustentar.

Processador
Intel Core i5 (legado)
Geração de escritório, sem instruções vetoriais modernas relevantes para inferência.
Memória RAM
16 GB
Compartilhada entre SO, índice vetorial e modelo carregado — o recurso mais disputado do sistema.
GPU
Sem GPU dedicada
Vídeo integrado ao processador, sem VRAM utilizável para aceleração de inferência.
Armazenamento
HDD + SSD local
Guarda os pesos do modelo quantizado e o índice vetorial persistido em disco. Comparativo de performance nos diferentes tipos de disco.
Rede
Opcional / offline-first
O pipeline funciona sem conexão à internet após a indexação inicial dos documentos.
Perfil da máquina
Estação de escritório comum
Representa o hardware já disponível em pequenas operações, não uma máquina de teste dedicada.

Camadas de software escolhidas por peso, não por moda

Cada componente foi avaliado pelo que consome em repouso e sob carga. Onde havia escolha entre "mais completo" e "mais leve", o mais leve venceu por padrão.

Sistema operacional

Linux, distribuição minimalista

Instalação enxuta, sem ambiente gráfico obrigatório, reduzindo o consumo de RAM ocioso do próprio sistema antes mesmo do pipeline iniciar.

Motor de inferência

llama.cpp (via bindings Python)

Runtime em C/C++ especializado em inferência de LLMs quantizados em CPU, sem dependência de CUDA ou drivers de GPU.

Banco vetorial

Índice local (FAISS / Chroma)

Armazenamento e busca por similaridade rodando embarcados no processo, sem servidor de banco de dados externo.

Camada de serviço

API local em FastAPI

Serviço HTTP leve expondo o pipeline de RAG, permitindo integrar o modelo a outras aplicações sem reescrever a lógica de inferência.

Da requisição HTTP ao token gerado

A pilha em camadas, de cima para baixo — da interface que o usuário toca até o hardware que efetivamente executa o modelo.

Apresentação
Frontend estático

Páginas HTML/CSS/JS — como esta — para documentação, demonstração e consumo direto do serviço.

HTML5CSS3JavaScript
API
Serviço de aplicação

Endpoints de consulta e ingestão de documentos, com validação de entrada e streaming de resposta.

PythonFastAPIUvicorn
Orquestração RAG
Pipeline de recuperação e geração

Chunking, roteamento de consultas, montagem de prompt com contexto recuperado e chamada ao motor de inferência.

PythonLangChain / LlamaIndex
Embeddings
Vetorização de texto

Modelo de embedding compacto para converter documentos e consultas em vetores comparáveis.

sentence-transformersONNX Runtime
Índice vetorial
Busca por similaridade

Armazenamento local dos vetores com recuperação aproximada de vizinhos mais próximos.

FAISSChroma
Inferência
Execução do modelo quantizado

Carregamento e execução do LLM em formato GGUF, com controle explícito de threads de CPU.

llama.cppC / C++
Sistema
Sistema Operacional

Ubuntu Server. 7.0.0-29-generic #29-Ubuntu

LinuxUbuntu
Hardware
Mac mini late 2012

CPU Intel Core i5-3210M (dual-core, 4 threads). Memória RAM 16GB PC3-12800 DDR3. GPU Integrada Intel HD Graphics 4000 (não utilizada). Storage: SATA HD 5400-rpm.

CPU-onlyNVMe
Tecnologia Categoria Papel no projeto
Python 3.xLinguagem principalOrquestração do pipeline, API e scripts de indexação.
C / C++Linguagem de baixo nívelNúcleo do motor de inferência (llama.cpp), crítico para desempenho em CPU.
llama.cppMotor de inferênciaExecuta o LLM quantizado (GGUF) sem depender de GPU.
LangChain / LlamaIndexOrquestração de RAGEncadeia recuperação de contexto e geração de resposta.
sentence-transformersEmbeddingsGera os vetores usados na busca por similaridade.
FAISS / ChromaBanco vetorialIndexação e busca local dos vetores de contexto.
FastAPI + UvicornAPIExpõe o pipeline como serviço HTTP local.
HTML / CSS / JavaScriptFrontendInterface de documentação e demonstração do projeto.

O repositório está aberto para inspeção

Todo o pipeline — scripts de indexação, configuração do motor de inferência e a API — está versionado publicamente.

github.com/elmironeto/nyeera/

Estudo de caso e implementação de referência para RAG local em hardware restrito: sem GPU dedicada, 16GB de RAM, CPU legada.

MIT License Python 3.x CPU-only llama.cpp
# clonar o repositório ainda não operacional git clone https://github.com/elmironeto/nyeera/ cd nyeera # instalar dependências pip install -r requirements.txt # subir a API local docker compose up -d

Uma arquitetura pensada para ser auditada, não só demonstrada.

Cada camada deste stack existe por um motivo de custo — de memória, de latência ou de dependência de rede. O código no repositório é a prova disso.