GGUF models mapped via memmap2 directly into the OS page cache. Phase 8 bifurcated compute via wgpu. Zero cloud egress.
Honest: decode tok/s on consumer GPUs is still below hand-tuned engines. For rights-grade grounding use QUALIA_RIGHTS_MODE=1. See 0.0.38 progress.
Select a model to chat. Click to copy the CLI load command.
TelemetryPayload on port 9090. A normal daemon can infer without this separate service.
Live inference uses the daemon's HTTP job API: discover local models, start a bounded job, then receive tokens through a Server-Sent Events stream. The general-purpose qualia-bridge WebSocket remains available for graph queries.
.gguf or .p64 model.
GgufSharder → parses GGUF header → NQuin pointer map (byte offsets in upper bits, modality flag 0b1001)GgufBridge → mmap weights into OS page cache via memmap2 → zero heap allocationfused_tensor_contraction.wgsl → 64 threads/workgroup, 4096 FMA ops/thread → Vulkan/DX12/MetalLocalLlmAgent → Phase 8 bifurcated compute: LLM Engine ↔ Webizen Sentinel via SPSC ring buffersOrchestrator → N3Logic rights pre-flight → infer → provenance NQuin citation check
LogitStreamControlStreamDenyRollback: recalculates mid-generation0x99 byte signature)DenyRollback into ControlStreamvalidate_intent() — N3Logic rights pre-flightagent.infer() — actual GPU inferencevalidate_output() — output must cite ≥1 NQuin provenance