Running Large Language Models Directly in Web Browsers How WebAssembly, WebGPU, and MediaPipe enable on-device LLM inference in browsers, preserving privacy and reducing latency without server calls. January 24, 2025 llmwebgpubrowser