🧠 Elige el Modelo para tu Navegador
Mayor precisión, capacidad de deducción profunda y generación de código complejo.
📖 ¿Cómo buscar y usar cualquier modelo de Hugging Face en 3 pasos?
Entra a onnx-community o filtra por transformers.js.
Copia el identificador público del repositorio (ej: onnx-community/Llama-3.2-1B-Instruct).
Pégalo en el campo personalizado y pulsa «Cargar». ¡Inferencia 100% en local en tu RAM!
🔑 Token de Acceso de Hugging Face (Opcional para modelos Gated)
Si deseas cargar modelos con acceso restringido (como Qwen o Llama) o tus repositorios privados, introduce tu Token de Hugging Face (Read):
🔒 Tu token se almacena localmente en tu navegador para autenticar las peticiones a la API de Hugging Face.
🎙️ Entrada de Voz o Audio
Convierte voz a texto en tiempo real con Whisper Tiny (~39 MB) directamente en tu navegador sin enviar audio a ningún servidor.
Formatos compatibles: MP3, WAV, M4A, OGG, WebM
📝 Texto Transcrito
Resultado generado localmente. Puedes copiarlo, descargarlo o enviarlo al chat para hacerle preguntas.
🖼️ Imagen a Procesar
Procesa y analiza imágenes en local utilizando modelos de visión por computador (Depth Estimation & Classification).
Formatos compatibles: PNG, JPG, WebP
✨ Resultado del Procesamiento
Inferencia neuronal directa en tu GPU / WebAssembly.
⚖️ ¿Por qué no un modelo de 27B en el navegador?
Modelos como Qwen3.8-27B o Llama-3-70B cuentan con 27.000 y 70.000 millones de parámetros.
- Requisitos de memoria: Un modelo 27B cuantizado en 4-bit requiere al menos 16 GB a 24 GB de VRAM dedicada.
- El límite que importa es el de la CPU, no el de la GPU: ONNX Runtime en WebAssembly usa memoria de 32 bits, así que por encima de ~1 GB de pesos la reserva falla. Por eso hay modelos marcados como «solo WebGPU»: sin tarjeta compatible no se descargan, en vez de bajarse entero para fallar al final.
- Ese límite no se puede subir desde el navegador. No es una preferencia ni un flag: va compilado dentro del binario WebAssembly del motor de inferencia, que direcciona con 32 bits (4 GiB de techo arquitectónico, y hay que dejar sitio a los cálculos intermedios). Ninguna opción de Chrome, Firefox o Safari lo cambia.
- Lo que sí se puede levantar es WebGPU. Con él, la memoria pasa a ser la de tu tarjeta gráfica y los modelos de 1–1,3 GB entran sin problema. Si el diagnóstico de arriba dice «solo CPU», ahí mismo te explica dónde se activa en tu navegador.
- El modelo descargado se guarda, no se repite. Al empezar una descarga se pide
navigator.storage.persist(), que le dice al navegador que esa caché no es desechable. Sin eso puede tirarla cuando le apriete el disco y te la vuelves a bajar entera sin saber por qué. - Entorno adecuado: Modelos >7B deben ejecutarse en aplicaciones de escritorio como Ollama o LM Studio en servidores locales.
- El punto dulce del navegador: Modelos optimizados de 0.1B a 3B (como SmolLM2, Qwen-0.5B, Whisper-Tiny o Depth-Anything) que descargan en segundos y responden al instante.
🤗 Dónde encontrar Modelos ONNX Oficiales
Hugging Face aloja miles de modelos convertidos listos para ejecutarse en el navegador con Transformers.js:
🛡️ Garantía de Privacidad en Local
A diferencia de las APIs tradicionales donde envías datos personales a servidores externos:
- Cero peticiones de red durante el chat: Puedes desconectar la red tras descargar el modelo.
- Tus archivos se quedan contigo: Los audios e imágenes nunca se suben a ningún backend.
- Caché en el navegador: Los modelos se guardan en IndexedDB / CacheStorage de tu navegador para arranques futuros offline.
¿Cómo es posible en el navegador?
Hasta hace poco, la inteligencia artificial requería servidores con tarjetas gráficas de miles de euros. Hoy en día, la combinación de tres avances permite que tu navegador ejecute modelos directamente:
- WebGPU: Nueva API web que permite a JavaScript acceder directamente a los núcleos de computación de tu tarjeta gráfica.
- Cuantización (INT4 / FP16): Compresión matemática de los pesos del modelo que reduce el tamaño un 70% sin perder apenas precisión.
- WebAssembly (WASM SIMD): Ejecución de instrucciones vectoriales en paralelo a velocidad casi nativa en la CPU.
Privacidad Absoluta por Diseño
A diferencia de servicios como ChatGPT, Claude o Gemini donde cada palabra que tecleas viaja por internet a servidores remotos:
- Cero fugas de datos: Tu texto nunca sale de tu memoria RAM.
- Funciona sin conexión: Una vez descargado el modelo, puedes apagar el router y la IA seguirá funcionando.
- Cumplimiento estricto RGPD: No hay procesamiento por terceros, almacenamiento en logs ni reentrenamiento con tus consultas.
Comparativa: IA en la Nube vs IA Local
| Característica | IA en la Nube | IA en tu Navegador |
|---|---|---|
| Privacidad | Tus datos viajan fuera | 100% Privado en RAM |
| Conexión | Requiere Internet | Funciona Offline |
| Coste por uso | Suscripción / Tokens | 0 € Gratis para siempre |
| Potencia | Modelos gigantes (>70B) | Modelos ligeros (0.1B - 3B) |