Modelos de IA y Niveles de Coste
Cada modelo en Hermes Haven pertenece a un nivel de coste del 0 al 5. El nivel determina cuantos Haven Credits (HC) consumen tus peticiones. El Nivel 0 es gratis — corre en nuestras propias GPUs. Los niveles 1-5 son modelos premium y cuestan HC por millon de tokens ponderados.
No necesitas elegir un nivel manualmente. Solo elige un modelo y el sistema se encarga del resto. Esta pagina explica el catalogo completo para que puedas tomar decisiones informadas.
Niveles de coste de modelos
Cada nivel tiene una tarifa expresada en HC por millon de tokens ponderados. El Nivel 0 es gratis — los modelos corren en nuestra propia infraestructura GPU. Los niveles 1-5 son modelos premium, con precios segun su coste computacional.
| Nivel | Tipo | Rango HC / 1M tokens ponderados | Modelos |
|---|---|---|---|
| L0 | Gratis — Infraestructura (GPUs propias + cloud subvencionado) | 0 | 1 |
| L1 | Economico — modelos premium mas baratos | 1 – 500 | 5 |
| L2 | Bajo coste — modelos pequenos/eficientes | 501 – 2.000 | 11 |
| L3 | Mid-range — calidad y coste equilibrados | 2.001 – 8.000 | 20 |
| L4 | Premium — modelos frontier de alta gama | 8.001 – 20.000 | 10 |
| L5 | Ultra — modelos de razonamiento/pro mas caros | 20.001+ | 1 |
Tokens ponderados explicados
Cuando envias una peticion, la plataforma no cuenta tokens raw. En su lugar calcula tokens ponderados para reflejar el coste real de computo de cada tipo de token:
ponderados = input_no_cacheado + (input_cacheado × 0,1) + (output × 5) + (razonamiento × 5)
| Tipo de token | Multiplicador | Por que |
|---|---|---|
| Input (no cacheado) | × 1 | Coste estandar de procesamiento |
| Input (cacheado) | × 0,1 | Reutilizado del contexto previo — 10× mas barato |
| Output | × 5 | La generacion activa requiere mas computo |
| Razonamiento | × 5 | Tokens de pensamiento interno — mismo coste que output |
Ejemplo practico
Calculo practico
Input: 1.000 tokens no cacheados
Output: 500 tokens
Razonamiento: 0 tokens
tokens_ponderados = 1.000 + 0 + (500 × 5) + 0 = 3.500
hc_cobrado = round(3.500 × 1.800 ÷ 1.000.000) = 6 HC
Son 6 HC para una peticion tipica. Con un plan Starter (1.500 HC/mes) podrias hacer aproximadamente 250 peticiones similares. Con un plan Plus (6.000 HC/mes) son ~1.000 peticiones.
Modo economia
Cuando se agotan tus HC — ya sea en el Trial gratuito o cuando has consumido tu asignacion mensual — la plataforma cambia automaticamente a modo economia. En este modo, solo los modelos de Nivel 0 (Gratis) estan disponibles, sin coste. Sigues trabajando sin interrupcion, solo con el catalogo de modelos gratuitos.
El Nivel 0 incluye Qwen 3.6 35B, funcionando en nuestra propia infraestructura GPU. Suficiente para la mayoria de tareas del dia a dia.
Trae tus propias claves API
Puedes conectar tus propias claves API para cualquier proveedor compatible o cualquier endpoint compatible con OpenAI. Cuando usas tus propias claves, las peticiones no consumen HC — pagas al proveedor directamente a sus tarifas. Esto es ideal si ya tienes creditos con un proveedor o quieres usar modelos que no estan en nuestro catalogo.
Mas info en Como funcionan los creditos.
Catalogo completo de modelos
Todos los modelos disponibles en Hermes Haven, organizados por nivel de coste. Las tarifas HC se muestran por millon de tokens ponderados. Los modelos no-LLM (TTS, STT, imagen, video, embeddings) muestran precios por unidad — ver panel para detalles.
| Modelo | Nivel | HC / 1M tokens ponderados |
|---|---|---|
| Qwen 3.6 35B (A3B NVFP4) | L0 | 0 |
| Nemotron-3 Nano 30B | L1 | 420 |
| Gemma 4 31B IT | L1 | 370 |
| Gemini Flash Lite Latest | L1 | 315 |
| Gemma 4 26B A4B IT | L1 | 314 |
| GPT-OSS 20B | L1 | 292 |
| Veo 3.1 Fast | — | Ver panel |
| AQA | — | Ver panel |
| Text Embedding 3 Large | — | Ver panel |
| Text Embedding Ada-002 | — | Ver panel |
| Sora-2 | — | Ver panel |
| Lyria 3 Pro Preview | — | Ver panel |
| GPT-Image-2 | — | Ver panel |
| Imagen 4.0 Ultra | — | Ver panel |
| Gemini 3 Pro Image (Nano Banana Pro) Preview | — | Ver panel |
| Gemini 3 Pro Image (Nano Banana Pro) | — | Ver panel |
| Nano Banana Pro Preview | — | Ver panel |
| Lyria 3 Clip Preview | — | Ver panel |
| Gemini Embedding | — | Ver panel |
| Gemini Embedding 2 | — | Ver panel |
| Gemini Embedding 2 Preview | — | Ver panel |
| Gemini 3.1 Flash Image (Nano Banana 2) | — | Ver panel |
| Gemini 3.1 Flash Image Preview (Nano Banana 2) | — | Ver panel |
| Imagen 4.0 Standard | — | Ver panel |
| Text Embedding 3 Small | — | Ver panel |
| Gemini 3.1 Flash Lite Image (Nano Banana 2 Lite) | — | Ver panel |
| Imagen 4.0 Fast | — | Ver panel |
| MiniMax M2.5 | L2 | 1,860 |
| Gemini 3.5 Flash Lite | L2 | 1,575 |
| Gemini 3.1 Flash Lite | L2 | 1,575 |
| Gemini 3.1 Flash TTS Preview | — | Ver panel |
| GPT-5.4 Nano | L2 | 1,050 |
| Gemma 4 31B | L2 | 856 |
| Nemotron-3 Super | L2 | 834 |
| GPT-OSS 120B | L2 | 720 |
| DeepSeek V4 Flash | L2 | 720 |
| Gemini 3 Flash Preview | L2 | 630 |
| Gemini Flash Latest | L2 | 630 |
| Gemini Omni Flash Preview | L2 | 630 |
| Veo 3.1 Standard | — | Ver panel |
| Gemini 3.6 Flash | L3 | 7,798 |
| Gemini 3.5 Flash | L3 | 7,798 |
| Kimi K2.7 Code | L3 | 7,290 |
| Whisper-1 | — | Ver panel |
| GPT-4o Transcribe | — | Ver panel |
| GPT-4o Transcribe Diarize | — | Ver panel |
| GLM-5.1 | L3 | 6,456 |
| Kimi K2.7 Code HighSpeed | L3 | 6,298 |
| Kimi K2.5 | L3 | 5,926 |
| Kimi K2.6 | L3 | 5,696 |
| Gemini Pro Latest | L3 | 5,249 |
| Gemini Robotics-ER 1.5 Preview | L3 | 5,249 |
| Gemini Robotics-ER 1.6 Preview | L3 | 5,249 |
| Claude Haiku 4.5-20251001 | L3 | 5,199 |
| GPT-5.6 Luna | L3 | 5,199 |
| GLM-5.2 | L3 | 5,138 |
| Qwen 3.5 397B | L3 | 4,834 |
| Nemotron-3 Ultra | L3 | 4,598 |
| DeepSeek V4 Pro | L3 | 3,600 |
| GPT-4o Mini Transcribe | — | Ver panel |
| Mistral Large 3 675B | L3 | 3,200 |
| GPT-5.4 Mini | L3 | 3,149 |
| MiniMax M3 | L3 | 2,468 |
| MiniMax M2.7 | L3 | 2,100 |
| Claude Opus 5 | L4 | 25,993 |
| TTS-1 | — | Ver panel |
| TTS-1 1106 | — | Ver panel |
| Fish Audio S1 | — | Ver panel |
| Fish Audio S2-Pro | — | Ver panel |
| Fish Audio S2.1-Pro | — | Ver panel |
| Fish Audio Transcribe-1 | — | Ver panel |
| Fish Audio Voice Design-1 | — | Ver panel |
| Kimi K3 | L4 | 15,596 |
| GPT-4o Mini TTS | — | Ver panel |
| Gemini 3.1 Pro Preview | L4 | 10,497 |
| Gemini 3.1 Pro Preview (Custom Tools) | L4 | 10,497 |
| Gemini 3 Pro Preview | L4 | 10,497 |
| Claude Sonnet 5 | L4 | 10,397 |
| Antigravity Preview (05-2026) | L4 | 8,398 |
| Deep Research Max Preview (04-2026) | L4 | 8,398 |
| Deep Research Preview (04-2026) | L4 | 8,398 |
| Deep Research Pro Preview (12-2025) | L4 | 8,398 |
| Claude Fable 5 | L5 | 51,986 |
| TTS-1 HD | — | Ver panel |
| TTS-1 HD 1106 | — | Ver panel |
FAQ
¿Que son los tokens ponderados?
Los tokens ponderados son una medida del coste real de computo. Los tokens de input cuentan ×1, el input cacheado ×0,1, los tokens de output ×5, y los de razonamiento ×5. Esto refleja que generar texto es mas caro que leerlo, y que el contexto cacheado es casi gratis de reutilizar.
¿Cuanto cuesta una peticion tipica?
Una peticion con 1.000 tokens de input y 500 de output usando GLM-5.2 (Nivel 3) produce 3.500 tokens ponderados, lo que cuesta 6 HC. Con un plan Starter (1.500 HC/mes), eso son aproximadamente 250 peticiones similares al mes.
¿Que pasa cuando se agotan los HC?
La plataforma cambia a modo economia. Solo los modelos de Nivel 0 (Gratis) estan disponibles, sin coste. Puedes seguir trabajando con el modelo gratuito hasta que tus HC se reseten en el proximo ciclo de facturacion o hagas un recargo.
¿Los modelos de Nivel 0 son realmente gratis?
Si. Los modelos de Nivel 0 cuestan 0 HC por millon de tokens ponderados. Corren en nuestro propio hardware GPU y capacidad cloud subvencionada. Estan disponibles en todos los planes, incluido el Trial gratuito, y siguen disponibles en modo economia cuando se agotan todos los creditos. El modelo gratuito es Qwen 3.6 35B.
¿Puedo usar mis propias claves API?
Si. Puedes traer tus propias claves API para cualquier proveedor compatible o cualquier endpoint compatible con OpenAI. Las peticiones hechas con tus claves no consumen HC — pagas al proveedor directamente. Esto te permite usar modelos fuera de nuestro catalogo a las tarifas del proveedor.
¿Como se calculan las tarifas HC?
Las tarifas HC se calculan segun el coste computacional de cada modelo. Para modelos LLM con precios separados de input/output, usamos la formula de tokens ponderados: blended = (input + 5 × output) / 6, reflejando que el output es 5× mas caro que el input.
¿Como funcionan los recargos de HC?
Puedes comprar recargos de HC en cualquier momento: 10€ → 10.000 HC, 50€ → 50.000 HC (10% bonus), 100€ → 100.000 HC (15% bonus). Los recargos nunca caducan. Ver Precios para mas detalles.
¿Cual es el cargo minimo por peticion?
El cargo minimo es 1 HC. Si el coste calculado de una peticion es inferior a 1 HC (p.ej. una peticion muy corta de Nivel 1), se redondea a 1 HC. Las peticiones de Nivel 0 siempre cuestan 0 HC independientemente del tamano.
¿Por que algunos modelos muestran precios por unidad en vez de HC/M?
Los modelos de TTS (texto-a-voz), STT (voz-a-texto), generacion de imagenes, generacion de video, musica y diseno de voz se cobran por unidad (por caracter, por minuto, por imagen, por segundo, por peticion) en lugar de por millon de tokens. Ver panel para detalles de precios por unidad.