Modelos de IA y Niveles de Coste

Cada modelo en Hermes Haven pertenece a un nivel de coste del 0 al 5. El nivel determina cuantos Haven Credits (HC) consumen tus peticiones. El Nivel 0 es gratis — corre en nuestras propias GPUs. Los niveles 1-5 son modelos premium y cuestan HC por millon de tokens ponderados.

No necesitas elegir un nivel manualmente. Solo elige un modelo y el sistema se encarga del resto. Esta pagina explica el catalogo completo para que puedas tomar decisiones informadas.

Niveles de coste de modelos

Cada nivel tiene una tarifa expresada en HC por millon de tokens ponderados. El Nivel 0 es gratis — los modelos corren en nuestra propia infraestructura GPU. Los niveles 1-5 son modelos premium, con precios segun su coste computacional.

Niveles de coste de modelos y tarifas HC
Nivel Tipo Rango HC / 1M tokens ponderados Modelos
L0Gratis — Infraestructura (GPUs propias + cloud subvencionado)01
L1Economico — modelos premium mas baratos1 – 5005
L2Bajo coste — modelos pequenos/eficientes501 – 2.00011
L3Mid-range — calidad y coste equilibrados2.001 – 8.00020
L4Premium — modelos frontier de alta gama8.001 – 20.00010
L5Ultra — modelos de razonamiento/pro mas caros20.001+1

Tokens ponderados explicados

Cuando envias una peticion, la plataforma no cuenta tokens raw. En su lugar calcula tokens ponderados para reflejar el coste real de computo de cada tipo de token:

ponderados = input_no_cacheado + (input_cacheado × 0,1) + (output × 5) + (razonamiento × 5)
Multiplicadores de tokens ponderados
Tipo de token Multiplicador Por que
Input (no cacheado)× 1Coste estandar de procesamiento
Input (cacheado)× 0,1Reutilizado del contexto previo — 10× mas barato
Output× 5La generacion activa requiere mas computo
Razonamiento× 5Tokens de pensamiento interno — mismo coste que output

Ejemplo practico

Calculo practico

Modelo: GLM-5.2 (Nivel 3, tarifa = 1.800 HC/1M)
Input: 1.000 tokens no cacheados
Output: 500 tokens
Razonamiento: 0 tokens

tokens_ponderados = 1.000 + 0 + (500 × 5) + 0 = 3.500
hc_cobrado = round(3.500 × 1.800 ÷ 1.000.000) = 6 HC

Son 6 HC para una peticion tipica. Con un plan Starter (1.500 HC/mes) podrias hacer aproximadamente 250 peticiones similares. Con un plan Plus (6.000 HC/mes) son ~1.000 peticiones.

Modo economia

Cuando se agotan tus HC — ya sea en el Trial gratuito o cuando has consumido tu asignacion mensual — la plataforma cambia automaticamente a modo economia. En este modo, solo los modelos de Nivel 0 (Gratis) estan disponibles, sin coste. Sigues trabajando sin interrupcion, solo con el catalogo de modelos gratuitos.

El Nivel 0 incluye Qwen 3.6 35B, funcionando en nuestra propia infraestructura GPU. Suficiente para la mayoria de tareas del dia a dia.

Trae tus propias claves API

Puedes conectar tus propias claves API para cualquier proveedor compatible o cualquier endpoint compatible con OpenAI. Cuando usas tus propias claves, las peticiones no consumen HC — pagas al proveedor directamente a sus tarifas. Esto es ideal si ya tienes creditos con un proveedor o quieres usar modelos que no estan en nuestro catalogo.

Mas info en Como funcionan los creditos.

Catalogo completo de modelos

Todos los modelos disponibles en Hermes Haven, organizados por nivel de coste. Las tarifas HC se muestran por millon de tokens ponderados. Los modelos no-LLM (TTS, STT, imagen, video, embeddings) muestran precios por unidad — ver panel para detalles.

Catalogo completo de modelos - 85 modelos
Modelo Nivel HC / 1M tokens ponderados
Qwen 3.6 35B (A3B NVFP4)L00
Nemotron-3 Nano 30BL1420
Gemma 4 31B ITL1370
Gemini Flash Lite LatestL1315
Gemma 4 26B A4B ITL1314
GPT-OSS 20BL1292
Veo 3.1 FastVer panel
AQAVer panel
Text Embedding 3 LargeVer panel
Text Embedding Ada-002Ver panel
Sora-2Ver panel
Lyria 3 Pro PreviewVer panel
GPT-Image-2Ver panel
Imagen 4.0 UltraVer panel
Gemini 3 Pro Image (Nano Banana Pro) PreviewVer panel
Gemini 3 Pro Image (Nano Banana Pro)Ver panel
Nano Banana Pro PreviewVer panel
Lyria 3 Clip PreviewVer panel
Gemini EmbeddingVer panel
Gemini Embedding 2Ver panel
Gemini Embedding 2 PreviewVer panel
Gemini 3.1 Flash Image (Nano Banana 2)Ver panel
Gemini 3.1 Flash Image Preview (Nano Banana 2)Ver panel
Imagen 4.0 StandardVer panel
Text Embedding 3 SmallVer panel
Gemini 3.1 Flash Lite Image (Nano Banana 2 Lite)Ver panel
Imagen 4.0 FastVer panel
MiniMax M2.5L21,860
Gemini 3.5 Flash LiteL21,575
Gemini 3.1 Flash LiteL21,575
Gemini 3.1 Flash TTS PreviewVer panel
GPT-5.4 NanoL21,050
Gemma 4 31BL2856
Nemotron-3 SuperL2834
GPT-OSS 120BL2720
DeepSeek V4 FlashL2720
Gemini 3 Flash PreviewL2630
Gemini Flash LatestL2630
Gemini Omni Flash PreviewL2630
Veo 3.1 StandardVer panel
Gemini 3.6 FlashL37,798
Gemini 3.5 FlashL37,798
Kimi K2.7 CodeL37,290
Whisper-1Ver panel
GPT-4o TranscribeVer panel
GPT-4o Transcribe DiarizeVer panel
GLM-5.1L36,456
Kimi K2.7 Code HighSpeedL36,298
Kimi K2.5L35,926
Kimi K2.6L35,696
Gemini Pro LatestL35,249
Gemini Robotics-ER 1.5 PreviewL35,249
Gemini Robotics-ER 1.6 PreviewL35,249
Claude Haiku 4.5-20251001L35,199
GPT-5.6 LunaL35,199
GLM-5.2L35,138
Qwen 3.5 397BL34,834
Nemotron-3 UltraL34,598
DeepSeek V4 ProL33,600
GPT-4o Mini TranscribeVer panel
Mistral Large 3 675BL33,200
GPT-5.4 MiniL33,149
MiniMax M3L32,468
MiniMax M2.7L32,100
Claude Opus 5L425,993
TTS-1Ver panel
TTS-1 1106Ver panel
Fish Audio S1Ver panel
Fish Audio S2-ProVer panel
Fish Audio S2.1-ProVer panel
Fish Audio Transcribe-1Ver panel
Fish Audio Voice Design-1Ver panel
Kimi K3L415,596
GPT-4o Mini TTSVer panel
Gemini 3.1 Pro PreviewL410,497
Gemini 3.1 Pro Preview (Custom Tools)L410,497
Gemini 3 Pro PreviewL410,497
Claude Sonnet 5L410,397
Antigravity Preview (05-2026)L48,398
Deep Research Max Preview (04-2026)L48,398
Deep Research Preview (04-2026)L48,398
Deep Research Pro Preview (12-2025)L48,398
Claude Fable 5L551,986
TTS-1 HDVer panel
TTS-1 HD 1106Ver panel

FAQ

¿Que son los tokens ponderados?

Los tokens ponderados son una medida del coste real de computo. Los tokens de input cuentan ×1, el input cacheado ×0,1, los tokens de output ×5, y los de razonamiento ×5. Esto refleja que generar texto es mas caro que leerlo, y que el contexto cacheado es casi gratis de reutilizar.

¿Cuanto cuesta una peticion tipica?

Una peticion con 1.000 tokens de input y 500 de output usando GLM-5.2 (Nivel 3) produce 3.500 tokens ponderados, lo que cuesta 6 HC. Con un plan Starter (1.500 HC/mes), eso son aproximadamente 250 peticiones similares al mes.

¿Que pasa cuando se agotan los HC?

La plataforma cambia a modo economia. Solo los modelos de Nivel 0 (Gratis) estan disponibles, sin coste. Puedes seguir trabajando con el modelo gratuito hasta que tus HC se reseten en el proximo ciclo de facturacion o hagas un recargo.

¿Los modelos de Nivel 0 son realmente gratis?

Si. Los modelos de Nivel 0 cuestan 0 HC por millon de tokens ponderados. Corren en nuestro propio hardware GPU y capacidad cloud subvencionada. Estan disponibles en todos los planes, incluido el Trial gratuito, y siguen disponibles en modo economia cuando se agotan todos los creditos. El modelo gratuito es Qwen 3.6 35B.

¿Puedo usar mis propias claves API?

Si. Puedes traer tus propias claves API para cualquier proveedor compatible o cualquier endpoint compatible con OpenAI. Las peticiones hechas con tus claves no consumen HC — pagas al proveedor directamente. Esto te permite usar modelos fuera de nuestro catalogo a las tarifas del proveedor.

¿Como se calculan las tarifas HC?

Las tarifas HC se calculan segun el coste computacional de cada modelo. Para modelos LLM con precios separados de input/output, usamos la formula de tokens ponderados: blended = (input + 5 × output) / 6, reflejando que el output es 5× mas caro que el input.

¿Como funcionan los recargos de HC?

Puedes comprar recargos de HC en cualquier momento: 10€ → 10.000 HC, 50€ → 50.000 HC (10% bonus), 100€ → 100.000 HC (15% bonus). Los recargos nunca caducan. Ver Precios para mas detalles.

¿Cual es el cargo minimo por peticion?

El cargo minimo es 1 HC. Si el coste calculado de una peticion es inferior a 1 HC (p.ej. una peticion muy corta de Nivel 1), se redondea a 1 HC. Las peticiones de Nivel 0 siempre cuestan 0 HC independientemente del tamano.

¿Por que algunos modelos muestran precios por unidad en vez de HC/M?

Los modelos de TTS (texto-a-voz), STT (voz-a-texto), generacion de imagenes, generacion de video, musica y diseno de voz se cobran por unidad (por caracter, por minuto, por imagen, por segundo, por peticion) en lugar de por millon de tokens. Ver panel para detalles de precios por unidad.

¿Listo para desplegar tu agente?

Prueba gratuita de 15 dias. Sin tarjeta. Qwen 3.6 35B incluido.