Models d'IA i Nivells de Cost

Cada model a Hermes Haven pertany a un nivell de cost del 0 al 5. El nivell determina quants Haven Credits (HC) consumeixen les teves peticions. El Nivell 0 es gratuit — funciona en les nostres propres GPUs. Els nivells 1-5 son models premium i costen HC per milio de tokens ponderats.

No necessites triar un nivell manualment. Només escull un model i el sistema s'encarrega de la resta. Aquesta pagina explica el cataleg complet perque puguis prendre decisions informades.

Nivells de cost dels models

Cada nivell te una tarifa expressada en HC per milio de tokens ponderats. El Nivell 0 es gratuit — els models funcionen en la nostra propia infraestructura GPU. Els nivells 1-5 son models premium, amb preus segun el seu cost computacional.

Nivells de cost dels models i tarifes HC
Nivell Tipus Rang HC / 1M tokens ponderats Models
L0Gratuit — Infraestructura (GPUs propres + cloud subvencionat)01
L1Economic — models premium mes barats1 – 5005
L2Baix cost — models petits/eficients501 – 2.00011
L3Mig — qualitat i cost equilibrats2.001 – 8.00020
L4Premium — models frontier d'alta gama8.001 – 20.00010
L5Ultra — models de raonament/pro mes cars20.001+1

Tokens ponderats explicats

Quan envies una peticio, la plataforma no compta tokens raw. En canvi calcula tokens ponderats per reflectir el cost real de comput de cada tipus de token:

ponderats = input_no_cacheat + (input_cacheat × 0,1) + (output × 5) + (raonament × 5)
Multiplicadors de tokens ponderats
Tipus de token Multiplicador Perque
Input (no cacheat)× 1Cost estandard de processament
Input (cacheat)× 0,1Reutilitzat del context previ — 10× mes barat
Output× 5La generacio activa requereix mes comput
Raonament× 5Tokens de pensament intern — mateix cost que output

Exemple practic

Calcul practic

Model: GLM-5.2 (Nivell 3, tarifa = 1.800 HC/1M)
Input: 1.000 tokens no cacheats
Output: 500 tokens
Raonament: 0 tokens

tokens_ponderats = 1.000 + 0 + (500 × 5) + 0 = 3.500
hc_cobrat = round(3.500 × 1.800 ÷ 1.000.000) = 6 HC

Son 6 HC per a una peticio tipica. Amb un pla Starter (1.500 HC/mes) podries fer aproximadament 250 peticions similars. Amb un pla Plus (6.000 HC/mes) son ~1.000 peticions.

Mode economia

Quan s'esgoten els teus HC — sigui al Trial gratuit o quan has consumit la teva assignacio mensual — la plataforma canvia automaticament a mode economia. En aquest mode, nomes els models de Nivell 0 (Gratuit) estan disponibles, sense cost. Continues treballant sense interrupcio, nomes amb el cataleg de models gratuits.

El Nivell 0 inclou Qwen 3.6 35B, funcionant en la nostra propia infraestructura GPU. Suficient per a la majoria de tasques del dia a dia.

Porta les teves pròpies claus API

Pots connectar les teves pròpies claus API per a qualsevol proveidor compatible o qualsevol endpoint compatible amb OpenAI. Quan utilitzes les teves claus, les peticions no consumeixen HC — pagues al proveidor directament a les seves tarifes. Aixo es ideal si ja tens credits amb un proveidor o vols utilitzar models que no son al nostre cataleg.

Més info a Com funcionen els credits.

Cataleg complet de models

Tots els models disponibles a Hermes Haven, organitzats per nivell de cost. Les tarifes HC es mostren per milio de tokens ponderats. Els models no-LLM (TTS, STT, imatge, video, embeddings) mostren preus per unitat — veure tauler per a detalls.

Cataleg complet de models - 85 models
Model Nivell HC / 1M tokens ponderats
Qwen 3.6 35B (A3B NVFP4)L00
Nemotron-3 Nano 30BL1420
Gemma 4 31B ITL1370
Gemini Flash Lite LatestL1315
Gemma 4 26B A4B ITL1314
GPT-OSS 20BL1292
Veo 3.1 FastVeure tauler
AQAVeure tauler
Text Embedding 3 LargeVeure tauler
Text Embedding Ada-002Veure tauler
Sora-2Veure tauler
Lyria 3 Pro PreviewVeure tauler
GPT-Image-2Veure tauler
Imagen 4.0 UltraVeure tauler
Gemini 3 Pro Image (Nano Banana Pro) PreviewVeure tauler
Gemini 3 Pro Image (Nano Banana Pro)Veure tauler
Nano Banana Pro PreviewVeure tauler
Lyria 3 Clip PreviewVeure tauler
Gemini EmbeddingVeure tauler
Gemini Embedding 2Veure tauler
Gemini Embedding 2 PreviewVeure tauler
Gemini 3.1 Flash Image (Nano Banana 2)Veure tauler
Gemini 3.1 Flash Image Preview (Nano Banana 2)Veure tauler
Imagen 4.0 StandardVeure tauler
Text Embedding 3 SmallVeure tauler
Gemini 3.1 Flash Lite Image (Nano Banana 2 Lite)Veure tauler
Imagen 4.0 FastVeure tauler
MiniMax M2.5L21,860
Gemini 3.5 Flash LiteL21,575
Gemini 3.1 Flash LiteL21,575
Gemini 3.1 Flash TTS PreviewVeure tauler
GPT-5.4 NanoL21,050
Gemma 4 31BL2856
Nemotron-3 SuperL2834
GPT-OSS 120BL2720
DeepSeek V4 FlashL2720
Gemini 3 Flash PreviewL2630
Gemini Flash LatestL2630
Gemini Omni Flash PreviewL2630
Veo 3.1 StandardVeure tauler
Gemini 3.6 FlashL37,798
Gemini 3.5 FlashL37,798
Kimi K2.7 CodeL37,290
Whisper-1Veure tauler
GPT-4o TranscribeVeure tauler
GPT-4o Transcribe DiarizeVeure tauler
GLM-5.1L36,456
Kimi K2.7 Code HighSpeedL36,298
Kimi K2.5L35,926
Kimi K2.6L35,696
Gemini Pro LatestL35,249
Gemini Robotics-ER 1.5 PreviewL35,249
Gemini Robotics-ER 1.6 PreviewL35,249
Claude Haiku 4.5-20251001L35,199
GPT-5.6 LunaL35,199
GLM-5.2L35,138
Qwen 3.5 397BL34,834
Nemotron-3 UltraL34,598
DeepSeek V4 ProL33,600
GPT-4o Mini TranscribeVeure tauler
Mistral Large 3 675BL33,200
GPT-5.4 MiniL33,149
MiniMax M3L32,468
MiniMax M2.7L32,100
Claude Opus 5L425,993
TTS-1Veure tauler
TTS-1 1106Veure tauler
Fish Audio S1Veure tauler
Fish Audio S2-ProVeure tauler
Fish Audio S2.1-ProVeure tauler
Fish Audio Transcribe-1Veure tauler
Fish Audio Voice Design-1Veure tauler
Kimi K3L415,596
GPT-4o Mini TTSVeure tauler
Gemini 3.1 Pro PreviewL410,497
Gemini 3.1 Pro Preview (Custom Tools)L410,497
Gemini 3 Pro PreviewL410,497
Claude Sonnet 5L410,397
Antigravity Preview (05-2026)L48,398
Deep Research Max Preview (04-2026)L48,398
Deep Research Preview (04-2026)L48,398
Deep Research Pro Preview (12-2025)L48,398
Claude Fable 5L551,986
TTS-1 HDVeure tauler
TTS-1 HD 1106Veure tauler

FAQ

Què són els tokens ponderats?

Els tokens ponderats son una mesura del cost real de comput. Els tokens d'input compten ×1, l'input cacheat ×0,1, els tokens d'output ×5, i els de raonament ×5. Aixo reflecteix que generar text es mes car que llegir-lo, i que el context cacheat es gairebe gratis de reutilitzar.

Quant costa una petició típica?

Una peticio amb 1.000 tokens d'input i 500 d'output usant GLM-5.2 (Nivell 3) produeix 3.500 tokens ponderats, el que costa 6 HC. Amb un pla Starter (1.500 HC/mes), aixo son aproximadament 250 peticions similars al mes.

Què passa quan s'esgoten els HC?

La plataforma canvia a mode economia. Nomes els models de Nivell 0 (Gratuit) estan disponibles, sense cost. Pots continuar treballant amb el model gratuit fins que els teus HC es restableixin al proper cicle de facturacio o facis una recarrega.

Els models de Nivell 0 són realment gratuïts?

Si. Els models de Nivell 0 costen 0 HC per milio de tokens ponderats. Funcionen en el nostre propi hardware GPU i capacitat cloud subvencionada. Estan disponibles a tots els plans, inclos el Trial gratuit, i romanen disponibles en mode economia quan s'esgoten tots els credits. El model gratuit es Qwen 3.6 35B.

Puc utilitzar les meves pròpies claus API?

Si. Pots portar les teves pròpies claus API per a qualsevol proveidor compatible o qualsevol endpoint compatible amb OpenAI. Les peticions fetes amb les teves claus no consumeixen HC — pagues al proveidor directament. Aixo et permet utilitzar models fora del nostre cataleg a les tarifes del proveidor.

Com es calculen les tarifes HC?

Les tarifes HC es calculen segun el cost computacional de cada model. Per a models LLM amb preus separats d'input/output, usem la formula de tokens ponderats: blended = (input + 5 × output) / 6, reflectint que l'output es 5× mes car que l'input.

Com funcionen les recàrregues de HC?

Pots comprar recarregues de HC en qualsevol moment: 10€ → 10.000 HC, 50€ → 50.000 HC (10% bonus), 100€ → 100.000 HC (15% bonus). Les recarregues mai no caduquen. Veure Preus per a mes detalls.

Quin és el càrrec mínim per petició?

El carc minim es 1 HC. Si el cost calculat d'una peticio es inferior a 1 HC (p.ex. una peticio molt curta de Nivell 1), s'arrodoneix a 1 HC. Les peticions de Nivell 0 sempre costen 0 HC independentment de la mida.

Per què alguns models mostren preus per unitat en lloc de HC/M?

Els models de TTS (text-a-veu), STT (veu-a-text), generacio d'imatges, generacio de video, musica i disseny de veu es cobren per unitat (per caracter, per minut, per imatge, per segon, per peticio) en lloc de per milio de tokens. Veure tauler per a detalls de preus per unitat.

Llest per desplegar el teu agent?

Prova gratuita de 15 dies. Sense targeta. Qwen 3.6 35B inclós.