Models d'IA i Nivells de Cost
Cada model a Hermes Haven pertany a un nivell de cost del 0 al 5. El nivell determina quants Haven Credits (HC) consumeixen les teves peticions. El Nivell 0 es gratuit — funciona en les nostres propres GPUs. Els nivells 1-5 son models premium i costen HC per milio de tokens ponderats.
No necessites triar un nivell manualment. Només escull un model i el sistema s'encarrega de la resta. Aquesta pagina explica el cataleg complet perque puguis prendre decisions informades.
Nivells de cost dels models
Cada nivell te una tarifa expressada en HC per milio de tokens ponderats. El Nivell 0 es gratuit — els models funcionen en la nostra propia infraestructura GPU. Els nivells 1-5 son models premium, amb preus segun el seu cost computacional.
| Nivell | Tipus | Rang HC / 1M tokens ponderats | Models |
|---|---|---|---|
| L0 | Gratuit — Infraestructura (GPUs propres + cloud subvencionat) | 0 | 1 |
| L1 | Economic — models premium mes barats | 1 – 500 | 5 |
| L2 | Baix cost — models petits/eficients | 501 – 2.000 | 11 |
| L3 | Mig — qualitat i cost equilibrats | 2.001 – 8.000 | 20 |
| L4 | Premium — models frontier d'alta gama | 8.001 – 20.000 | 10 |
| L5 | Ultra — models de raonament/pro mes cars | 20.001+ | 1 |
Tokens ponderats explicats
Quan envies una peticio, la plataforma no compta tokens raw. En canvi calcula tokens ponderats per reflectir el cost real de comput de cada tipus de token:
ponderats = input_no_cacheat + (input_cacheat × 0,1) + (output × 5) + (raonament × 5)
| Tipus de token | Multiplicador | Perque |
|---|---|---|
| Input (no cacheat) | × 1 | Cost estandard de processament |
| Input (cacheat) | × 0,1 | Reutilitzat del context previ — 10× mes barat |
| Output | × 5 | La generacio activa requereix mes comput |
| Raonament | × 5 | Tokens de pensament intern — mateix cost que output |
Exemple practic
Calcul practic
Input: 1.000 tokens no cacheats
Output: 500 tokens
Raonament: 0 tokens
tokens_ponderats = 1.000 + 0 + (500 × 5) + 0 = 3.500
hc_cobrat = round(3.500 × 1.800 ÷ 1.000.000) = 6 HC
Son 6 HC per a una peticio tipica. Amb un pla Starter (1.500 HC/mes) podries fer aproximadament 250 peticions similars. Amb un pla Plus (6.000 HC/mes) son ~1.000 peticions.
Mode economia
Quan s'esgoten els teus HC — sigui al Trial gratuit o quan has consumit la teva assignacio mensual — la plataforma canvia automaticament a mode economia. En aquest mode, nomes els models de Nivell 0 (Gratuit) estan disponibles, sense cost. Continues treballant sense interrupcio, nomes amb el cataleg de models gratuits.
El Nivell 0 inclou Qwen 3.6 35B, funcionant en la nostra propia infraestructura GPU. Suficient per a la majoria de tasques del dia a dia.
Porta les teves pròpies claus API
Pots connectar les teves pròpies claus API per a qualsevol proveidor compatible o qualsevol endpoint compatible amb OpenAI. Quan utilitzes les teves claus, les peticions no consumeixen HC — pagues al proveidor directament a les seves tarifes. Aixo es ideal si ja tens credits amb un proveidor o vols utilitzar models que no son al nostre cataleg.
Més info a Com funcionen els credits.
Cataleg complet de models
Tots els models disponibles a Hermes Haven, organitzats per nivell de cost. Les tarifes HC es mostren per milio de tokens ponderats. Els models no-LLM (TTS, STT, imatge, video, embeddings) mostren preus per unitat — veure tauler per a detalls.
| Model | Nivell | HC / 1M tokens ponderats |
|---|---|---|
| Qwen 3.6 35B (A3B NVFP4) | L0 | 0 |
| Nemotron-3 Nano 30B | L1 | 420 |
| Gemma 4 31B IT | L1 | 370 |
| Gemini Flash Lite Latest | L1 | 315 |
| Gemma 4 26B A4B IT | L1 | 314 |
| GPT-OSS 20B | L1 | 292 |
| Veo 3.1 Fast | — | Veure tauler |
| AQA | — | Veure tauler |
| Text Embedding 3 Large | — | Veure tauler |
| Text Embedding Ada-002 | — | Veure tauler |
| Sora-2 | — | Veure tauler |
| Lyria 3 Pro Preview | — | Veure tauler |
| GPT-Image-2 | — | Veure tauler |
| Imagen 4.0 Ultra | — | Veure tauler |
| Gemini 3 Pro Image (Nano Banana Pro) Preview | — | Veure tauler |
| Gemini 3 Pro Image (Nano Banana Pro) | — | Veure tauler |
| Nano Banana Pro Preview | — | Veure tauler |
| Lyria 3 Clip Preview | — | Veure tauler |
| Gemini Embedding | — | Veure tauler |
| Gemini Embedding 2 | — | Veure tauler |
| Gemini Embedding 2 Preview | — | Veure tauler |
| Gemini 3.1 Flash Image (Nano Banana 2) | — | Veure tauler |
| Gemini 3.1 Flash Image Preview (Nano Banana 2) | — | Veure tauler |
| Imagen 4.0 Standard | — | Veure tauler |
| Text Embedding 3 Small | — | Veure tauler |
| Gemini 3.1 Flash Lite Image (Nano Banana 2 Lite) | — | Veure tauler |
| Imagen 4.0 Fast | — | Veure tauler |
| MiniMax M2.5 | L2 | 1,860 |
| Gemini 3.5 Flash Lite | L2 | 1,575 |
| Gemini 3.1 Flash Lite | L2 | 1,575 |
| Gemini 3.1 Flash TTS Preview | — | Veure tauler |
| GPT-5.4 Nano | L2 | 1,050 |
| Gemma 4 31B | L2 | 856 |
| Nemotron-3 Super | L2 | 834 |
| GPT-OSS 120B | L2 | 720 |
| DeepSeek V4 Flash | L2 | 720 |
| Gemini 3 Flash Preview | L2 | 630 |
| Gemini Flash Latest | L2 | 630 |
| Gemini Omni Flash Preview | L2 | 630 |
| Veo 3.1 Standard | — | Veure tauler |
| Gemini 3.6 Flash | L3 | 7,798 |
| Gemini 3.5 Flash | L3 | 7,798 |
| Kimi K2.7 Code | L3 | 7,290 |
| Whisper-1 | — | Veure tauler |
| GPT-4o Transcribe | — | Veure tauler |
| GPT-4o Transcribe Diarize | — | Veure tauler |
| GLM-5.1 | L3 | 6,456 |
| Kimi K2.7 Code HighSpeed | L3 | 6,298 |
| Kimi K2.5 | L3 | 5,926 |
| Kimi K2.6 | L3 | 5,696 |
| Gemini Pro Latest | L3 | 5,249 |
| Gemini Robotics-ER 1.5 Preview | L3 | 5,249 |
| Gemini Robotics-ER 1.6 Preview | L3 | 5,249 |
| Claude Haiku 4.5-20251001 | L3 | 5,199 |
| GPT-5.6 Luna | L3 | 5,199 |
| GLM-5.2 | L3 | 5,138 |
| Qwen 3.5 397B | L3 | 4,834 |
| Nemotron-3 Ultra | L3 | 4,598 |
| DeepSeek V4 Pro | L3 | 3,600 |
| GPT-4o Mini Transcribe | — | Veure tauler |
| Mistral Large 3 675B | L3 | 3,200 |
| GPT-5.4 Mini | L3 | 3,149 |
| MiniMax M3 | L3 | 2,468 |
| MiniMax M2.7 | L3 | 2,100 |
| Claude Opus 5 | L4 | 25,993 |
| TTS-1 | — | Veure tauler |
| TTS-1 1106 | — | Veure tauler |
| Fish Audio S1 | — | Veure tauler |
| Fish Audio S2-Pro | — | Veure tauler |
| Fish Audio S2.1-Pro | — | Veure tauler |
| Fish Audio Transcribe-1 | — | Veure tauler |
| Fish Audio Voice Design-1 | — | Veure tauler |
| Kimi K3 | L4 | 15,596 |
| GPT-4o Mini TTS | — | Veure tauler |
| Gemini 3.1 Pro Preview | L4 | 10,497 |
| Gemini 3.1 Pro Preview (Custom Tools) | L4 | 10,497 |
| Gemini 3 Pro Preview | L4 | 10,497 |
| Claude Sonnet 5 | L4 | 10,397 |
| Antigravity Preview (05-2026) | L4 | 8,398 |
| Deep Research Max Preview (04-2026) | L4 | 8,398 |
| Deep Research Preview (04-2026) | L4 | 8,398 |
| Deep Research Pro Preview (12-2025) | L4 | 8,398 |
| Claude Fable 5 | L5 | 51,986 |
| TTS-1 HD | — | Veure tauler |
| TTS-1 HD 1106 | — | Veure tauler |
FAQ
Què són els tokens ponderats?
Els tokens ponderats son una mesura del cost real de comput. Els tokens d'input compten ×1, l'input cacheat ×0,1, els tokens d'output ×5, i els de raonament ×5. Aixo reflecteix que generar text es mes car que llegir-lo, i que el context cacheat es gairebe gratis de reutilitzar.
Quant costa una petició típica?
Una peticio amb 1.000 tokens d'input i 500 d'output usant GLM-5.2 (Nivell 3) produeix 3.500 tokens ponderats, el que costa 6 HC. Amb un pla Starter (1.500 HC/mes), aixo son aproximadament 250 peticions similars al mes.
Què passa quan s'esgoten els HC?
La plataforma canvia a mode economia. Nomes els models de Nivell 0 (Gratuit) estan disponibles, sense cost. Pots continuar treballant amb el model gratuit fins que els teus HC es restableixin al proper cicle de facturacio o facis una recarrega.
Els models de Nivell 0 són realment gratuïts?
Si. Els models de Nivell 0 costen 0 HC per milio de tokens ponderats. Funcionen en el nostre propi hardware GPU i capacitat cloud subvencionada. Estan disponibles a tots els plans, inclos el Trial gratuit, i romanen disponibles en mode economia quan s'esgoten tots els credits. El model gratuit es Qwen 3.6 35B.
Puc utilitzar les meves pròpies claus API?
Si. Pots portar les teves pròpies claus API per a qualsevol proveidor compatible o qualsevol endpoint compatible amb OpenAI. Les peticions fetes amb les teves claus no consumeixen HC — pagues al proveidor directament. Aixo et permet utilitzar models fora del nostre cataleg a les tarifes del proveidor.
Com es calculen les tarifes HC?
Les tarifes HC es calculen segun el cost computacional de cada model. Per a models LLM amb preus separats d'input/output, usem la formula de tokens ponderats: blended = (input + 5 × output) / 6, reflectint que l'output es 5× mes car que l'input.
Com funcionen les recàrregues de HC?
Pots comprar recarregues de HC en qualsevol moment: 10€ → 10.000 HC, 50€ → 50.000 HC (10% bonus), 100€ → 100.000 HC (15% bonus). Les recarregues mai no caduquen. Veure Preus per a mes detalls.
Quin és el càrrec mínim per petició?
El carc minim es 1 HC. Si el cost calculat d'una peticio es inferior a 1 HC (p.ex. una peticio molt curta de Nivell 1), s'arrodoneix a 1 HC. Les peticions de Nivell 0 sempre costen 0 HC independentment de la mida.
Per què alguns models mostren preus per unitat en lloc de HC/M?
Els models de TTS (text-a-veu), STT (veu-a-text), generacio d'imatges, generacio de video, musica i disseny de veu es cobren per unitat (per caracter, per minut, per imatge, per segon, per peticio) en lloc de per milio de tokens. Veure tauler per a detalls de preus per unitat.