Hermes Agent ist seit seinem Start im Februar 2026 einer der meistbeachteten Open-Source-KI-Agenten. Er läuft auf dem eigenen Rechner oder Server, merkt sich, was er gelernt hat, und baut sich aus erledigten Aufgaben wiederverwendbare Skills. In diesem Beitrag erfährst du, was Hermes Agent ausmacht, wie du ihn komplett lokal mit Ollama betreibst und wann du besser zu Claude Code greifst.
Was ist Hermes Agent?
Hermes Agent ist ein autonomer KI-Agent von Nous Research, veröffentlicht am 25. Februar 2026 unter der MIT-Lizenz. Anders als ein Coding-Assistent, der an eine IDE gebunden ist, oder ein Chatbot, der nur eine einzige API kapselt, ist Hermes als dauerhaft laufender Agent konzipiert: Er lebt auf deinem Laptop, einem günstigen VPS oder einer GPU-Maschine und wird mit jeder Sitzung leistungsfähiger.
Technisch ist Hermes ein sogenannter Agent-Harness: die Software-Schicht rund um ein Sprachmodell, die Werkzeuge, Gedächtnis, Berechtigungen und Ausführungsumgebung bereitstellt. Das Modell selbst ist austauschbar – Hermes funktioniert mit Nous Portal, OpenRouter, OpenAI, Anthropic und praktisch jedem OpenAI-kompatiblen Endpunkt, also auch mit lokalen Modellen über Ollama.
Das Projekt wächst rasant: Das GitHub-Repository zählt inzwischen weit über 200.000 Sterne, und die Release-Kadenz liegt bei etwa einem Minor-Release alle zwei bis drei Wochen (Stand September 2026: 0.20er-Reihe).

Die wichtigsten Features von Hermes Agent im Überblick
Der eingebaute Lernkreislauf
Das Alleinstellungsmerkmal von Hermes ist sein geschlossener Lernkreislauf:
-
Persistentes Gedächtnis: Der Agent pflegt selbst Notizen über Projekte und über dich (
MEMORY.md,USER.md) und erinnert sich periodisch daran, Wichtiges festzuhalten. -
Autonome Skill-Erstellung: Nach komplexen Aufgaben legt Hermes eigenständig Skills an und verbessert sie bei späterer Nutzung. Skills folgen dem offenen Standard von agentskills.io.
-
Sitzungssuche: Vergangene Gespräche sind per Volltextsuche (SQLite FTS5) durchsuchbar und werden bei Bedarf zusammengefasst.
-
Transparenz: Mit
/journeysiehst du eine Zeitleiste dessen, was der Agent über dich gelernt hat – und kannst Einträge korrigieren oder löschen.
Überall erreichbar
Ein einziger Gateway-Prozess verbindet Hermes mit Telegram, Discord, Slack, WhatsApp, Signal, E-Mail und weiteren Kanälen. Du startest eine Aufgabe im Terminal und fragst unterwegs per Telegram nach dem Stand – dieselbe Sitzung, dasselbe Gedächtnis.
Automatisierung und Parallelisierung
-
Cron-Scheduler: Tägliche Reports, nächtliche Backups oder wöchentliche Audits lassen sich in natürlicher Sprache planen und laufen unbeaufsichtigt.
-
Subagenten: Hermes kann isolierte Unteragenten starten, auch im Hintergrund, und deren Ergebnisse gebündelt zurückliefern.
-
MCP-Integration: Beliebige MCP-Server lassen sich anbinden.
Flexible Ausführungsumgebungen
Hermes kennt sieben Terminal-Backends: lokal, Docker, SSH, Singularity, Modal, Daytona und Vercel Sandbox. Mit Daytona oder Modal schläft die Umgebung im Leerlauf und kostet dann nahezu nichts.
Sicherheit
Potenziell gefährliche Befehle werden standardmäßig von einem separaten LLM-Reviewer geprüft („Smart Approvals”). Eigene Deny-Regeln blockieren Befehle zuverlässig, und Secrets lassen sich aus Bitwarden oder 1Password beziehen statt aus einer Klartext-.env.
Hermes Agent: Installation in fünf Minuten
Hermes läuft unter Linux, macOS, WSL2, Android (Termux) und inzwischen auch nativ unter Windows. Der Installer richtet Python 3.11, uv und alle Abhängigkeiten ohne Root-Rechte ein.
Linux, macOS, WSL2:
|
1 2 3 |
curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash source ~/.bashrc # bzw. ~/.zshrc hermes # Chat starten |
Windows (PowerShell, nativ):
|
1 |
iex (irm https://hermes-agent.nousresearch.com/install.ps1) |
Alternativ gibt es Hermes Desktop als native App für macOS und Windows.
Die wichtigsten Befehle:
| Befehl | Zweck |
|---|---|
hermes |
Interaktive Sitzung im Terminal (TUI) |
hermes model |
Provider und Modell einrichten bzw. wechseln |
hermes setup |
Vollständiger Einrichtungsassistent |
hermes tools |
Werkzeuge aktivieren/deaktivieren |
hermes gateway |
Messaging-Gateway starten |
hermes doctor |
Diagnose bei Problemen |
hermes update |
Auf die neueste Version aktualisieren |
Hinweis: Wie bei jedem
curl | bash-Installer gilt: Skript vorher ansehen, wenn du es in einer sicherheitskritischen Umgebung ausführst.
Hermes Agent mit lokalem LLM unter Ollama einrichten
Ein lokales Modell ist die Wahl, wenn Datenschutz, Offline-Betrieb oder null Token-Kosten im Vordergrund stehen. Hermes spricht Ollama über dessen OpenAI-kompatiblen Endpunkt http://localhost:11434/v1 an. Zwei Dinge entscheiden über Erfolg oder Frust:
-
Das Modell muss Tool Calling (Function Calling) beherrschen.
-
Ollama muss mit einem Kontextfenster von mindestens 64.000 Tokens laufen. Hermes verweigert den Start mit kleineren Fenstern, weil Systemprompt, Tool-Schemata, Gedächtnis und Arbeitsstand sonst nicht hineinpassen.
Voraussetzungen und Modellwahl
| Modell (Ollama) | Grober VRAM-Bedarf | Einsatz |
|---|---|---|
gemma4 |
ca. 16 GB | Reasoning und Code, Einstieg |
qwen3.6 |
ca. 24 GB | Reasoning, Code, Bildverständnis |
qwen2.5-coder:32b |
ca. 24 GB+ | Code-lastige Aufgaben |
Die Angaben beziehen sich auf die Modellgewichte. Das 64k-Kontextfenster benötigt zusätzlich Speicher für den KV-Cache – plane also Reserve ein. Kleine Modelle unter etwa 8B Parametern scheitern in der Praxis häufig an zuverlässigen mehrstufigen Tool-Aufrufen.
Variante A: Der Schnellweg mit ollama launch
Ollama bringt eine eigene Hermes-Integration mit:
|
1 |
ollama launch hermes |
Ollama installiert Hermes bei Bedarf, lässt dich ein lokales Modell auswählen, trägt den Endpunkt http://127.0.0.1:11434/v1 ein und setzt das Modell als Standard. Optional wird direkt ein Messaging-Kanal verbunden. Für einen ersten Test ist das der schnellste Weg. Das Kontextfenster musst du trotzdem selbst prüfen (siehe Schritt 2 unten).
Variante B: Manuelles Setup Schritt für Schritt
Schritt 1 – Ollama installieren und Modell laden
|
1 2 3 |
curl -fsSL https://ollama.com/install.sh | sh ollama pull qwen3.6 ollama show qwen3.6 # unter "Capabilities" sollte "tools" stehen |
Schritt 2 – Kontextfenster auf mindestens 64k anheben
Ollama nutzt standardmäßig nicht das volle Kontextfenster des Modells. Bei weniger als 24 GB VRAM liegt der Default bei nur 4.096 Tokens – der häufigste Grund, warum Hermes mit Ollama nicht startet oder „vergesslich” wirkt. Wichtig: Die Kontextlänge lässt sich nicht über die OpenAI-kompatible API setzen, sondern nur serverseitig.
Option 1 – Umgebungsvariable (empfohlen):
|
1 |
OLLAMA_CONTEXT_LENGTH=64000 ollama serve |
Option 2 – Ollama als systemd-Dienst:
|
1 2 3 4 5 |
sudo systemctl edit ollama.service # Einfügen: # [Service] # Environment="OLLAMA_CONTEXT_LENGTH=64000" sudo systemctl daemon-reload && sudo systemctl restart ollama |
Option 3 – Eigenes Modell mit fest eingebautem Kontext:
|
1 2 |
printf 'FROM qwen3.6\nPARAMETER num_ctx 64000\n' > Modelfile ollama create qwen3.6-64k -f Modelfile |
Kontrolle:
|
1 |
ollama ps # Spalte CONTEXT muss 64000 (oder mehr) zeigen |
Schritt 3 – Hermes installieren
|
1 |
curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash |
Schritt 4 – Ollama als Custom Endpoint verbinden
Interaktiv über den Assistenten:
|
1 2 3 4 5 6 |
hermes model # → "Custom endpoint (self-hosted / VLLM / etc.)" wählen # → API base URL: http://localhost:11434/v1 # → API key: leer lassen # → Modell: qwen3.6 (bzw. qwen3.6-64k) # → Context length: leer lassen (Auto-Erkennung) oder 64000 |
Oder direkt in ~/.hermes/config.yaml:
|
1 2 3 4 5 |
model: default: qwen3.6 provider: custom base_url: http://localhost:11434/v1 context_length: 64000 |
Schritt 5 – Testen
|
1 2 3 |
curl http://localhost:11434/v1/models # Endpunkt erreichbar? hermes doctor # Konfiguration prüfen hermes # Sitzung starten |
Beim Start zeigt Hermes das erkannte Kontextlimit an. Stelle anschließend eine Aufgabe, die ein Werkzeug erfordert, etwa „Liste die Dateien im aktuellen Verzeichnis auf”. Führt Hermes das Tool aus, funktioniert Tool Calling.
Sonderfall Windows mit WSL2
Läuft Ollama unter Windows und Hermes in WSL2, zeigt localhost in WSL2 standardmäßig auf die Linux-VM, nicht auf Windows. Die einfachste Lösung unter Windows 11 ist der Mirrored-Networking-Modus:
|
1 2 3 |
# %USERPROFILE%\.wslconfig [wsl2] networkingMode=mirrored |
Danach wsl --shutdown ausführen und WSL neu öffnen. Alternativ installierst du Ollama direkt in WSL2 – dann entfällt das Problem vollständig. Wer mit der Host-IP arbeitet, muss Ollama per OLLAMA_HOST=0.0.0.0 auf alle Interfaces binden und ggf. Port 11434 in der Windows-Firewall freigeben.
Troubleshooting
| Symptom | Ursache | Lösung |
|---|---|---|
| Hermes startet nicht, meldet zu kleinen Kontext | Ollama-Default (4k/32k) | OLLAMA_CONTEXT_LENGTH=64000 oder Modelfile mit num_ctx |
| Tool-Aufrufe erscheinen als JSON-Text im Chat | Modell ohne Tool-Support | Modell mit tools-Capability wählen (ollama show) |
| Agent „vergisst” frühere Schritte | Kontext läuft über, Server verwirft alte Nachrichten | Kontext erhöhen, ollama ps prüfen |
| „Connection refused” aus WSL2 | Netzwerk-Trennung WSL2/Windows | Mirrored Mode oder Host-IP + OLLAMA_HOST=0.0.0.0 |
Was „lokal” bei Hermes bedeutet – und was nicht
Mit Ollama bleibt die Inferenz auf deiner Hardware. Hilfsaufgaben wie Kontextkompression oder Bildanalyse laufen standardmäßig über dasselbe Hauptmodell, bleiben also ebenfalls lokal. Einige Werkzeuge – Websuche, Browser-Automatisierung, Text-to-Speech – nutzen dagegen externe Dienste, sofern du sie aktivierst. Für ein vollständig abgeschottetes Setup deaktivierst du diese Werkzeuge über hermes tools oder setzt selbst gehostete Alternativen ein (für Web-Scraping z. B. eine eigene Firecrawl-Instanz).
Hermes Agent vs. Claude Code
Beide werden oft in einem Atemzug genannt, lösen aber unterschiedliche Probleme. Kurz gesagt: Claude Code ist ein Coding-Agent für die Arbeit im Repository, Hermes ist ein dauerhaft laufender Allzweck-Agent mit Gedächtnis.
Vergleichstabelle
| Kriterium | Hermes Agent | Claude Code |
|---|---|---|
| Hersteller | Nous Research | Anthropic |
| Lizenz | Open Source (MIT) | Proprietär |
| Schwerpunkt | Persistente Automatisierung, persönlicher Assistent, Ops | Softwareentwicklung im Repository |
| Modelle | Modellagnostisch: 300+ Cloud-Modelle, jeder OpenAI-kompatible Endpunkt | Auf Claude-Modelle ausgelegt (Anthropic API, Bedrock, Vertex) |
| Lokale LLMs (Ollama) | Ja, offiziell unterstützt | Nicht vorgesehen |
| Laufzeitmodell | Daemon, läuft dauerhaft | Sitzungsbasiert; Cloud- und Desktop-Sitzungen können weiterlaufen |
| Oberflächen | TUI, Desktop-App, 15+ Messenger, API-Server | Terminal, IDE (VS Code, JetBrains), Desktop, Web, CI |
| Gedächtnis | Projektübergreifend, vom Agenten selbst kuratiert | Projektbezogen über CLAUDE.md plus Auto-Memory |
| Skills | Legt Skills selbst an und verbessert sie | Skills, Hooks, Plugins – vom Nutzer bzw. Team definiert |
| Scheduling | Eingebauter Cron, selbst gehostet | Routines (Cloud), geplante Tasks in der Desktop-App, /loop |
| Multi-Agent | Subagenten, auch im Hintergrund | Subagenten und Agent Teams |
| Erweiterbarkeit | MCP, Plugins, Skills Hub | MCP, Hooks, Plugins, Skills |
| Betrieb | Selbst hosten: Updates, Secrets, Monitoring liegen bei dir | Verwaltet von Anthropic, kaum Infrastrukturaufwand |
| Kosten | Software kostenlos; du zahlst Modell-Tokens oder eigene Hardware | In Claude Pro/Max enthalten oder nutzungsbasiert per API |
Wo Hermes stärker ist
-
Modellfreiheit und Souveränität: Kein Vendor-Lock-in, lokale Modelle möglich, alle Daten bleiben auf deinem System. Für Unternehmen mit strengen Datenschutzvorgaben ist das oft das entscheidende Argument.
-
Langlebige Automatisierung: Recherche-Loops, tägliche Briefings, Monitoring und Reports laufen per Cron ohne geöffnete Sitzung und werden per Messenger zugestellt.
-
Lernen über Monate: Der Agent wird mit jeder Nutzung besser in wiederkehrenden Abläufen, ohne dass du Anweisungen manuell pflegen musst.
-
Erreichbarkeit: Telegram, Slack, WhatsApp & Co. sind erstklassige Oberflächen, nicht nur Zusatz.
Wo Claude Code stärker ist
-
Tiefe in der Softwareentwicklung: Codebasis verstehen, Multi-File-Refactorings, Tests ausführen, Diffs prüfen, Commits und Pull Requests vorbereiten – dafür ist Claude Code gebaut.
-
IDE- und Workflow-Integration: Inline-Diffs in VS Code und JetBrains, CI-Anbindung, Hooks für Team-Konventionen.
-
Explizite, reproduzierbare Projektregeln:
CLAUDE.mdliegt versioniert im Repository. Viele Entwickler bevorzugen diese explizite Kontrolle gegenüber einem Gedächtnis, das sich der Agent selbst schreibt. -
Kein Betriebsaufwand: Kein Server, keine Modell-Hosting-Fragen, kein Patch-Management.
Ein Detail zur Kombination
Hermes kann Claude-Modelle nutzen – per Anthropic-API-Key (Abrechnung pro Token) oder per OAuth mit einem Claude-Max-Abo. Laut Hermes-Dokumentation verbraucht der OAuth-Weg allerdings nur zusätzlich gekaufte Extra-Usage-Credits, nicht das im Max-Abo enthaltene Kontingent; mit Claude Pro funktioniert er gar nicht. Wer beides einsetzt, sollte das bei der Kostenplanung berücksichtigen.
Entscheidungshilfe
-
Du schreibst hauptberuflich Code und willst schneller ausliefern? → Claude Code.
-
Du willst einen Assistenten, der rund um die Uhr läuft, sich erinnert und per Messenger erreichbar ist? → Hermes Agent.
-
Du brauchst lokale Modelle oder volle Datenhoheit? → Hermes Agent mit Ollama.
-
Beides trifft zu? → Viele Teams kombinieren die Tools: Claude Code für die Arbeit im Repository, Hermes für die langlebige Automatisierung drumherum.
FAQ: Häufige Fragen zu Hermes Agent
Ist Hermes Agent kostenlos?
Ja. Die Software steht unter der MIT-Lizenz. Kosten entstehen nur für die genutzten Modelle (API-Tokens oder eigene Hardware) und optional für das Abo von Nous Portal, das Modelle und Werkzeuge wie Websuche unter einem Konto bündelt.
Welche Hardware brauche ich für Hermes mit Ollama?
Für brauchbare Ergebnisse eine GPU mit mindestens 16 GB VRAM (z. B. für gemma4), besser 24 GB. Hinzu kommt Speicher für das 64k-Kontextfenster. Auf einem Mac mit Apple Silicon und ausreichend Unified Memory funktioniert Ollama ebenfalls.
Warum startet Hermes nicht mit meinem Ollama-Modell?
Fast immer ist das Kontextfenster zu klein. Setze OLLAMA_CONTEXT_LENGTH=64000 und prüfe mit ollama ps, ob der Wert aktiv ist.
Läuft Hermes Agent unter Windows?
Ja, inzwischen nativ per PowerShell-Installer oder klassisch in WSL2. Hermes Desktop gibt es für Windows und macOS.
Kann Hermes Agent Claude Code ersetzen?
Für gelegentliche Skripte und Automatisierungen ja. Für intensive Arbeit in großen Codebasen ist Claude Code spezialisierter. Die meisten Vergleiche kommen zum Schluss, dass sich beide Tools eher ergänzen als ersetzen.
Woher kommt der Name?
Hermes ist der Götterbote der griechischen Mythologie – passend für einen Agenten, der über viele Kanäle kommuniziert. Nous Research vertreibt unter demselben Namen auch eine Familie offener Sprachmodelle; der Agent ist aber mit beliebigen Modellen nutzbar.
Fazit
Hermes Agent füllt eine Lücke, die klassische Coding-Assistenten offenlassen: einen quelloffenen, selbst gehosteten Agenten, der dauerhaft läuft, dazulernt und dort erreichbar ist, wo du ohnehin kommunizierst. Mit Ollama lässt er sich vollständig lokal betreiben – vorausgesetzt, du wählst ein Modell mit Tool-Support und hebst das Kontextfenster auf mindestens 64k an. Im Vergleich mit Claude Code gibt es keinen klaren Sieger, sondern zwei Werkzeuge für unterschiedliche Aufgaben: Claude Code für die Arbeit am Code, Hermes für alles, was darüber hinaus dauerhaft laufen soll.
Quellen
-
Hermes Agent Docs – LLM and Model Providers (Ollama, Custom Endpoints, WSL2)
-
Nous Research ships Bot Mode for Hermes Agent (MarkTechPost)
