agent harness
Aktualisiert 2026-06 · EN · DE

Was ist ein Agent Harness?

Ein Agent Harness ist die Schicht um ein Modell, die Handlungen eines Agenten verlässlich macht: Werkzeuge, Kontext, Berechtigungen, Feedback und die Schleife, die alles ausführt.

01 / Harness vor KI

Das Harness ist älter als Software.

Beim Pferd ist das Harness das Geschirr aus Riemen, das Kraft in gezogene Lasten und gepflügte Felder übersetzt. Es besitzt keine eigene Kraft. Es lenkt Kraft in kontrollierte, nützliche Arbeit und hält sie davon ab, dorthin zu wirken, wo sie nicht wirken soll.

Die Softwareentwicklung übernahm das Wort für Tests. Ein Test Harness ist der Code um den Code: Es richtet eine kontrollierte Umgebung ein, gibt dem Programm Eingaben, führt es aus und beobachtet die Ergebnisse. Die Form bleibt dieselbe: Das Harness ist nicht das, was ausgeführt wird. Es macht die Ausführung kontrollierbar und beobachtbar.

Beide Bedeutungen leben im heutigen KI-Gebrauch fort: kontrolliertes Handeln, beobachtbare Ausführung, wiederholbare Arbeit.

02 / Heutiger Gebrauch

Wie der Begriff heute verwendet wird.

Der gegenwärtige KI-Gebrauch ist noch nicht vereinheitlicht. Die wichtigsten Definitionen gruppieren sich um sechs Quellen. Die englischen Quellenzitate sind hier von mir übersetzt.

LangChain machte die Formel populär, die inzwischen viele wiederholen: „Agent = Modell + Harness. Wenn du nicht das Modell bist, bist du das Harness. Ein Harness ist jeder Teil von Code, Konfiguration und Ausführungslogik, der nicht das Modell selbst ist.“ Dazu zählen System-Prompts, Werkzeuge und ihre Beschreibungen, Dateisystem, Sandbox, Orchestrierungslogik und Hooks.

Cursor behandelt das Harness als Produktschicht, die gemeinsam mit jedem Modell abgestimmt wird: „Harness und Modell bestimmen gemeinsam, wie gut der Agent ist.“ Verschiedene Modelle erhalten unterschiedliche Bearbeitungswerkzeuge und Prompts, weil Modelle mit der Maschinerie am besten arbeiten, auf die sie trainiert wurden.

METR, eine Organisation für KI-Evaluation, verwendet das Wort Harness meist gar nicht. Dort heißt es Scaffold: die Struktur, die einem Modell Werkzeuge gibt und die Interaktionsschleife steuert. In diesem Sprachgebrauch gehören ReAct — „ein Agent handelt, sieht das Ergebnis und wiederholt den Vorgang“ — und Claude Code in dieselbe Kategorie: einfachere und aufwendigere Scaffolds.

Das Agenten-Glossar von Hugging Face zieht eine Grenze: Scaffolding ist die verhaltensbestimmende Schicht, von der das Modell aus arbeitet — Prompts, Werkzeugbeschreibungen, Parsing. Harness ist die Ausführungsschicht, die den Agenten betreibt — sie ruft das Modell auf, führt Werkzeuge aus und entscheidet, wann Schluss ist. Zugleich räumt das Glossar ein, dass die meisten Produkte in der Praxis „Harness“ für das Ganze verwenden. Es entstand, weil sich Forschende auf derselben Konferenz nicht auf die Bedeutung dieser Wörter einigen konnten.

OpenAI verwendet den Begriff am weitesten. Im Bericht über Harness Engineering reicht das Harness über die Software um das Modell hinaus bis in die Arbeitsumgebung selbst: Repository-Struktur, CI-Konfiguration, Linter, Dokumentation im Repository und Observability, die der Agent abfragen kann. Die Aufgabe von Engineering wird, „Umgebungen zu gestalten, Absicht zu spezifizieren und Feedbackschleifen zu bauen, die Codex- Agenten verlässliche Arbeit ermöglichen“.

Übereinstimmung. Das Modell ist nicht Teil des Harness. Das Harness umgibt es, führt Werkzeuge aus, betreibt die Schleife, entscheidet über das Ende und steuert, was das Modell sieht: Prompts, Gedächtnis und Kontext.

Offene Grenze. Der Begriff konkurriert weiterhin mit Scaffold; Hugging Face trennt beide in eigene Schichten. Die meisten Quellen enden bei der Software um das Modell. OpenAI erweitert Harness Engineering bis in die Arbeitsumgebung. Diese Seite verwendet die engere Grenze: Wenn alles, was ein Agent berührt, als Harness gilt, fehlt ein Wort für die Schichten, die danach kommen.

03 / Eine Arbeitsdefinition

Eine Arbeitsdefinition.

Auch Agent ist ein altes Wort: vom lateinischen agere, handeln. Der Handelnde im Gegensatz zu dem, an dem gehandelt wird. Die technische Bedeutung stammt aus dem Reinforcement Learning, wo ein Agent beobachtet, handelt und erneut beobachtet (HF-Glossar). In LLM-Systemen lautet die verbreitete Formel:

Agent = Modell + Harness

Das Modell erzeugt Text. Das Harness verwandelt diese Ausgabe in Arbeit:

Harness = Werkzeuge + Kontext + Schleife
  • Werkzeuge verbinden den Agenten mit der Welt: Dateioperationen, Shell-Befehle, Webzugriff, APIs. Das Modell kann nur die Absicht zu handeln ausdrücken; das Harness führt sie aus. (HF-Glossar)
  • Kontext ist alles, was das Harness dem Modell vorlegt: Anweisungen, Werkzeugbeschreibungen, über Sitzungen hinweg bewahrtes Gedächtnis und die fortlaufende Verwaltung eines begrenzten Kontextfensters. (Anthropic, Cursor)
  • Die Schleife betreibt das System: Modell aufrufen, angeforderte Handlung ausführen, Ergebnis zurückgeben, wiederholen und entscheiden, wann Schluss ist. Hier leben Berechtigungen: was der Agent ausführen darf und was Zustimmung braucht. Hier lebt auch Feedback: Tests, Überprüfung und Fehlermeldungen, mit denen der Agent sich korrigieren kann. Simon Willisons knappe Definition trifft es: Ein Agent „führt Werkzeuge in einer Schleife aus, um ein Ziel zu erreichen“.
Präzisionsnotizen

Zwei Details sind wichtig.

Die Schleife ist kein Teil wie die anderen. Sie betreibt die anderen. Eine genauere Schreibweise wäre Agent = Schleife(Modell, Werkzeuge, Kontext): das Harness als Funktion, das Modell als eines ihrer Argumente. Die Listenform ist leichter zu merken; die Funktionsform liegt näher am System.

Auch sind die Terme keine unabhängigen Variablen. Heutige Modelle werden innerhalb bestimmter Harnesses nachtrainiert, und Harnesses werden auf einzelne Modelle abgestimmt — bis hin zu verschiedenen Werkzeugen für Dateiänderungen (Cursor). Begrifflich ist die Trennung von Modell und Harness sauber. Empirisch wachsen beide gemeinsam; wer einen Term austauscht und den anderen festhält, verändert mehr, als die Gleichung vermuten lässt.

Arbeitsdefinition, Juni 2026: Ein Agent Harness ist die Werkzeug-, Kontext- und Schleifenschicht um ein Modell. Diese Seite verwendet die engere heutige Grenze und behandelt Scaffold als benachbarten Begriff. Wenn sich der Sprachgebrauch anders einpendelt, ändert sich die Definition. Der Agent ist nicht das Modell; er entsteht, wenn ein Harness die Beobachtungs-Handlungs-Schleife bereitstellt. Agent, Framework und Workflow voneinander abzugrenzen, gehört auf eine eigene Seite.

04 / Belege

Wie wichtig ist das Harness?

Viele Texte über Harnesses behaupten, sie seien wichtiger als das Modell. Die Belege sind gemischt.

Dafür spricht: Derselbe Modellwechsel in ein anderes Harness brachte einen Coding-Agenten auf Terminal-Bench 2.0 ungefähr von Platz 30 auf Platz 5 (LangChain). Cursor berichtet von wochenlangem Engineering pro Modell für die Abstimmung des Harness, weil die Verbesserungen real sind (Cursor).

Die Komplikation: METR verglich die autonome Aufgabenleistung von Frontier-Modellen mit minimalen Scaffolds und führenden Produkt-Harnesses und fand für die getesteten Modelle keinen statistisch signifikanten Unterschied im Zeithorizont.

Eine plausible Versöhnung: Harnesses zählen besonders dort, wo Arbeit interaktiv, umgebungsabhängig und werkzeugreich ist — und am wenigsten in stark reduzierten autonomen Messungen. Das bleibt eine Hypothese, kein Ergebnis.

05 / Genealogie

Woher das Wort kommt.

Die folgende Zeitleiste ordnet die wichtigsten Entwicklungsschritte des Begriffs ein.

  • Vor KI

    Das Test Harness: Code, der anderen Code unter kontrollierten Bedingungen ausführt und beobachtet. (Wikipedia)

  • 2021

    Das Wort gelangt über Evaluation in die LLM-Welt, nicht über Agenten: EleutherAIs lm-evaluation-harness wird zur Standardinfrastruktur, um Sprachmodelle gegen Benchmarks laufen zu lassen — ein direkter Nachfahre des Test Harness.

  • 2023

    Tool Use und Function Calling: Modelle erhalten einen strukturierten Weg, Handlungsabsicht auszudrücken; nun muss etwas diese Absicht ausführen.

  • 2023–2024

    Scaffolding: das frühe Wort für die Struktur um einen Agenten, verwendet von Evaluationsgruppen (METR führt diese Verwendung fort).

  • Nov. 2024

    Das Model Context Protocol standardisiert, wie Werkzeuge und Kontext Modelle erreichen, und macht die umgebende Schicht als Infrastruktur baubar.

  • 2025

    Agent Harness wird zum Begriff auf Produktseite: Claude Code beschreibt sich selbst als eines; SDKs werden als Harnesses veröffentlicht.

  • 2025–2026

    Harness Engineering erhält einen Namen als Disziplin (LangChain, OpenAI, O'Reilly); der Begriff erscheint zunehmend in wissenschaftlicher Übersichtsliteratur. „Scaffold“ bleibt daneben in Gebrauch.

Das Muster bleibt über jede Epoche des Wortes stabil: Das Harness ist niemals die Kraft. Es ist die Struktur, die Kraft kontrollierte, beobachtbare und wiederholbare Arbeit verrichten lässt.

06 / Offene Fragen

Fragen, die offen bleiben.

  • Harness oder Scaffold? Das Feld verwendet beides; ein Glossar trennt sie in eigene Schichten. Diese Seite verwendet „Harness“ im breiten Sinn, bis sich der Gebrauch stabilisiert.
  • Wie wichtig ist das Harness — und wo? Produktbenchmarks und autonome Evaluationen widersprechen sich derzeit. Wie sähe ein sauberes Experiment aus?
  • Wo genau endet das Harness? Die hier verwendete engere Definition endet an der Softwareschicht um das Modell. OpenAIs weiterer Gebrauch zieht die ganze Arbeitsumgebung hinein. Diese Grenze ist für die nächste Schicht entscheidend.
07 / Jenseits des Harness

Verlässliches Handeln ist noch keine regierbare Agency.

Ein Harness macht Handlungen eines Agenten verlässlich. Es sagt nicht, wer das Ziel gesetzt hat, mit welcher Autorität der Agent handelt, welche Normen ihn binden oder was geschieht, wenn seine Folgen die Sitzung überdauern. Das sind Fragen regierbarer Agency, nicht verlässlicher Ausführung — eine andere Schicht mit einem eigenen Namen: das Agent Habitat.

08 / Versionsgeschichte
  • 2026-06 Erste Fassung: Die Definition wurde vom Ursprung des Begriffs aus einer Untersuchung des heutigen Gebrauchs entwickelt (Anthropic, OpenAI, METR, LangChain, Hugging Face, Cursor).
  • 2026-06-12 Redaktionelle Überarbeitung: weniger erklärende Rahmung, straffere Übergänge und ein stärkerer Referenzton.
  • 2026-07-27 Deutsche Fassung veröffentlicht.

Werkzeuge lassen Agenten handeln. Harnesses machen Handlungen verlässlich. Habitats machen Agency regierbar.