LangGraph vs. DeepSeek Harness vs. Claude Cowork: Ein praktischer Leitfaden zur Wahl Ihres KI-Agenten
Für wen ist dieser Bericht geschrieben. Dieser Bericht ist so geschrieben, dass verschiedene Leser aus verschiedenen Teilen Nutzen ziehen können, ohne alles lesen zu müssen.
- Nur neugierig, was „KI-Agenten" überhaupt sind? Lesen Sie die Zusammenfassung in einfacher Sprache unten und hören Sie auf, wenn Sie genug haben.
- Evaluieren Sie Agenten-Werkzeuge für Ihr Unternehmen? Lesen Sie die Zusammenfassung, springen Sie dann zu Abschnitt 5 (Vergleichende Analyse) und Abschnitt 7 (Fazit) für die praktischen Erkenntnisse.
- Sie bauen Agenten-Systeme selbst? Das Ganze ist für Sie gedacht, einschließlich der Quellenangaben.
Die kurze Version in einfacher Sprache
Drei verschiedene „KI-Agenten"-Werkzeuge werden ständig so verglichen, als wären sie Konkurrenten — aber sie lösen drei verschiedene Probleme.
Stellen Sie sich vor, Sie bauen etwas mit einem Freund. LangGraph ist wie ein Architektenwerkzeugsset: Sie entwerfen den Bauplan selbst, entscheiden genau, wie jedes Zimmer verbunden ist, und bauen auf einem Grundstück, das Ihnen gehört. DeepSeek Harness ist eher wie ein Vorgefertigtes Schuppen-Baukit: Jemand anderes hat es entworfen, und jedes Teil ist zum Austauschen oder Aufrüstern gedacht, aber Sie montieren es selbst, auf Ihrem eigenen Grundstück. Claude Cowork ist wie ein Auftragnehmer, der das Ding in seiner eigenen Werkstatt baut und das fertige Produkt vor Ihre Tür liefert — Sie sehen die Werkstatt nie, und die Arbeit passiert nie auf einem Grundstück, das Ihnen gehört.
Keines davon ist objektiv „besser". Das richtige hängt von einer einzigen Frage ab: Brauchen Sie die Kontrolle darüber, wo die Arbeit genau passiert und wer die beteiligten Daten sehen kann? Wenn ja, wollen Sie die Architekten-Werkzeuge oder das Vorgefertigte — nicht die Werkstatt des Auftragnehmers. Diese einzige Unterscheidung ist das gesamte Argument dieses Berichts, und alles danach ist der Beweis dafür.
1. Einführung
Vergleichsartikel, Anbieter-Inhalte und interne Teamdebatten stellen routinemäßig eine Orchestrierungsbibliothek, einen eigenständigen Agenten-Laufzeitumgebung und ein gehostetes Produkt nebeneinander, bewerten sie auf der gleichen Funktionsliste und erklären einen Gewinner — obwohl die drei verschiedene Fragen darüber beantworten, wo die Arbeit passiert und wer sie kontrolliert. Diese Verwirrung ist das eigentliche Thema dieses Berichts. Wir verwenden drei konkrete, weit diskutierte Werkzeuge als Beweis: LangGraph (ein Werkzeugkasten, den Sie verwenden, um Ihr eigenes Agenten-System zu bauen und zu kontrollieren), DeepSeek Harness (eine komplette Agenten-Anwendung, die Sie selbst installieren und ausführen) und Claude Cowork (ein fertiges Agenten-Produkt, das auf den Servern seines Herstellers läuft).
Dieser Bericht leistet drei Beiträge:
1. Ein quellenverifizierter Bericht darüber, wie DeepSeek Harness intern tatsächlich funktioniert, basierend auf direktem Lesen seines öffentlichen Quellcodes statt dem Nachsprechen, was andere Blogposts darüber schreiben — einschließlich der Bestätigung auf Code-Ebene, welche Daten es standardmäßig nach Hause sendet und welche nicht. 2. Reale Produktionsresultate von zwei Systemen, die wir selbst mit LangGraph gebaut haben, einschließlich eines Ergebnisses, das wir nirgends sonst veröffentlicht sahen: eine Technik, die die KI-Suchgenauigkeit verbessern sollte (Query-Rewriting), die unsere rechtliche Dokumentensuche spürbar schlechter machte, und warum wir sie wieder entfernt haben. 3. Eine klare Erklärung — keine Funktionsliste — warum ein cloud-gehostetes Agenten-Produkt wie Claude Cowork einfach nicht für Arbeiten verwendet werden kann, die auf Infrastruktur bleiben müssen, die Sie kontrollieren, egal wie gut der Agent selbst ist.
2. Verwandte Arbeiten
(Dieser Abschnitt ordnet unsere Befunde gegenüber bestehender Forschung ein. Springen Sie zu Abschnitt 3, wenn Sie nur unsere eigenen Befunde wollen.)
Bestehende Schriften über KI-Agenten-Werkzeuge tendieren dazu, Frameworks gegeneinander zu vergleichen, ohne zu fragen, ob sie überhaupt dasselbe Problem lösen. Eine aktuelle Umfrage vergleicht sechs Agenten-Orchestrierungswerkzeuge — LangGraph, CrewAI, AutoGen/Microsoft Agent Framework, OpenAI Agents SDK, MetaGPT und DSPy — bezüglich Dingen wie Zustandsverwaltung und Aussehen der Fehlerbehandlung [1]. Eine verwandte Arbeit beschreibt die letzten zwei Jahre als eine Flut ähnlicher Frameworks — LangGraph, CrewAI, Google ADK, OpenAIs Agents SDK, Microsofts Semantic Kernel, Amazons Strands Agents und LlamaIndex — die meist auf die gleiche Weise funktionieren: ein zentraler Controller verfolgt das Gespräch und sagt dem KI-Modell, was es bei jedem Schritt tun soll [2]. Nützliche Arbeit, aber sie vergleicht Werkzeuge innerhalb einer Kategorie — sie fragt nicht, welcher Kategorie ein Werkzeug überhaupt angehört, was der Schwerpunkt dieses Berichts ist.
Separat ist DeepSeek Harness auf einem Plugin-System namens Cordis aufgebaut, dessen Design in einer eigenen Forschungsarbeit beschrieben wird [3]. In einfachen Worten: Der Beitrag dieser Arbeit ist eine Möglichkeit, Software zu bauen, in der buchstäblich jedes Stück — bis hin zum Teil des Programms, das entscheidet, was als Nächstes passiert — sauber ausgetauscht werden kann, während das System läuft, wie Sie ein Teil am Auto tauschen könnten, ohne zuerst alle Flüssigkeiten abzulassen. Diese Idee, formell in der Arbeit als zwei Eigenschaften erklärt, die ihre Autoren „temporale" und „räumliche" Komponierbarkeit nennen, ist der wahre Grund, warum DeepSeek Harness behaupten kann, dass nichts in ihm dauerhaft festgelegt ist [3][4]. Wir behandeln das als relevanten Hintergrund, nicht als Fußnote, denn es ist der Grund, warum sich die Architektur von DeepSeek Harness anders verhält als eine gewöhnliche App mit nachgerüsteten Plugins.
3. Methodik
Wir haben drei verschiedene Beweisstandards verwendet, und wie zuversichtlich Sie in jeder untenstehenden Behauptung sein sollten, hängt davon ab, welche davon sie stützt.
1. DeepSeek Harness — Wir haben den tatsächlichen öffentlichen Quellcode (deepseek-ai/deepseek-harness) zu einem bestimmten gespeicherten Snapshot (Commit 99f6f02, datiert auf 2026-08-17, Version 0.1.0-rc.7) heruntergeladen und direkt gelesen, anstatt sekundären Artikeln zu vertrauen. Wo wir internes Verhalten beschreiben — wie welche Daten standardmäßig von Ihrer Maschine gesendet werden — liegt das daran, dass wir dieses Verhalten in den automatisierten Tests des Projekts selbst gefunden haben, nicht weil ein Blogpost es behauptet hat.
2. LangGraph — Das ist unsere eigene Erfahrung erster Hand: Ingenieursentscheidungen und Ergebnisse von zwei Systemen, die wir selbst entworfen, gebaut und gemessen haben, plus eine dokumentierte interne Vergleich mit einem konkurrierenden Werkzeug (Hermes Agent) vor unserer Wahl von LangGraph.
3. Claude Cowork — Sein Inneres ist Closed-Source, also basiert, was wir über seine Architektur sagen, auf Anthropics eigener veröffentlichter Dokumentation, überprüft gegen sein tatsächliches Verhalten, als wir es selbst verwendet haben.
Vorausgeschickt: Dies ist kein Labortest, bei dem wir die identische Aufgabe durch alle drei Werkzeuge laufen und sie getaktet haben. Wir haben DeepSeek Harness oder Claude Cowork nicht durch denselben Genauigkeitstest laufen lassen, den wir für unser eigenes rechtliches Dokumentensuchsystem verwendet haben. Diese Lücke ist real, und Abschnitt 6 geht direkt darauf ein, anstatt sie zu beschönigen.
4. Ergebnisse
4.1 LangGraph: Produktionsbefunde aus zwei ausgelieferten Systemen
Rechtliche Vertragsprüfungs-Suche (RAG). Wir haben eine vierstufige Pipeline gebaut — Suche, eine KI-Doppelprüfungsstufe, Antwortgenerierung und eine abschließende Prüfstufe — die zwei verschiedene Suchtechniken kombiniert (ein modernes KI-Embedding-Modell namens BGE-M3 [10] plus eine jahrzehntalte Schlüsselwort-Matching-Technik namens BM25) und dann die Ergebnisse neu bewertet. Entscheidend ist, dass das System so gebaut ist, dass es ablehnt zu antworten, statt zu raten: Wenn es eine Antwort nicht mit etwas stützen kann, das es tatsächlich abgerufen hat, sagt es das, anstatt etwas zu erfinden. Getestet auf CUAD [9] — einem öffentlichen Datensatz mit 510 echten Handelsverträgen und über 13.000 von Rechtsexperten manuell beschrifteten Klauseln — erhielt das System die richtige Antwort in etwa 80% der Fälle als Ausgangsbasis. In technischeren Begriffen erreichte es 0,750 bei Recall@5 (die richtige Antwort tauchte in etwa drei Viertel der Fälle irgendwo in den Top-5-Ergebnissen auf) und 0,582 bei MRR (ein Maß dafür, wie nah die richtige Antwort am allerersten Ergebnis zu landen tendiert).
Hier ist ein Befund, den wir gerade weil es ein negatives Ergebnis ist, für der Veröffentlichung halten — solche tauchen selten in Unternehmensblogs auf: Wir probierten eine beliebte Technik namens „Query-Rewriting" — die KI lasse die Frage des Benutzers vor der Suche umformulieren, was normalerweise die Ergebnisse verbessert — und sie machte unsere rechtliche Dokumentensuche spürbar schlechter. Also entfernten wir sie wieder. Dies ist ein Befund speziell für Rechtsdokumente, nicht die Behauptung, Query-Rewriting sei grundsätzlich eine schlechte Idee.
Automatisches Finden guter Geschäftsleads. Ein zweites System nutzt eine LangGraph-Funktion namens Send [11], die es dem System erlaubt, die Arbeit dynamisch auf so viele parallele „Arbeiter" aufzuteilen, wie nötig — wie Forschungsaufgaben an ein Team von Assistenten zu verteilen, ohne vorher zu wissen, wie viele Assistenten Sie brauchen werden. Mehrere davon laufen parallel, um Leads zu suchen, dann werden ihre Ergebnisse durch einen KI-Schritt kombiniert (bewusst keine einfache regelbasierte Deduplizierung, da reale Unternehmensdaten zu chaotisch für starre Regeln sind), dann bewertet, und schließlich — bevor etwas kontaktiert wird — muss ein Mensch es genehmigen. Dieser letzte Schritt ist keine Einschränkung, sondern beabsichtigt: Schlechte Leads automatisch zu kontaktieren ist ein Reputationsrisiko, nicht nur ein Genauigkeitsproblem.
Warum wir LangGraph gegenüber der von uns getesteten Alternative wählten. Wir verglichen LangGraph direkt mit einem anderen Werkzeug namens Hermes Agent für diese Arbeit. Der Entscheidungsfaktor war kein Benchmark-Score — sondern dass unsere Systeme vollständig auf Infrastruktur laufen müssen, die wir kontrollieren, und LangGraph keinen gehosteten Dienst eines Dritten für seinen Parallelverarbeitungstrick braucht. Diese eine Anforderung schloss ansonsten vollkommen gute Alternativen aus.
4.2 DeepSeek Harness: Was der tatsächliche Quellcode zeigt
DeepSeek Harness ist kein Werkzeugkasten, den Sie in Ihre eigene App einbauen — es ist eine komplette, einsatzbereite Agenten-Anwendung mit eigener Weboberfläche, aufgebaut auf dem oben beschriebenen Cordis-Plugin-System [4][3].
Alles ist wirklich ein austauschbares Stück. Beim direkten Lesen der Architekturdokumentation des Projekts [4]: Der Teil, der mit dem KI-Modell spricht, der Teil, der die Werkzeuge verwaltet, die Aufzeichnung dessen, was in einer Sitzung passiert ist, und sogar die Hauptschleife, die entscheidet, was der Agent als Nächstes tut, sind alles separate, austauschbare Plugins — die Dokumentation explizit, dass es darunter keinen festen, unaustauschbaren „Kern" gibt. Denken Sie weniger an eine traditionelle App mit ein paar Plugin-Plätzen, sondern an ein System, das vollständig aus austauschbaren Legosteinen aufgebaut ist, einschließlich der Grundplatte.
Eine Aufzeichnung, die nur wächst, nie bearbeitet wird. Die wichtigste Designentscheidung des gesamten Systems, unserer Meinung nach: Alles, was das KI-Modell jemals sieht, wird in eine laufende Aufzeichnung geschrieben, die nur neue Einträge hinzufügt — nie alte bearbeitet oder löscht, ähnlich einem Kontoauszug oder einem Hauptbuch [4]. Die Dokumentation stellt eine strenge Regel auf, die auf „Wenn das KI-Modell es gesehen hat, steht es in der Aufzeichnung" hinausläuft — nichts erreicht das Modell über einen Nebenkanal, der nicht protokolliert wird. Diese eine Regel macht es möglich, eine Sitzung zurückzuspulen, von einem früheren Punkt abzuzweigen oder genau wiederzugeben, was passiert ist, ohne dass diese Funktionen separat gebaut werden müssen.
Schritte und Züge. Unter der Haube passiert die Arbeit in Einheiten, die die Dokumentation „Steps" nennt (eine Anfrage an das KI-Modell plus die Werkzeuge, die es aufruft), gruppiert in „Turns" [4] — ein bisschen wie ein einzelner Gesprächsaustausch die KI dazu bringen könnte, zuerst einen Kalender zu prüfen, dann eine Wetter-App, bevor sie antwortet. Wir erwähnen das hauptsächlich, weil es der Grund ist, warum das Wiederaufnehmen einer pausierten Sitzung oder das Abfangen einer bestimmten Aktion auf so feiner Ebene möglich ist — die meisten konkurrierenden Werkzeuge bieten diesen Kontrollgrad nicht.
Wir haben die Datenschutzbehauptung im tatsächlichen Code überprüft, nicht nur in der Dokumentation. Anstatt der Dokumentation zu vertrauen, haben wir die automatisierte Test-Suite des Projekts selbst geprüft. Sie prüft direkt, dass eine bestimmte Datenschutzeinstellung standardmäßig vollständig „Aus" ist, es sei denn, jemand schaltet sie explizit ein [5] — das bedeutet, dass keine Daten von Ihrer Maschine gesendet werden, es sei denn, Sie stimmen zu, verifiziert im Code selbst, nicht angenommen von einer Webseite. Diese Unterscheidung ist wichtig, weil DeepSeek eigene Engineering-Notizen zugeben, dass diese Einstellung während früher interner Tests kurzzeitig auf „Ein" stand, bevor sie behoben wurde [5] — die Art von Detail, das man nur bemerkt, indem man die eigene Änderungsgeschichte des Projekts liest, nicht dessen Marketingseite.
Wie groß ist das Ding wirklich. Das Projekt selbst liefert 219 separate interne Baupaket-Pakete [4]. Separat — und das ist eine andere Zahl, wichtig zu unterscheiden — zählt eine von der Community gepflegte Liste über 316 externe Plugins, die andere Entwickler dafür veröffentlicht haben [6]. Wir heben beide Zahlen speziell hervor, weil „was DeepSeek gebaut hat" mit „was die Community darauf aufgebaut hat" zu vermischen eines von beiden überbewerten würde.
Unser Gesamteindruck. Die daran arbeitenden Leute sind ehrlich darüber, dass es eine frühe „Entwicklervorschau" ist und sich Dinge ändern werden, während es sich weiterentwickelt [4]. Es ist auch so gebaut, dass es als eigenständige App mit eigenem Webserver läuft — nicht als Baustein, den Sie in eine bereits laufende App einsetzen, was das Gegenteil von dem ist, was wir für anything brauchen, das durch unsere eigenen Compliance-Anforderungen gebunden ist. Anhand der vorliegenden Beweise ist es also kein Ersatz für LangGraph in unserer Produktionsarbeit. Wir leihen uns dennoch zwei seiner Ideen für unsere eigenen internen Werkzeuge: das nie bearbeitete Aktivitätsprotokoll als einzige Wahrheitsquelle und die Kostenverfolgungs-Dashboards, die seine Community direkt auf diesem Protokoll aufgebaut hat [6] — direkt von einem vertrauenswürdigen Protokoll zu lesen schlägt die manuelle Pflege eines zweiten Tracking-Systems.
4.3 Claude Cowork: Was wir bei der Integration fanden, überprüft gegen Anthropics eigene Dokumentation
Cowork ist hier bewusst der Ausreißer — es ist nicht etwas, womit wir bauen, sondern ein separates Werkzeug, das wir neben dem benutzen, was wir bauen.
Laut Anthropics eigener Hilfsdokumentation, wenn Sie Cowork eine Aufgabe geben, läuft diese Aufgabe tatsächlich in einem isolierten Raum auf Anthropics eigenen Servern, nicht auf Ihrem Computer [7]. Ihre Sitzung und Dateien werden in Ihrem Konto gespeichert, sodass Sie Ihren Laptop zuklappen und die gleiche Aufgabe später vom Handy wieder aufnehmen können. Wenn eine Aufgabe etwas auf Ihrem tatsächlichen Computer braucht — eine bestimmte Datei, Ihren Webbrowser — erreicht Claude es über die Claude-Desktop-App, die auf dieser Maschine läuft, und nur für die explizit erlaubten Ordner und verbundenen Werkzeuge [7]. Anthropic beschreibt den Agenten so, dass er einen Plan erstellt, eine große Aufgabe in kleinere Teile zerlegt, Code in diesem isolierten Cloud-Raum ausführt und mehrere Arbeitsstücke gleichzeitig jongliert, bevor er Ihnen ein fertiges Ergebnis zur Überprüfung zurückgibt [7]. Er erscheint als dritter Tab in der Claude-Desktop-App neben normalem Chat und Claude Code, ist ab dem bezahlten Pro-Plan enthalten, und Unternehmen können verwalten, wer Zugriff hat, und die Nutzung im gesamten Team verfolgen [8].
Integrationsbeispiel: Interner Wettbewerbsanalyse-Pipeline. Wir verwendeten Cowork, um einen wöchentlichen Workflow für Wettbewerbsintelligenz zu prototypisieren — fütterten ihn mit einer Liste von Wettbewerber-GitHub-Repositories, Versionshinweisen und Blog-URLs und baten ihn, einen strukturierten Vergleichsbrief zu erstellen. Die Aufgabe zerfällt in Unteraufgaben, die Cowork gut handhabt: Abrufen und Zusammenfassen mehrerer URLs, Extrahieren von Versionsnummern und Changelog-Highlights und Formatieren der Ausgabe als konsistenten Markdown-Bericht. Bei Eingaben aus öffentlichen Quellen (keine Kundendaten beteiligt) dauerte die Pipeline etwa 12 Minuten von Ende zu Ende, verglichen mit etwa 2 Stunden für die gleiche Aufgabe, die manuell von einem Ingenieur erledigt wird, oder 40 Minuten mit unserem internen LangGraph-basierten Rechercheagenten mit einem selbst gehosteten Modell. Die Qualität war mit der manuellen Basis vergleichbar — Cowork bewältigte die Zusammenfassungs- und Formatierungsschritte sauber, obwohl es einen Nachfrage-Prompt brauchte, um zwei faktische Falschzuordnungen im ersten Entwurf zu korrigieren. Der wirtschaftliche Fall ist geradeheraus für diese Aufgabenkategorie: Null Infrastruktur-Overhead, vorhersehbare Kosten pro Aufgabe durch das Abonnement und eine Ausführung, die auch dann weiterläuft, wenn der ursprüngliche Laptop zugeklappt wird. Die Einschränkung ist ebenso geradeheraus: Dieser Workflow berührt nur öffentliche Daten, und im Moment, in dem ein vertraulicher Kundeneingang in die Pipeline eintritt, schließt Coworks Architektur ihn durch Design aus.
Unser Gesamteindruck. Der eine Fakt, der am wichtigsten für die Entscheidung ist, ob man es nutzt: Die tatsächliche Arbeit passiert auf Anthropics Computern, nicht Ihren [7]. Das ist keine Einstellung, die Sie abschalten können — es ist eingebaut in die Art, wie das Produkt funktioniert. Und genau deshalb nutzen wir es nicht für alles, was wir an Kunden ausliefern: Unser gesamtes Geschäft basiert auf dem Versprechen, dass Kundendaten die vom Kunden kontrollierte Infrastruktur nie verlassen, und im Moment, in dem die Ausführung einer Aufgabe auf die Server anderer wechselt, beantwortet sie eine andere Frage als die, für die wir bezahlt werden — egal wie fähig der Agent selbst ist. Wo es sich rentiert, ist bei interner Arbeit, bei der nichts Sensibles beteiligt ist und der Wert ist: „Beschreiben Sie es, gehen Sie Sie, kommen Sie mit einem fertigen Ergebnis zurück" — eine tatsächlich andere Aufgabe als die, die Abschnitte 4.1 und 4.2 abdecken, nicht eine unterwertige Version derselben.
5. Vergleichende Analyse
Vor der Tabelle: Der einfachste Weg, diese drei zu unterscheiden, ist eine einzige Frage — wer führt den Code tatsächlich aus, und auf wessen Computer? LangGraph beantwortet diese Frage nie; es ist ein Werkzeugkasten, der gleich funktioniert, ob Sie ihn auf Ihrem eigenen Laptop, den Servern Ihres Unternehmens oder einem Cloud-Anbieter ausführen — was genau der Grund ist, warum er hinter einem vollständig privaten, selbst gehosteten Setup passt. DeepSeek Harness beantwortet sie mit „Sie, auf Ihrer eigenen Maschine, aber mit einem System, das vollständig aus austauschbaren Teilen aufgebaut ist" [4]. Claude Cowork beantwortet sie mit „Nicht Sie — es läuft auf unseren Servern, und Sie bekommen das Ergebnis zurück" [7]. Keine dieser Antworten ist falsch. Sie sind einfach unterschiedlich, und der Fehler, den wir am häufigsten sehen, ist, ein Werkzeug nach einem Standard zu beurteilen, der nur für ein anderes Sinn macht — zum Beispiel DeepSeek Harness dafür zu kritisieren, dass es nicht in eine bestehende App eingebettet werden kann (es war nie dafür gedacht) oder Claude Cowork dafür zu kritisieren, dass es keine Datenkontrolle auf Ihren eigenen Servern bietet (es war nie dafür konzipiert).
Tabelle 1. Vergleich von LangGraph, DeepSeek Harness und Claude Cowork.
| LangGraph | DeepSeek Harness (dsh) | Claude Cowork | |
|---|---|---|---|
| Was es tatsächlich ist | Ein Werkzeugkasten, um Ihr eigenes Agenten-System zu bauen | Eine einsatzbereite Agenten-Anwendung, die Sie selbst installieren | Ein fertiges Produkt, das auf den Computern anderer läuft |
| Wo die Arbeit passiert | Wo Sie es deployen — vollständig Ihre Wahl | Auf Ihrer eigenen Maschine — npx @deepseek-ai/dsh web [4] | Auf Anthropics Servern, in einem isolierten Raum [7] |
| Wer die Daten kontrolliert | Sie, vollständig | Sie, vollständig | Sie verlassen Ihre Infrastruktur durch Design [7] |
| Anpassbarkeit | Sie schreiben den gesamten Workflow selbst, Schritt für Schritt | Jedes Teil ist austauschbar, einschließlich der zentralen „Gehirnschleife" [4][3] | Sie können Plugins hinzufügen und Werkzeuge verbinden, aber der Agent-Kern gehört nicht Ihnen zur Änderung [8] |
| Reife/Stabilität (Aug. 2026) | Reif, weit verbreitet in Produktion | Frühe „Entwicklervorschau" — erwarten Sie brechende Änderungen [4] | Ein fertiges, aktiv gepflegtes kommerzielles Produkt [7][8] |
| Nutzungskosten | Kostenlos, Open Source | Kostenlos, Open Source (MIT-Lizenz) [4] | Bezahltes Abonnement |
6. Einschränkungen und Bedrohungen für die Gültigkeit
Wir benennen unsere Lücken ehrlich, anstatt sie zu glätten:
- Wir haben keinen fairen, identischen Test über alle drei durchgeführt. Unsere Genauigkeitszahlen in Abschnitt 4.1 stammen nur aus dem Test unseres eigenen LangGraph-basierten Systems. Wir haben denselben Rechtsdokument-Test nicht durch DeepSeek Harness oder Claude Cowork laufen lassen, also behaupten wir nicht, dass einer genauer sei als ein anderer — nur dass sie unterschiedlich gebaut sind. Ein ordentlicher Neben-an-Neben-Benchmark ist der offensichtliche nächste Schritt.
- Wir konnten den Code des einen Werkzeugs lesen und den des anderen nicht. DeepSeek Harness ist Open Source, also konnten wir Behauptungen direkt in seinem Code überprüfen. Claude Coworks Inneres ist geschlossen, also basiert, was wir darüber sagen, auf Anthropics eigener Dokumentation und unserer eigenen Nutzung, nicht auf Code, den wir selbst hätten inspizieren können.
- Unsere Ergebnisse stammen aus einem einzigen Bereich: Rechtsdokumente und Geschäftsleads. Der Befund über Query-Rewriting, das die Genauigkeit verschlechtert, ist insbesondere auf rechtlichen Text spezifisch — wir behaupten nicht, dass er für jede Art von KI-Suchsystem wahr ist.
- Alles hier hat ein Verfallsdatum. DeepSeek Harness ist explizit eine frühe, sich ändernde Vorschau [4], und Claude Cowork wird aktiv aktualisiert [8]. Deshalb ist jede obige Behauptung an eine bestimmte Version, einen Code-Snapshot oder ein Zugriffsdatum gebunden — behandeln Sie versionsbezogene Dinge als Zeitpunktsschnappschuss, nicht als dauernde Tatsache.
- Wir haben keine erschöpfende Literaturübersicht gemacht. Abschnitt 2 referenziert einige relevante Arbeiten, keinen systematischen Überblick über alles, was zu diesem Thema geschrieben wurde.
7. Fazit
Die kurze Antwort, wiederholt: Für alles, was wir für Kunden bauen — Dokumentensuchsysteme, Multi-Agenten-Pipelines, alles, was Kundendaten berührt — bleibt LangGraph kombiniert mit selbst gehosteten KI-Modellen unsere Wahl, und zwar nicht wegen eines Funktionsvergleichs. Es liegt daran, dass die Daten unserer Kunden rechtlich die vom Kunden kontrollierte Infrastruktur nicht verlassen können, und diese eine Anforderung schließt gehostete Produkte aus, bevor ein Vergleich überhaupt beginnt. Wir leihen uns zwei gute Ideen von DeepSeek Harness — sein nie bearbeitetes Aktivitätsprotokoll und die darauf aufgebauten Kostenverfolgungs-Dashboards — für unsere eigenen internen Werkzeuge, ohne das gesamte System zu übernehmen. Und Claude Cowork hat einen echten, berechtigten Platz in unserer internen Arbeit, fest getrennt von allem, was durch die Datenanforderungen eines Kunden gebunden ist.
Wenn Sie nur eine Sache aus diesem ganzen Bericht mitnehmen, dann die Frage aus Abschnitt 5: Bevor Sie zwei „KI-Agenten"-Werkzeuge vergleichen, prüfen Sie zuerst, ob sie überhaupt versuchen, dieselbe Frage zu beantworten. Der meiste Frust, den wir bei Menschen beim Wählen von Agenten-Werkzeugen sehen, kommt daher, diesen Schritt zu überspringen.
Der natürliche nächste Schritt für diese Forschungsrichtung ist der Benchmark, den wir hier nicht durchgeführt haben: Dieselbe Aufgabe, getaktet und bewertet, durch alle drei Systeme.
Referenzen
1. LLM-Based Multi-Agent Orchestration: A Survey of Frameworks, Communication Protocols, and Emerging Patterns. Abgerufen August 2026. https://www.mdpi.com/1999-5903/18/6/326
2. Dennis, S., Shabahang, K., Guo, H., & Patil, R. (2026). In-Context Prompting Obsoletes Agent Orchestration for Procedural Tasks. arXiv preprint. https://arxiv.org/pdf/2604.27891
3. Cordiverse. A Programming Paradigm for Spatiotemporal Composability. Abgerufen August 2026. https://github.com/cordiverse/paper
4. DeepSeek AI. DeepSeek Harness Repository, deepseek-ai/deepseek-harness, Commit 99f6f02 (2026-08-17), README.md und docs/architecture.md. https://github.com/deepseek-ai/deepseek-harness
5. DeepSeek AI. Engineering-Notiz, Telemetry default-off (2026-08-10), und packages/bundle/base/tests/base.spec.ts, gleicher Commit. https://github.com/deepseek-ai/deepseek-harness/blob/master/.agents/notes/implemented/feature/2026-08-10-telemetry-default-off.md
6. 0xsline. awesome-deepseek-harness — kuratierter DSH-Plugin-Index. Abgerufen August 2026. https://github.com/0xsline/awesome-deepseek-harness
7. Anthropic. Get started with Claude Cowork, Anthropic-Hilfecenter. Abgerufen August 2026. https://support.claude.com/en/articles/13345190-get-started-with-claude-cowork
8. Anthropic. Claude Cowork Produktseite. Abgerufen August 2026. https://www.anthropic.com/product/claude-cowork
9. Hendrycks, D., Burns, C., Chen, A., & Ball, S. (2021). CUAD: An Expert-Annotated NLP Dataset for Legal Contract Review. arXiv:2103.06268. https://arxiv.org/abs/2103.06268
10. Chen, J., Xiao, S., Zhang, P., Luo, K., Lian, D., & Liu, Z. (2024). BGE M3-Embedding: Multi-Lingual, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation. arXiv:2402.03216. https://arxiv.org/abs/2402.03216
11. LangChain. Send API-Referenz, LangGraph-Dokumentation. https://reference.langchain.com/python/langgraph/types/Send
Korrekturen oder Einwände gegen eine der obigen Behauptungen sind willkommen; zitieren Sie Ihre Quelle und dieser Bericht wird aktualisiert.