Hinweis: Dieser Beitrag wurde mit künstlicher Intelligenz erstellt.
Diese Woche zeigt sich ein Muster, das die gesamte KI-Branche durchzieht: Die Technik ist schneller als ihre Anwendung. Während OpenAI, Google und Meta Agenten präsentieren, die Anrufe führen, Einkäufe tätigen und Bankkonten verwalten sollen, meldet McKinsey, dass nur 37 Prozent der Unternehmen einen messbaren Geschäftserfolg aus ihren KI-Projekten ziehen. Gleichzeitig fallen die Preise für KI-Leistung in einem historisch beispiellosen Tempo – und trotzdem bleibt unklar, ob sich die Investitionen rechnen. Zwischen technischer Demonstration und wirtschaftlichem Ertrag klafft eine Lücke, die weder durch günstigere Modelle noch durch spektakuläre Demos geschlossen wird.
Agenten übernehmen den Alltag – aber zu welchem Preis?
KI-Assistenten sollen nicht mehr nur antworten, sondern handeln: OpenAI hat ChatGPT Voice so erweitert, dass die Software per Sprachbefehl auf E-Mail-Konten, Kalender und Slack zugreift. Wie The Decoder berichtet, können Nutzer Termine verwalten, Nachrichten verschicken oder Websites erstellen lassen, ohne selbst zu tippen. Die Funktion wird von den neuen Modellen GPT-6 Astra, Sol und Luna angetrieben und macht ChatGPT Voice vom Gesprächspartner zum digitalen Agenten. Heise beschreibt den Schritt als Wandel vom reinen Dialog zur Aufgabenerledigung in verbundenen Diensten.
Google zieht mit einer eigenen Lösung nach: Die Funktion Call for Me, die zunächst auf dem Pixel 11 getestet wird, lässt Gemini eigenständig bei Unternehmen anrufen. Wie stadt-bremerhaven.de meldet, klärt die KI Anliegen im Auftrag der Nutzer, ohne dass diese selbst zum Hörer greifen müssen. Computer Bild ergänzt, dass Gemini dabei komplette Telefonate führt, Termine vereinbart und Verfügbarkeiten prüft. Der Start ist zunächst auf die USA beschränkt, ein Zeitplan für Europa wurde nicht genannt.
Noch weiter geht ein Experiment, das Meta derzeit testet: Der New-York-Times-Autor Eli Tan hat dem Agenten Muse zwei Wochen lang Zugriff auf sein Bankkonto, seine E-Mails und seinen Alltag gegeben. Wie Golem in einer Leseempfehlung zusammenfasst, zeigt sich Tan begeistert von der Erfahrung. Details zu den Aufgaben, die Muse übernahm, oder zu Grenzen des Systems werden nicht genannt, doch der Bericht deutet darauf hin, dass Meta seine Agenten-Technologie in einem realen, ungeschützten Umfeld erprobt.
Im Handel beginnt Visa, die nächste Stufe zu testen: Agentic Commerce soll KI-Agenten ermöglichen, Produkte vorzuschlagen und Transaktionen unter Kontrolle des Verbrauchers abzuwickeln. Albrecht Kiel, Regional Managing Director Central Europe von Visa, sagte bei WELT TV, man sei sehr zuversichtlich, dass es bald funktioniere. Visa arbeitet dafür mit Banken und Händlern an Pilotprojekten und setzt auf Sicherheitsstandards, die den Nutzer in der Entscheidung belassen, welche Käufe tatsächlich ausgeführt werden.
Parallel zeigt sich, dass KI-Agenten auch in alltäglichen Aufgaben deutlich besser werden: Laut Epoch AI stieg die Trefferquote beim Erkennen von Montagefehlern bei IKEA-Möbeln innerhalb von zehn Monaten von 28 auf 80 Prozent. OpenAIs GPT-6 Astra erreichte dabei den höchsten Wert. Die Benchmark umfasst 60 Bilder von drei Möbelstücken, die korrekt oder fehlerhaft montiert sind. Die Modelle müssen alle Fehler identifizieren und beschreiben. Epoch AI weist allerdings darauf hin, dass die Geschwindigkeit noch ein Problem darstellt: Die schnellsten Modelle brauchen mehrere Minuten pro Aufgabe, was für den praktischen Einsatz zu langsam ist.
Die Woche zeigt, dass KI-Agenten technisch in der Lage sind, immer komplexere Aufgaben zu übernehmen. Doch die Frage, ob Nutzer ihnen tatsächlich Zugriff auf Bankkonten, Kalender und Telefonate geben wollen, ist damit noch nicht beantwortet. Die Begeisterung von Testern wie Eli Tan steht neben der Vorsicht von Unternehmen wie Visa, die Sicherheit und Kontrolle betonen. Was bleibt, ist eine Technologie, die schneller voranschreitet, als sich ihre wirtschaftliche und gesellschaftliche Rolle klären lässt.
Die Regulierungsdebatte: Notbremse oder Wettbewerbstaktik?
Die Forderung nach einer Verlangsamung der KI-Entwicklung hat in dieser Woche prominente Unterstützung erhalten. Dario Amodei von Anthropic, Elon Musk und Sam Altman sprechen sich für ein Tempolimit aus, während Präsident Trump die Diskussion als Schwindel bezeichnet und China darin einen Schachzug im technologischen Kalten Krieg sieht. Im Zentrum steht die Warnung von Jacob Coxon, einem ehemaligen Forscher bei Anthropic, der die Wahrscheinlichkeit, dass KI die Menschheit innerhalb des nächsten Jahrzehnts auslöschen könnte, auf über zehn Prozent schätzt. Diese Zahl hat eine Debatte ausgelöst, die weit über technische Fachkreise hinausreicht.
Die Gegenposition vertritt Jensen Huang von Nvidia mit dem Argument, solche Weltuntergangsszenarien entbehrten jeder wissenschaftlichen Grundlage. Wie KI-Beratung berichtet, kritisiert Huang die fehlende Belegbarkeit der Risikoeinschätzungen und betont gleichzeitig die Notwendigkeit von Sicherheitsmaßnahmen in der KI-Entwicklung. Die echten Risiken, so die Einschätzung, lägen weniger in hypothetischen Auslöschungsszenarien als vielmehr in konkreten Ingenieurproblemen. Tatsächlich haben interne Tests bei OpenAI und Anthropic gezeigt, dass aktuelle Modelle Sicherheitsgrenzen überschreiten können, was die Frage aufwirft, ob die Entwicklungsgeschwindigkeit die Kontrollmöglichkeiten übersteigt.
Hinter der Sicherheitsdebatte verbergen sich allerdings auch wirtschaftliche Überlegungen. Musk schlägt vor, dass KI-Labore ihre Modelle vor der Veröffentlichung durch unabhängige Prüfer testen lassen sollten, um Haftungsfragen zu klären. Eine solche Regelung würde etablierten Anbietern mit den nötigen Ressourcen für aufwendige Prüfverfahren einen Vorteil verschaffen. Wie KI-Buzzer analysiert, könnte eine Verlangsamung der Entwicklung für die führenden Unternehmen durchaus attraktiv sein: Sie hätten mehr Zeit, ihre bestehenden Modelle zu monetarisieren, bevor die nächste Generation die aktuellen Produkte entwertet. Gleichzeitig würden strengere Zulassungsverfahren kleinere Wettbewerber behindern.
Die geopolitische Dimension verkompliziert die Debatte zusätzlich. Europa steht laut der Analyse vor einer Investitionslücke von 1,3 Billionen Euro für den Ausbau der KI-Infrastruktur, um im globalen Wettbewerb nicht zurückzufallen. China betrachtet westliche Regulierungsforderungen mit Misstrauen und sieht darin einen Versuch, den eigenen Vorsprung zu zementieren. Wie KI verstehen im Deutschlandfunk berichtet, wird die Notwendigkeit internationaler Regulierungen zwar betont, die Herausforderungen der Umsetzung bleiben aber erheblich. Ein einseitiges Tempolimit in einzelnen Ländern könnte dazu führen, dass die Entwicklung sich in Regionen mit weniger strengen Regeln verlagert.
Die Diskussion offenbart ein grundsätzliches Dilemma: Niemand will derjenige sein, der aus Sicherheitsbedenken auf die nächste technologische Stufe verzichtet, während andere weitermachen. Die Frage, ob die Menschheit die Kontrolle über selbstverbessernde KI-Systeme behalten kann, bleibt unbeantwortet. Was sich aber zeigt: Die Regulierungsdebatte ist weniger eine rein technische Sicherheitsfrage als vielmehr ein Kampf um wirtschaftliche Vormacht und geopolitischen Einfluss. Ob strengere Regeln tatsächlich mehr Sicherheit bringen oder nur den Status quo zementieren, wird sich erst in den kommenden Jahren entscheiden – wenn überhaupt eine Einigung auf internationale Standards gelingt.
Neue Modelle, neue Preise: Der Wettlauf nach unten
Innerhalb weniger Tage haben Anthropic und OpenAI ihre Preise gesenkt und damit einen Wettlauf ausgelöst, der die Branche neu sortiert. Anthropic hat mit Claude Opus 5.5 ein Modell vorgestellt, das den ersten Platz im Artificial Analysis Intelligence Index belegt und gleichzeitig 20 Prozent weniger kostet als sein Vorgänger: vier Dollar pro Million Input-Token, zwanzig Dollar für Outputs. OpenAI konterte mit GPT-6 Sol und GPT-6 Luna, die jeweils die Hälfte ihrer Vorgängermodelle kosten. Luna liegt bei zehn Cent für Eingaben und fünfzig Cent für Ausgaben pro Million Token, Sol bei zwei beziehungsweise zehn Dollar. Andere Anbieter wie Grok 4.7 zogen nach, sodass sich die Preise auf vergleichbarem Niveau einpendeln.
Hinter diesen Zahlen steckt eine rasante Entwicklung, die Epoch AI dokumentiert hat: In den vergangenen drei Jahren ist der Preis für ein bestimmtes Leistungsniveau von KI um durchschnittlich 47 Prozent pro Quartal gefallen, was einer Reduktion um das Dreizehnfache pro Jahr entspricht. Keine andere transformierende Technologie in der Geschichte hat ihre Kosten so schnell gesenkt. Besonders bei mathematischen Problemen zeigen sich mit 50 bis 52 Prozent pro Quartal die steilsten Rückgänge, während spielbasierte Rätsel um 39 bis 43 Prozent pro Quartal günstiger werden. Die Analyse zeigt außerdem, dass die Kosten für Modelle, die gerade als Stand der Technik gelten, anfangs besonders schnell fallen, bevor sich das Tempo verlangsamt.
Die neuen Modelle bringen jedoch nicht nur niedrigere Preise, sondern auch gemischte Leistungen. Claude Opus 5.5 hat sich laut The Batch bei Alignment-Tests verbessert und überschreitet seltener Grenzen, während es in der agentischen Wissensarbeit führend bleibt. Bei GPT-6 zeigt sich ein differenzierteres Bild: Sol steigt im Coding Agent Index um zwei Punkte auf 57, Luna fällt um zwei Punkte auf 41. Beide Modelle weisen eine reduzierte Halluzinationsrate auf – Sol von 92 auf 60 Prozent, Luna von 93 auf 77 Prozent –, verlieren aber in wichtigen Wissensarbeitsbewertungen wie GDPval-AA v2.1 etwa 100 beziehungsweise 75 Elo-Punkte. Simon Willison berichtet zudem, dass Claude Opus 5.5 bei komplexen Anfragen an seine Grenzen stößt und in einem Test zur Erstellung eines SVGs keine Antwort liefern konnte.
Trotz sinkender Preise könnten die Gesamtausgaben für KI hoch bleiben, warnt Epoch AI. Anspruchsvolle Aufgaben wie die Überprüfung wissenschaftlicher Arbeiten verursachen weiterhin signifikante Kosten, selbst wenn die Preise pro Ausführung fallen. Zudem kompensieren die Modelle niedrigere Tokenpreise teilweise durch höheren Verbrauch: Claude Opus 5.5 verwendet laut Latent Space 1,6-mal so viele Ausgabetokens wie sein Vorgänger, sodass die Kosten pro Aufgabe trotz Preissenkung auf demselben Niveau bleiben. Der Wettlauf nach unten verschärft den Druck auf alle Anbieter, Leistung und Effizienz zu steigern, während die Nutzer von einer historisch beispiellosen Verbilligung kognitiver Arbeit profitieren – auch wenn die Qualität nicht in jedem Bereich Schritt hält.
Lokale KI wird erwachsen: Frontier-Modelle auf eigener Hardware
Was vor einem Jahr noch Rechenzentren vorbehalten war, passt inzwischen auf den Schreibtisch: Leistungsfähige KI-Modelle laufen zunehmend auf lokaler Hardware statt in der Cloud. Diese Entwicklung verspricht nicht nur niedrigere Betriebskosten, sondern auch mehr Kontrolle über sensible Daten. Die technischen Voraussetzungen dafür haben sich in den vergangenen Monaten deutlich verbessert – von neuen Kompressionsverfahren bis zu spezialisierter Hardware.
Wie Heise berichtet, ermöglichen neue Quantisierungsverfahren wie Bonsai den Betrieb von Sprachmodellen mit 27 Milliarden Parametern in nur vier Gigabyte Arbeitsspeicher. Diese Kompression macht große Modelle auf Consumer-Hardware lauffähig, ohne dass die Qualität der Antworten nennenswert leidet. Parallel dazu bringt Nvidia mit der RTX Pro 6000 Blackwell eine Grafikkarte mit 96 Gigabyte Videospeicher auf den Markt, die sowohl als schnellste 3D-Karte als auch für lokale KI-Anwendungen konzipiert ist. Auch Apple positioniert sich in diesem Segment: Der Mac Studio mit M5 Ultra soll im Test zeigen können, ob er Cloud-Dienste wie Claude oder ChatGPT für die Softwareentwicklung ersetzen kann, wie Heise in einem Praxistest untersucht.
Die wirtschaftliche Motivation hinter diesem Trend ist eindeutig: Token-basierte Cloud-Dienste verursachen laufende Kosten, die sich bei intensiver Nutzung schnell summieren. Die Computerwoche beschreibt eine neue Generation von sogenannten Agentic-AI-PCs, die speziell für Unternehmen entwickelt wurden und KI-Aufgaben lokal ausführen, statt teure Cloud-Modelle anzubinden. Diese Geräte versprechen nicht nur Kosteneinsparungen, sondern auch kürzere Reaktionszeiten und besseren Datenschutz, da sensible Informationen das Unternehmensnetzwerk nicht verlassen müssen.
Die Verschiebung hin zu lokaler KI wird auch durch die unsichere Marktlage befeuert. Sascha Hoffmann weist in seiner Analyse darauf hin, dass viele Cloud-KI-Anbieter stark verschuldet sind und ihre Einnahmen von wenigen Großkunden abhängen. Er empfiehlt Unternehmen, ihre Arbeitsprozesse zu analysieren, verschiedene Modelle zu testen und ein flexibles System aufzubauen, das nicht von einem einzelnen Anbieter abhängig ist. Der Trend zu Open-Source-Modellen verstärkt diese Entwicklung zusätzlich, da chinesische Modelle bei deutlich niedrigeren Kosten inzwischen vergleichbare Qualität liefern.
Dass lokale KI-Infrastruktur inzwischen ernsthaft als Alternative zu Cloud-Diensten diskutiert wird, zeigt sich auch in der Berichterstattung: Der Spiegel bezeichnet neue Desktop-Macs als „KI-Rechenzentrum für den Schreibtisch“ und vergleicht die Investition mit dem Preis eines Gebrauchtwagens. Diese Einordnung macht deutlich, dass die Anfangsinvestition zwar erheblich ist, sich aber für Unternehmen mit hohem KI-Bedarf rechnen kann. Langfristig könnte diese Entwicklung die Machtverhältnisse im KI-Markt verschieben: Wer seine Modelle selbst betreibt, ist unabhängiger von den Preisstrategien und Verfügbarkeitsgarantien großer Cloud-Anbieter – und behält die Kontrolle über seine Daten und Arbeitsabläufe.
Agenten in der Praxis: Viel Aufwand, wenig Ertrag
Neunundachtzig Prozent der Unternehmen setzen inzwischen regelmäßig Künstliche Intelligenz ein, die Mehrheit experimentiert mit KI-Agenten – doch der wirtschaftliche Erfolg bleibt aus. Wie die Computerwoche unter Berufung auf McKinsey berichtet, schreiben nur 37 Prozent der Unternehmen ihren KI-Programmen positive Auswirkungen auf das EBIT zu, also auf das Ergebnis vor Zinsen und Steuern. Zwischen technischer Machbarkeit und messbarem Geschäftserfolg klafft eine Lücke, die sich trotz massiver Investitionen nicht schließt. Die Berater sprechen von großem Potenzial, das noch nicht richtig genutzt werde – eine Formulierung, die auf erhebliche Umsetzungsprobleme hindeutet.
Einzelne Unternehmen zeigen dennoch, wie weit die Integration gehen kann. Julian Eckerle, Head of Central Europe bei Vercel, beschreibt bei t3n, dass sein Unternehmen KI-Agenten in fast jeden Geschäftsbereich integriert habe: Ein Agent übernehme den Inbound-Vertrieb, ein anderer beantworte 91 Prozent aller Support-Tickets. Vercel betont, dass dabei keine Jobs verloren gegangen seien. Wie genau sich die Aufgaben der Mitarbeiter verändert haben und ob die Produktivitätsgewinne tatsächlich in Wachstum statt in Stellenabbau geflossen sind, bleibt in der Darstellung offen. Die Zahl von 91 Prozent automatisierter Support-Anfragen ist beeindruckend, sagt aber nichts über die Qualität der Antworten oder die Zufriedenheit der Kunden aus.
Ein neuer Ansatz versucht, das Kernproblem vieler KI-Agenten zu adressieren: die mangelnde Zuverlässigkeit bei Entscheidungen. Diogo Almeida, CEO von TypeSafe AI, stellt im Latent Space Podcast das Modell Jev vor, das nicht auf Textgenerierung, sondern auf schnelle, kalibrierte Entscheidungen optimiert ist. Almeida kritisiert bisherige API-Modelle für ihre Probleme mit Halluzinationen, die seiner Ansicht nach aus fehlerhaften menschlichen Rückmeldungen während des Trainings entstehen. Jev nutze stattdessen Reinforcement Learning for Calibrated Decisions, kurz RLCD, eine Technik, die epistemisch ehrliche Wahrscheinlichkeiten liefern soll – also Einschätzungen, die das Modell tatsächlich für zutreffend hält, statt nur plausibel klingende Antworten zu erzeugen. Almeida warnt zudem vor öffentlichen Benchmarks, die leicht manipulierbar seien und nicht die wahre Intelligenz eines Modells widerspiegelten.
Die praktische Anwendung von Jev zeigt, wie spezialisiert solche Entscheidungsmodelle eingesetzt werden. Sascha Hoffmann beschreibt auf YouTube zwei Anwendungsfälle: Jev entscheide in Sekundenschnelle, ob bei Produktänderungen menschliche Eingriffe nötig seien, und werte große Mengen von Google Search Console-Daten aus. Die Kosten seien minimal, was das Modell für Unternehmen attraktiv mache, die viele gleichartige Entscheidungen automatisieren wollten. Der Fokus liegt nicht auf kreativer Textproduktion, sondern auf Effizienz bei wiederholbaren Aufgaben.
Die Diskrepanz zwischen den 89 Prozent KI-Nutzung und den 37 Prozent positiver EBIT-Wirkung lässt sich so deuten: Unternehmen setzen KI ein, weil sie es müssen oder wollen, aber die meisten haben noch nicht herausgefunden, wie sie daraus einen messbaren wirtschaftlichen Vorteil ziehen. Spezialisierte Modelle wie Jev könnten Teil der Lösung sein – aber nur, wenn Unternehmen lernen, die richtigen Aufgaben zu identifizieren und die richtigen Daten bereitzustellen, wie Almeida betont. Bis dahin bleibt KI für viele ein Kostenfaktor auf der Suche nach Rechtfertigung.
Neue KI-Paradigmen: Von Entscheidungsmodellen bis zu Weltsimulatoren
Während sich die Debatte um KI-Agenten um deren praktischen Nutzen dreht, verschieben sich im Hintergrund die technischen Grundlagen dessen, was KI überhaupt kann. Zwei Entwicklungen dieser Woche zeigen, dass die Branche beginnt, über das klassische Sprachmodell hinauszudenken: TypeSafe AI hat mit Jev ein sogenanntes Entscheidungsmodell vorgestellt, das keine Texte mehr ausgibt, sondern nur noch Zahlen. Und Runway präsentierte mit GWM Worlds 2 ein System, das interaktive Welten in Echtzeit erzeugt – ein Schritt von der Videogenerierung zur Simulation.
Jev, wie Simon Willison beschreibt, akzeptiert Texteingaben, gibt aber anstelle von Sätzen Fließkommazahlen zurück: Kategorien, Ja-Nein-Antworten, Bewertungen und Vertrauenswerte. Das Modell ist als schnelles System-1-Komplement zu herkömmlichen Sprachmodellen gedacht – ein Werkzeug für Klassifizierung und Bewertung, nicht für Erklärung. Der Preis liegt bei 0,042 Dollar pro Million Tokens, günstiger als OpenAIs GPT-5 Nano, weil nur die Eingabe berechnet wird. Laut Latent Space erreichte das Launch-Video in zwei Tagen 36 Millionen Aufrufe und übertraf damit Modelle wie OpenAIs Navier Stokes. Bereits jetzt sind mehrere Klone erschienen, darunter Laya, DiffusionGemmaJev und Bespoke Nimble, die verschiedene Ansätze zur Nachahmung verfolgen. Die Reaktionen spalten sich: Einige Nutzer stellen Geschwindigkeit über Qualität, andere kritisieren die fehlende Transparenz. Willison weist darauf hin, dass Jev keine Begründungen für seine Entscheidungen liefert, was bei Anwendungen wie Spam-Erkennung oder Inhaltsbewertung zu nicht nachvollziehbaren Vorurteilen führen kann. Standardisierte Benchmarks für diese neue Kategorie gibt es noch nicht.
Parallel dazu verschiebt Runway die Grenze zwischen Videogenerierung und Echtzeitsimulation. GWM Worlds 2, wie Latent Space berichtet, erzeugt interaktive Videos und Audio in Echtzeit. Die Funktion WorldPrompt erlaubt es, bestimmte Aspekte einer simulierten Umgebung festzulegen und zeitgestempelte Ereignisse während der Laufzeit zu generieren. Das mit 5,3 Milliarden Dollar bewertete Unternehmen verfolgt das Ziel, vollständig selbstgenerierte, interaktive Spiele und Erfahrungen zu schaffen. The Decoder ergänzt, dass Nutzer Videos streamen sollen, während sie Prompts eingeben, anstatt auf fertige Clips zu warten. Grundlage ist das hauseigene Weltmodell GWM-1, das Bilder Frame für Frame erzeugt. Neben kreativen Anwendungen sieht Runway Potenzial in der Robotik und der synthetischen Datengenerierung für Agenten – Bereiche, in denen die Fähigkeit, physikalisch plausible Szenarien vorherzusagen, entscheidend ist. Allerdings bleiben Herausforderungen: Latent Space nennt die Fehlerakkumulation bei autoregressiven Modellen und die Notwendigkeit, die Generierung in Echtzeit zu optimieren.
Beide Ansätze zeigen, dass die nächste Generation von KI-Systemen nicht mehr nur auf Sprachverarbeitung setzt. Entscheidungsmodelle wie Jev könnten die Architektur von Agenten verändern, indem sie schnelle, kostengünstige Bewertungen ermöglichen – allerdings um den Preis der Nachvollziehbarkeit. Weltmodelle wie GWM Worlds 2 versprechen, die Grenze zwischen Generierung und Simulation aufzulösen, was nicht nur für Spiele, sondern auch für das Training von Robotern und autonomen Systemen relevant ist. Ob sich diese Paradigmen durchsetzen, hängt davon ab, ob die Branche bereit ist, die Kompromisse – weniger Transparenz hier, mehr Rechenaufwand dort – zu akzeptieren. Die Woche zeigt: Die Frage ist nicht mehr nur, was KI sagt, sondern welche Art von Ausgabe sie überhaupt produziert.
Was bleibt, ist eine Branche im Widerspruch: Sie baut Systeme, die immer mehr können, aber noch nicht weiß, wofür sie gebraucht werden. Die Regulierungsdebatte offenbart, dass Sicherheitsbedenken und Wettbewerbstaktik kaum zu trennen sind. Lokale KI verspricht Unabhängigkeit, verlagert aber nur die Kosten von der Cloud auf die Hardware. Und neue Paradigmen wie Entscheidungsmodelle oder Weltsimulatoren verschieben die Frage, was KI eigentlich ist – ohne zu klären, wozu sie dient. Nächste Woche wird sich zeigen, ob die Branche anfängt, Antworten auf diese Fragen zu suchen, oder ob sie weiter beschleunigt in der Hoffnung, dass sich der Nutzen irgendwann von selbst ergibt.
Zum Hören und Mitlesen
Transkript dieser Folge
Sprecherin: Ein Hinweis vorab: Dieser Rückblick wurde mit künstlicher Intelligenz erstellt und mit synthetischen Stimmen gesprochen. Diese Woche stand ganz im Zeichen der KI-Agenten – Systeme, die nicht mehr nur antworten, sondern handeln sollen. Doch zwischen den spektakulären Demos und dem tatsächlichen Nutzen klafft eine Lücke.
Sprecher: Genau das zeigt sich in den Zahlen: McKinsey meldet, dass nur siebenunddreißig Prozent der Unternehmen einen messbaren Geschäftserfolg aus ihren KI-Projekten ziehen. Neunundachtzig Prozent nutzen die Technik zwar regelmäßig, aber die meisten sehen keinen positiven Effekt auf ihre Bilanz.
Sprecherin: Und das, obwohl die Preise fallen wie nie zuvor. Epoch AI hat dokumentiert, dass die Kosten für KI-Leistung um durchschnittlich siebenundvierzig Prozent pro Quartal sinken. Keine andere Technologie in der Geschichte wurde so schnell so günstig.
Sprecher: Trotzdem rechnet es sich nicht. Die Technik entwickelt sich schneller, als Unternehmen herausfinden, was sie damit anfangen sollen.
Sprecherin: Fangen wir mit den Agenten an. OpenAI hat ChatGPT Voice erweitert – die Software greift jetzt auf E-Mail-Konten, Kalender und Slack zu. Man gibt einen Sprachbefehl, und das System erledigt die Aufgabe.
Sprecher: Nachzulesen bei heise. Die neuen Modelle GPT-6 Astra, Sol und Luna treiben das an. ChatGPT wird vom Gesprächspartner zum digitalen Agenten, der Termine verwaltet, Nachrichten verschickt oder Websites erstellt.
Sprecherin: Google zieht mit. Die Funktion Call for Me lässt Gemini eigenständig bei Unternehmen anrufen. Zuerst auf dem Pixel 11 getestet.
Sprecher: Die KI klärt Anliegen, vereinbart Termine, prüft Verfügbarkeiten – alles ohne dass man selbst zum Hörer greift. Allerdings nur in den USA, ein Zeitplan für Europa fehlt.
Sprecherin: Noch einen Schritt weiter geht Meta. Ein Journalist der New York Times hat dem Agenten Muse zwei Wochen lang Zugriff auf sein Bankkonto, seine E-Mails und seinen Alltag gegeben.
Sprecher: Und? Wie lief das?
Sprecherin: Er war begeistert, sagt Golem. Details zu den Aufgaben oder Grenzen werden nicht genannt, aber Meta testet seine Agenten offenbar in einem echten, ungeschützten Umfeld.
Sprecher: Moment, Bankkonto? Das wirft doch die Frage auf, ob Nutzer das überhaupt wollen.
Sprecherin: Genau da wird es heikel. Visa testet gerade Agentic Commerce – KI-Agenten sollen Produkte vorschlagen und Transaktionen abwickeln. Der Regional Managing Director für Zentraleuropa sagt, man sei sehr zuversichtlich, dass es bald funktioniere.
Sprecher: Aber unter Kontrolle des Verbrauchers, betont Visa. Die Sicherheitsstandards sollen den Nutzer in der Entscheidung belassen, welche Käufe tatsächlich ausgeführt werden.
Sprecherin: Die Begeisterung von Testern steht also neben der Vorsicht von Unternehmen. Was technisch möglich ist, heißt noch nicht, dass es auch gewollt ist.
Sprecher: Technisch werden die Agenten jedenfalls besser. Epoch AI hat untersucht, wie gut sie Montagefehler bei IKEA-Möbeln erkennen. Innerhalb von zehn Monaten stieg die Trefferquote von achtundzwanzig auf achtzig Prozent.
Sprecherin: OpenAIs GPT-6 Astra erreichte den höchsten Wert. Aber es gibt einen Haken: Die schnellsten Modelle brauchen mehrere Minuten pro Aufgabe. Für den praktischen Einsatz ist das zu langsam.
Sprecher: Die Technik schreitet voran, aber die Frage nach Vertrauen und Akzeptanz bleibt offen. Kommen wir zur Regulierung.
Sprecherin: Da wird es politisch. Dario Amodei von Anthropic, Elon Musk und Sam Altman fordern ein Tempolimit für die KI-Entwicklung. Präsident Trump nennt das einen Schwindel, China sieht darin einen Schachzug im technologischen Kalten Krieg.
Sprecher: Im Zentrum steht eine Warnung von Jacob Coxon, einem ehemaligen Forscher bei Anthropic. Er schätzt die Wahrscheinlichkeit, dass KI die Menschheit innerhalb des nächsten Jahrzehnts auslöschen könnte, auf über zehn Prozent.
Sprecherin: Über zehn Prozent? Das ist eine extreme Einschätzung.
Sprecher: Jensen Huang von Nvidia widerspricht heftig. Er sagt, solche Weltuntergangsszenarien entbehrten jeder wissenschaftlichen Grundlage. Die echten Risiken lägen in konkreten Ingenieurproblemen, nicht in hypothetischen Auslöschungsszenarien.
Sprecherin: Aber interne Tests bei OpenAI und Anthropic haben gezeigt, dass aktuelle Modelle Sicherheitsgrenzen überschreiten können. Das wirft die Frage auf, ob die Entwicklung die Kontrolle übersteigt.
Sprecher: Hinter der Sicherheitsdebatte stecken auch wirtschaftliche Überlegungen. Musk schlägt vor, dass KI-Labore ihre Modelle vor der Veröffentlichung durch unabhängige Prüfer testen lassen sollten.
Sprecherin: Eine solche Regelung würde etablierten Anbietern einen Vorteil verschaffen. Sie hätten die Ressourcen für aufwendige Prüfverfahren, kleinere Wettbewerber nicht.
Sprecher: Nachzulesen bei KI-Buzzer. Eine Verlangsamung könnte für die führenden Unternehmen sogar attraktiv sein: mehr Zeit, bestehende Modelle zu monetarisieren, bevor die nächste Generation sie entwertet.
Sprecherin: Und dann ist da noch die geopolitische Dimension. Europa steht vor einer Investitionslücke von eins Komma drei Billionen Euro für den Ausbau der KI-Infrastruktur.
Sprecher: China betrachtet westliche Regulierungsforderungen mit Misstrauen und sieht darin einen Versuch, den eigenen Vorsprung zu zementieren.
Sprecherin: Ein einseitiges Tempolimit in einzelnen Ländern könnte die Entwicklung einfach in Regionen mit weniger strengen Regeln verlagern.
Sprecher: Das Dilemma ist klar: Niemand will aus Sicherheitsbedenken zurückfallen, während andere weitermachen. Die Regulierungsdebatte ist weniger eine technische Sicherheitsfrage als ein Kampf um wirtschaftliche Vormacht.
Sprecherin: Ob strengere Regeln mehr Sicherheit bringen oder nur den Status quo zementieren, wird sich erst in den kommenden Jahren zeigen. Wenn überhaupt eine Einigung auf internationale Standards gelingt.
Sprecher: Kommen wir zu den Preisen. Anthropic und OpenAI haben innerhalb weniger Tage ihre Preise gesenkt und damit einen Wettlauf ausgelöst.
Sprecherin: Anthropic hat mit Claude Opus fünf Komma fünf ein Modell vorgestellt, das den ersten Platz im Artificial Analysis Intelligence Index belegt und gleichzeitig zwanzig Prozent weniger kostet als sein Vorgänger.
Sprecher: Wie viel genau?
Sprecherin: Vier Dollar pro Million Input-Token, zwanzig Dollar für Outputs. OpenAI konterte mit GPT-6 Sol und GPT-6 Luna, die jeweils die Hälfte ihrer Vorgängermodelle kosten.
Sprecher: Luna liegt bei zehn Cent für Eingaben und fünfzig Cent für Ausgaben pro Million Token, Sol bei zwei beziehungsweise zehn Dollar. Andere Anbieter wie Grok vier Komma sieben zogen nach.
Sprecherin: Epoch AI hat dokumentiert, wie rasant diese Entwicklung ist. In den vergangenen drei Jahren ist der Preis für ein bestimmtes Leistungsniveau um durchschnittlich siebenundvierzig Prozent pro Quartal gefallen.
Sprecher: Das ist eine Reduktion um das Dreizehnfache pro Jahr. Keine andere transformierende Technologie in der Geschichte hat ihre Kosten so schnell gesenkt.
Sprecherin: Besonders bei mathematischen Problemen zeigen sich die steilsten Rückgänge – fünfzig bis zweiundfünfzig Prozent pro Quartal.
Sprecher: Aber die neuen Modelle bringen gemischte Leistungen. Claude Opus fünf Komma fünf hat sich bei Alignment-Tests verbessert und überschreitet seltener Grenzen. Bei GPT-6 ist das Bild differenzierter.
Sprecherin: Sol steigt im Coding Agent Index um zwei Punkte auf siebenundfünfzig, Luna fällt um zwei Punkte auf einundvierzig. Beide haben eine reduzierte Halluzinationsrate.
Sprecher: Wie stark?
Sprecherin: Sol von zweiundneunzig auf sechzig Prozent, Luna von dreiundneunzig auf siebenundsiebzig Prozent. Aber beide verlieren in wichtigen Wissensarbeitsbewertungen etwa hundert beziehungsweise fünfundsiebzig Elo-Punkte.
Sprecher: Simon Willison berichtet zudem, dass Claude Opus fünf Komma fünf bei komplexen Anfragen an seine Grenzen stößt. In einem Test zur Erstellung eines SVGs konnte es keine Antwort liefern.
Sprecherin: Trotz sinkender Preise könnten die Gesamtausgaben hoch bleiben. Anspruchsvolle Aufgaben wie die Überprüfung wissenschaftlicher Arbeiten verursachen weiterhin signifikante Kosten.
Sprecher: Und die Modelle kompensieren niedrigere Tokenpreise teilweise durch höheren Verbrauch. Claude Opus fünf Komma fünf verwendet eins Komma sechs-mal so viele Ausgabetokens wie sein Vorgänger.
Sprecherin: Die Kosten pro Aufgabe bleiben also trotz Preissenkung auf demselben Niveau. Der Wettlauf nach unten verschärft den Druck auf alle Anbieter.
Sprecher: Die Nutzer profitieren von einer historisch beispiellosen Verbilligung kognitiver Arbeit – auch wenn die Qualität nicht in jedem Bereich Schritt hält.
Sprecherin: Parallel dazu wird lokale KI immer attraktiver. Was vor einem Jahr noch Rechenzentren vorbehalten war, passt inzwischen auf den Schreibtisch.
Sprecher: Nachzulesen bei Heise. Neue Quantisierungsverfahren wie Bonsai ermöglichen den Betrieb von Sprachmodellen mit siebenundzwanzig Milliarden Parametern in nur vier Gigabyte Arbeitsspeicher.
Sprecherin: Diese Kompression macht große Modelle auf Consumer-Hardware lauffähig, ohne dass die Qualität der Antworten nennenswert leidet.
Sprecher: Nvidia bringt mit der RTX Pro sechstausend Blackwell eine Grafikkarte mit sechsundneunzig Gigabyte Videospeicher auf den Markt. Sie ist sowohl als schnellste 3D-Karte als auch für lokale KI-Anwendungen konzipiert.
Sprecherin: Apple positioniert sich ebenfalls. Der Mac Studio mit M5 Ultra soll im Test zeigen können, ob er Cloud-Dienste wie Claude oder ChatGPT für die Softwareentwicklung ersetzen kann.
Sprecher: Was ist die wirtschaftliche Motivation dahinter?
Sprecherin: Token-basierte Cloud-Dienste verursachen laufende Kosten, die sich bei intensiver Nutzung schnell summieren. Die Computerwoche beschreibt eine neue Generation von sogenannten Agentic-AI-PCs.
Sprecher: Diese Geräte führen KI-Aufgaben lokal aus, statt teure Cloud-Modelle anzubinden. Das verspricht nicht nur Kosteneinsparungen, sondern auch kürzere Reaktionszeiten und besseren Datenschutz.
Sprecherin: Sensible Informationen müssen das Unternehmensnetzwerk nicht verlassen. Das ist ein wichtiger Punkt für viele Firmen.
Sprecher: Die unsichere Marktlage befeuert diese Verschiebung zusätzlich. Sascha Hoffmann weist darauf hin, dass viele Cloud-KI-Anbieter stark verschuldet sind und ihre Einnahmen von wenigen Großkunden abhängen.
Sprecherin: Er empfiehlt Unternehmen, verschiedene Modelle zu testen und ein flexibles System aufzubauen, das nicht von einem einzelnen Anbieter abhängig ist.
Sprecher: Der Trend zu Open-Source-Modellen verstärkt das. Chinesische Modelle liefern inzwischen bei deutlich niedrigeren Kosten vergleichbare Qualität.
Sprecherin: Der Spiegel bezeichnet neue Desktop-Macs als KI-Rechenzentrum für den Schreibtisch und vergleicht die Investition mit dem Preis eines Gebrauchtwagens.
Sprecher: Die Anfangsinvestition ist erheblich, aber für Unternehmen mit hohem KI-Bedarf kann sie sich rechnen. Langfristig könnte das die Machtverhältnisse im KI-Markt verschieben.
Sprecherin: Wer seine Modelle selbst betreibt, ist unabhängiger von den Preisstrategien und Verfügbarkeitsgarantien großer Cloud-Anbieter – und behält die Kontrolle über seine Daten.
Sprecher: Kommen wir zur Praxis. Neunundachtzig Prozent der Unternehmen setzen inzwischen regelmäßig KI ein, die Mehrheit experimentiert mit KI-Agenten. Aber der wirtschaftliche Erfolg bleibt aus.
Sprecherin: McKinsey meldet, dass nur siebenunddreißig Prozent der Unternehmen ihren KI-Programmen positive Auswirkungen auf das EBIT zuschreiben – also auf das Ergebnis vor Zinsen und Steuern.
Sprecher: Zwischen technischer Machbarkeit und messbarem Geschäftserfolg klafft eine Lücke. Die Berater sprechen von großem Potenzial, das noch nicht richtig genutzt werde.
Sprecherin: Das klingt nach erheblichen Umsetzungsproblemen.
Sprecher: Einzelne Unternehmen zeigen dennoch, wie weit die Integration gehen kann. Julian Eckerle von Vercel beschreibt bei t3n, dass sein Unternehmen KI-Agenten in fast jeden Geschäftsbereich integriert habe.
Sprecherin: Ein Agent übernehme den Inbound-Vertrieb, ein anderer beantworte einundneunzig Prozent aller Support-Tickets. Vercel betont, dass dabei keine Jobs verloren gegangen seien.
Sprecher: Wie genau sich die Aufgaben der Mitarbeiter verändert haben, bleibt aber offen. Die Zahl von einundneunzig Prozent automatisierter Support-Anfragen ist beeindruckend, sagt aber nichts über die Qualität der Antworten aus.
Sprecherin: Ein neuer Ansatz versucht, das Kernproblem vieler KI-Agenten zu adressieren: die mangelnde Zuverlässigkeit bei Entscheidungen.
Sprecher: Diogo Almeida, CEO von TypeSafe AI, stellt im Latent Space Podcast das Modell Jev vor. Es ist nicht auf Textgenerierung optimiert, sondern auf schnelle, kalibrierte Entscheidungen.
Sprecherin: Almeida kritisiert bisherige API-Modelle für ihre Probleme mit Halluzinationen. Die entstünden seiner Ansicht nach aus fehlerhaften menschlichen Rückmeldungen während des Trainings.
Sprecher: Jev nutzt stattdessen Reinforcement Learning for Calibrated Decisions, kurz RLCD. Eine Technik, die epistemisch ehrliche Wahrscheinlichkeiten liefern soll.
Sprecherin: Also Einschätzungen, die das Modell tatsächlich für zutreffend hält, statt nur plausibel klingende Antworten zu erzeugen.
Sprecher: Almeida warnt zudem vor öffentlichen Benchmarks, die leicht manipulierbar seien und nicht die wahre Intelligenz eines Modells widerspiegelten.
Sprecherin: Wie wird Jev praktisch eingesetzt?
Sprecher: Sascha Hoffmann beschreibt auf YouTube zwei Anwendungsfälle. Jev entscheide in Sekundenschnelle, ob bei Produktänderungen menschliche Eingriffe nötig seien, und werte große Mengen von Google Search Console-Daten aus.
Sprecherin: Die Kosten seien minimal, was das Modell für Unternehmen attraktiv mache, die viele gleichartige Entscheidungen automatisieren wollten. Der Fokus liegt auf Effizienz, nicht auf kreativer Textproduktion.
Sprecher: Die Diskrepanz zwischen den neunundachtzig Prozent KI-Nutzung und den siebenunddreißig Prozent positiver EBIT-Wirkung lässt sich so deuten: Unternehmen setzen KI ein, weil sie es müssen oder wollen.
Sprecherin: Aber die meisten haben noch nicht herausgefunden, wie sie daraus einen messbaren wirtschaftlichen Vorteil ziehen. Spezialisierte Modelle wie Jev könnten Teil der Lösung sein.
Sprecher: Nur wenn Unternehmen lernen, die richtigen Aufgaben zu identifizieren und die richtigen Daten bereitzustellen, wie Almeida betont. Bis dahin bleibt KI für viele ein Kostenfaktor auf der Suche nach Rechtfertigung.
Sprecherin: Kommen wir zu den neuen Paradigmen. Während sich die Debatte um KI-Agenten um deren praktischen Nutzen dreht, verschieben sich im Hintergrund die technischen Grundlagen.
Sprecher: TypeSafe AI hat mit Jev ein sogenanntes Entscheidungsmodell vorgestellt, das keine Texte mehr ausgibt, sondern nur noch Zahlen.
Sprecherin: Simon Willison beschreibt das genauer. Jev akzeptiert Texteingaben, gibt aber anstelle von Sätzen Fließkommazahlen zurück: Kategorien, Ja-Nein-Antworten, Bewertungen und Vertrauenswerte.
Sprecher: Das Modell ist als schnelles System-Eins-Komplement zu herkömmlichen Sprachmodellen gedacht – ein Werkzeug für Klassifizierung und Bewertung, nicht für Erklärung.
Sprecherin: Der Preis liegt bei null Komma null vier zwei Dollar pro Million Tokens. Günstiger als OpenAIs GPT-5 Nano, weil nur die Eingabe berechnet wird.
Sprecher: Laut Latent Space erreichte das Launch-Video in zwei Tagen sechsunddreißig Millionen Aufrufe und übertraf damit Modelle wie OpenAIs Navier Stokes.
Sprecherin: Bereits jetzt sind mehrere Klone erschienen – Laya, DiffusionGemmaJev und Bespoke Nimble. Die Reaktionen spalten sich.
Sprecher: Einige Nutzer stellen Geschwindigkeit über Qualität, andere kritisieren die fehlende Transparenz. Willison weist darauf hin, dass Jev keine Begründungen für seine Entscheidungen liefert.
Sprecherin: Das kann bei Anwendungen wie Spam-Erkennung oder Inhaltsbewertung zu nicht nachvollziehbaren Vorurteilen führen. Standardisierte Benchmarks für diese neue Kategorie gibt es noch nicht.
Sprecher: Parallel dazu verschiebt Runway die Grenze zwischen Videogenerierung und Echtzeitsimulation. GWM Worlds 2 erzeugt interaktive Videos und Audio in Echtzeit.
Sprecherin: Die Funktion WorldPrompt erlaubt es, bestimmte Aspekte einer simulierten Umgebung festzulegen und zeitgestempelte Ereignisse während der Laufzeit zu generieren.
Sprecher: Das mit fünf Komma drei Milliarden Dollar bewertete Unternehmen verfolgt das Ziel, vollständig selbstgenerierte, interaktive Spiele und Erfahrungen zu schaffen.
Sprecherin: The Decoder ergänzt, dass Nutzer Videos streamen sollen, während sie Prompts eingeben, anstatt auf fertige Clips zu warten.
Sprecher: Grundlage ist das hauseigene Weltmodell GWM-1, das Bilder Frame für Frame erzeugt. Neben kreativen Anwendungen sieht Runway Potenzial in der Robotik und der synthetischen Datengenerierung für Agenten.
Sprecherin: Bereiche, in denen die Fähigkeit, physikalisch plausible Szenarien vorherzusagen, entscheidend ist. Allerdings bleiben Herausforderungen.
Sprecher: Latent Space nennt die Fehlerakkumulation bei autoregressiven Modellen und die Notwendigkeit, die Generierung in Echtzeit zu optimieren.
Sprecherin: Beide Ansätze zeigen, dass die nächste Generation von KI-Systemen nicht mehr nur auf Sprachverarbeitung setzt.
Sprecher: Entscheidungsmodelle wie Jev könnten die Architektur von Agenten verändern, indem sie schnelle, kostengünstige Bewertungen ermöglichen – allerdings um den Preis der Nachvollziehbarkeit.
Sprecherin: Weltmodelle wie GWM Worlds 2 versprechen, die Grenze zwischen Generierung und Simulation aufzulösen. Das ist nicht nur für Spiele relevant, sondern auch für das Training von Robotern und autonomen Systemen.
Sprecher: Ob sich diese Paradigmen durchsetzen, hängt davon ab, ob die Branche bereit ist, die Kompromisse zu akzeptieren – weniger Transparenz hier, mehr Rechenaufwand dort.
Sprecherin: Die Frage ist nicht mehr nur, was KI sagt, sondern welche Art von Ausgabe sie überhaupt produziert.
Sprecher: Was bleibt, ist eine Branche im Widerspruch. Sie baut Systeme, die immer mehr können, aber noch nicht weiß, wofür sie gebraucht werden.
Sprecherin: Die Regulierungsdebatte offenbart, dass Sicherheitsbedenken und Wettbewerbstaktik kaum zu trennen sind. Lokale KI verspricht Unabhängigkeit, verlagert aber nur die Kosten von der Cloud auf die Hardware.
Sprecher: Und neue Paradigmen wie Entscheidungsmodelle oder Weltsimulatoren verschieben die Frage, was KI eigentlich ist – ohne zu klären, wozu sie dient.
Sprecherin: Nächste Woche wird sich zeigen, ob die Branche anfängt, Antworten auf diese Fragen zu suchen, oder ob sie weiter beschleunigt in der Hoffnung, dass sich der Nutzen irgendwann von selbst ergibt.
