News aus aller Welt
Start
Vorsicht, Halluzination: Warum du bei Steuerfragen nicht blind auf KI-Chatbots vertrauen solltest
Technik · 03.10.2026 18:05

Vorsicht, Halluzination: Warum du bei Steuerfragen nicht blind auf KI-Chatbots vertrauen solltest

Kurz: Eine neue Studie warnt: KI-Chatbots liefern bei Finanz- und Steuerfragen erschreckend oft falsche Informationen. Die Folgen können teuer werden.

Was geschehen ist – die Kernmeldung

Die Nutzung von künstlicher Intelligenz für komplexe finanzielle Fragestellungen hat in den letzten Jahren massiv an Popularität gewonnen. Viele Anwender betrachten Chatbots mittlerweile als eine Art digitalen Berater für Steuer- oder Rentenfragen. Doch eine aktuelle Untersuchung des Technologieunternehmens Saturn zeichnet ein besorgniserregendes Bild der Zuverlässigkeit dieser Systeme. Die Ergebnisse der Studie belegen, dass die gängigen KI-Modelle bei Finanzthemen in einem alarmierenden Ausmaß fehlerhafte Informationen liefern. Im Durchschnitt waren 57 Prozent der von den Systemen generierten Antworten inkorrekt. Diese Fehlerrate ist nicht nur statistisch signifikant, sondern stellt ein erhebliches Risiko für Nutzer dar, die sich bei sensiblen finanziellen Entscheidungen auf die Technologie verlassen. Die Untersuchung umfasst eine breite Palette bekannter KI-Modelle, darunter ChatGPT, Claude, Copilot, Grok und Gemini. Die Ergebnisse legen nahe, dass die Technologie in ihrem derzeitigen Entwicklungsstadium für eine verlässliche Finanzberatung keineswegs ausgereift ist und Nutzer Gefahr laufen, durch falsche Informationen gravierende finanzielle Fehlentscheidungen zu treffen, die bis hin zu hohen Steuernachzahlungen führen können.

Die Einzelheiten – Zahlen, Namen und konkrete Beispiele

Die Studie von Saturn stützt sich auf eine Analyse von mehr als 100 verschiedenen Finanzfragen, die sowohl an kostenlose als auch an kostenpflichtige KI-Modelle gerichtet wurden. Besonders kritisch wird es, wenn die Fragen einen gewissen Komplexitätsgrad überschreiten. Sobald mehr als ein einzelner Rechenschritt erforderlich ist, steigt die Fehlerquote der untersuchten Modelle laut der Untersuchung im Durchschnitt auf 88 Prozent an. In extremen Fällen lieferten einige der getesteten Systeme bei 99 Prozent dieser anspruchsvolleren Fragen falsche Ergebnisse. Selbst das Modell Claude Opus 5, das im sogenannten Reasoning-Modus die besten Ergebnisse innerhalb der Testreihe erzielte, wies immer noch eine Fehlerrate von 39 Prozent auf. Die Art der Fehler ist vielfältig: Die KI-Systeme produzieren Rechenfehler, ignorieren aktuelle oder anstehende Änderungen in der Steuergesetzgebung oder halluzinieren schlichtweg Regelungen, die in der Realität nicht existieren. Ein konkretes Beispiel illustriert die Gefahr: Ein Fehler bei der Berechnung der Rentenbesteuerung durch das Modell Claude Haiku 4.5 hätte einen britischen Sparer beinahe mit einer Steuernachzahlung in Höhe von 17.500 Pfund belastet, was umgerechnet etwa 20.400 Euro entspricht. Ein weiteres Beispiel betrifft die Falschinformation zu Studienkrediten, bei der ein Modell behauptete, Absolventen könnten die Rückzahlung bei einem Umzug ins Ausland einfach einstellen – eine Regel, die es so nicht gibt.

Hintergrund – Die Entwicklung der KI-Finanzberatung

Der Trend, KI-Chatbots für die persönliche Finanzplanung einzusetzen, ist eng mit der schnellen Verbreitung von Sprachmodellen verknüpft, die komplexe Texte in natürlicher Sprache verarbeiten können. Viele Anwender sehen in diesen Werkzeugen eine schnelle und kostengünstige Alternative zu professionellen Steuerberatern oder Finanzexperten. Doch die technische Architektur dieser Modelle, die auf Wahrscheinlichkeiten und Sprachmustern basiert, ist für die präzise Anwendung von Steuerrecht und mathematischen Finanzformeln nur bedingt geeignet. Die Untersuchung von Saturn zeigt auf, dass die Systeme zwar sprachlich überzeugend auftreten, aber inhaltlich keine Garantie für Korrektheit bieten können. Die Geschichte der KI-Entwicklung ist geprägt von dem Bestreben, die sogenannten Halluzinationen – also das Erfinden von Fakten – zu minimieren. Die aktuelle Studie verdeutlicht jedoch, dass gerade in hochsensiblen Bereichen wie dem Steuerwesen, wo absolute Genauigkeit erforderlich ist, die technischen Grenzen der Modelle nach wie vor gravierend sind. Die Diskrepanz zwischen der Eloquenz der Chatbots und der faktischen Richtigkeit ihrer Aussagen führt dazu, dass Nutzer die Qualität der Antworten oft falsch einschätzen, was die Gefahr einer unkritischen Übernahme der generierten Ratschläge massiv erhöht.

Die Beteiligten – Wer ist betroffen und wer warnt?

Im Zentrum der Untersuchung steht das Technologieunternehmen Saturn, das die Studie in Auftrag gegeben und durchgeführt hat. Der CEO von Saturn, Amal Jolly, äußerte sich gegenüber der Financial Times sehr deutlich zu den Gefahren der aktuellen Entwicklung. Er betonte, dass Millionen von Menschen weltweit KI-Modelle für ihre Finanzfragen nutzen, dabei jedoch Antworten erhalten, die sie teuer zu stehen kommen können. Auf der Seite der Anbieter sind die großen Akteure der KI-Branche betroffen, deren Modelle – darunter ChatGPT, Claude, Copilot, Grok und Gemini – in die Untersuchung einbezogen wurden. Die Nutzer, die diese Dienste in der Hoffnung auf Unterstützung bei Steuererklärungen oder Rentenfragen in Anspruch nehmen, sind die primär gefährdete Gruppe. Zudem werden Institutionen wie die britische Steuerbehörde HMRC im Kontext der Studie genannt, da deren Regelwerke von den KI-Modellen fehlerhaft interpretiert oder ignoriert wurden. Die Studie fungiert somit als eine Art Warnsignal an die breite Öffentlichkeit, die sich zunehmend auf digitale Assistenten verlässt, ohne die inhärenten Risiken der Technologie ausreichend zu hinterfragen.

Einordnung – Was die Studienergebnisse bedeuten

Einzuordnen ist das so: Die Ergebnisse der Saturn-Studie markieren einen wichtigen Punkt in der Debatte um die Sicherheit und Zuverlässigkeit von generativer KI. Den Berichten zufolge ist die Technologie derzeit nicht in der Lage, die notwendige Präzision für finanzielle Angelegenheiten zu gewährleisten. Die hohe Fehlerquote bei komplexen Berechnungen und die Tendenz zur Erfindung von Regeln deuten darauf hin, dass die zugrundeliegenden Modelle keine logische Prüfung der Fakten vornehmen, sondern lediglich statistisch plausible Antworten generieren. Dies ist ein entscheidender Unterschied zu einer fachlichen Beratung. Während ein Mensch die Konsequenzen seines Handelns versteht und haftbar gemacht werden kann, liefert die KI lediglich eine Antwort, die „gut klingt“. Die Gefahr besteht darin, dass Nutzer durch die überzeugende Art der Chatbots in Sicherheit gewiegt werden. Die Studie unterstreicht, dass die Nutzung von KI-Chatbots für Steuerfragen derzeit als hochriskant einzustufen ist. Wer sich auf diese Systeme verlässt, riskiert nicht nur finanzielle Verluste, sondern auch rechtliche Auseinandersetzungen mit Finanzbehörden, da die Verantwortung für die Richtigkeit der gemachten Angaben letztlich immer beim Steuerpflichtigen selbst liegt.

Offene Fragen – Was der Quelltext nicht beantwortet

Obwohl die Studie von Saturn ein deutliches Bild der Fehleranfälligkeit zeichnet, bleiben einige Aspekte unbeantwortet. Der Quelltext macht beispielsweise keine detaillierten Angaben dazu, ob die Fehlerhäufigkeit bei den kostenpflichtigen Premium-Versionen der KI-Modelle signifikant geringer ist als bei den kostenlosen Varianten, oder ob der Unterschied lediglich marginal ausfällt. Zudem wird nicht explizit thematisiert, ob die Anbieter der KI-Modelle bereits an spezifischen Sicherheitsupdates arbeiten, um die Fehlerquote bei mathematischen und steuerrechtlichen Fragen gezielt zu senken. Auch bleibt offen, wie die verschiedenen Modelle im direkten Vergleich bei unterschiedlichen Sprachen abschneiden, da die Studie primär auf den britischen Kontext und die dortigen Steuergesetze fokussiert ist. Ebenso wird nicht erläutert, ob es bestimmte Fragestellungen gibt, bei denen die KI-Modelle konstant korrekte Ergebnisse liefern, oder ob die Fehlerrate bei allen Finanzthemen gleichermaßen hoch ist. Die methodische Frage, wie genau die „Halluzinationen“ in der Studie identifiziert und kategorisiert wurden, wird ebenfalls nur oberflächlich angerissen, was eine tiefere wissenschaftliche Einordnung der Ergebnisse erschwert.

Wie es weitergeht – Ausstehende Entwicklungen

Die Ergebnisse der Untersuchung dürften den Druck auf die Entwickler von KI-Systemen erhöhen, die Zuverlässigkeit ihrer Modelle in fachspezifischen Bereichen zu verbessern. Da die Problematik der Halluzinationen bei Finanzfragen ein zentrales Hindernis für den breiten Einsatz der Technologie darstellt, ist davon auszugehen, dass die Anbieter ihre Modelle weiter optimieren müssen. Ob und wann es zu einer signifikanten Verbesserung der Korrektheit bei komplexen Berechnungen kommen wird, bleibt abzuwarten. Nutzer sind bis auf Weiteres gut beraten, die Ratschläge von KI-Chatbots bei steuerlichen Angelegenheiten mit äußerster Skepsis zu betrachten und diese keinesfalls ungeprüft in ihre Finanzplanung oder Steuererklärung zu übernehmen. Es steht zu erwarten, dass weitere Studien folgen werden, die das Verhalten der KI-Modelle bei verschiedenen regulatorischen Rahmenbedingungen untersuchen. Für die Anwender bleibt die Empfehlung bestehen, bei wichtigen finanziellen Entscheidungen weiterhin auf verifizierte Quellen oder professionelle Beratung zu setzen, anstatt sich auf die probabilistischen Antworten von Sprachmodellen zu verlassen, deren Fehlerpotenzial in der aktuellen Untersuchung eindrucksvoll belegt wurde.

Bild: Pexels: https://www.pexels.com/de-de/foto/person-frau-sitzung-sitzen-8720593/ · Foto: cottonbro studio
Quelle: https://t3n.de/news/ki-chatbots-finanzfragen-studie-falsche-antworten-1764310/?utm_source=rss&utm_medium=newsFeed&utm_campaign=newsFeed