Zum Inhalt springen
unterHUNDs – Hundeschule und Verhaltenstherapie im Saarland Initiative für gewaltfreies Hundetraining

Hunderatgeber · Verhaltensbiologie beim Hund

Vorhersagefehler beim Hund: Wie Überraschung Lernen steuert

Nicht die Belohnung treibt das Lernen an, sondern der Abstand zwischen Erwartung und Wirklichkeit. Was dieses Modell erklärt, was am Hund geprüft ist und was nicht.

Michael Sauerwein · 1. Mai 2026

Ein Leckerchen, das kommt, obwohl keines erwartet wurde, lehrt mehr als dasselbe Leckerchen nach Plan. Eine Belohnung, die ausbleibt, obwohl der Hund sicher mit ihr rechnete, erzeugt etwas, das sehr nach Enttäuschung aussieht. Beide Beobachtungen zeigen auf dieselbe zugrunde liegende Größe: den Abstand zwischen dem, was erwartet wurde, und dem, was eingetreten ist.

Dieser Beitrag behandelt den Vorhersagefehler als etabliertes Modell des Lernens, das auf das Hundetraining übertragen wird, und nicht als Befund am Hund, also wie er funktioniert, wie er Erwerb und Löschung antreibt, warum er Frustration erzeugt und was daraus für Verstärkerpläne, die Verlässlichkeit von Signalen und die Praxis folgt. Eine Einordnung zieht sich durch, und sie zählt hier mehr, als die Trainingsliteratur meist zugibt. Die Darstellung des Vorhersagefehlers entstand durch direkte Ableitungen an Dopaminneuronen wacher Affen und wurde seither bei Nagern ursächlich geprüft. Eine vergleichbare Messung wurde beim Hund nicht gemacht. Die Evidenz vom Hund besteht aus indirekten fMRT-Signalen, Verhaltensversuchen und Schlüssen aus einem gut gestützten artübergreifenden Modell. Der Rahmen ist stark, seine Besonderheiten beim Hund sind übertragen, und dieser Beitrag zieht die Linie, statt sie zu verwischen (die Neurochemie dahinter wird gesondert behandelt).

Hund bietet Verhalten (Pfote geben) und erwartet Belohnung, Beispiel für Lernen durch Vorhersage und Verstärkung

1. Was ein Vorhersagefehler ist

1.1 Die Definition

Ein Vorhersagefehler ist der Unterschied zwischen dem eingetretenen und dem erwarteten Ergebnis, wobei die Erwartung die Wertschätzung widerspiegelt, die das Tier aus früherer Erfahrung aufgebaut hat.

Ein positiver Vorhersagefehler heißt, das Ergebnis war besser als vorhergesagt, etwa eine größere Belohnung als sonst oder eine Belohnung, wo keine erwartet wurde. Der Wert dessen, was davor kam, wird nach oben korrigiert. Ein negativer Vorhersagefehler heißt, das Ergebnis war schlechter als vorhergesagt, etwa eine kleinere Belohnung oder gar keine. Der Wert wird nach unten korrigiert. Ein Vorhersagefehler von null heißt, Erwartung und Ergebnis stimmten überein, und es gibt nichts zu aktualisieren.

Der letzte Fall ist der widersinnige und der praktisch wichtige: Eine vollständig vorhersehbare Belohnung liefert kein neues Lernen. Sie erhält Verhalten, sie baut es nicht auf.

1.2 Es ist keine Rechnung, die der Hund anstellt

Ein Vorhersagefehler ist kein Abwägen. Er ist ein selbsttätiges Signal, das bestimmt, ob der Rest des Systems aufmerken, aktualisieren oder alles lassen soll. Ein Hund bemerkt nicht, dass eine Belohnung besser war als erwartet, die Abweichung wird registriert, bevor irgendetwas stattfinden könnte, das dem Bemerken ähnelt (weshalb Verhalten einen inneren Zustand nicht direkt wiedergibt).

1.3 Die theoretische Herkunft

Die Idee ist älter als die Neurowissenschaft. Rescorla und Wagner (1972) formulierten die Einsicht, dass Konditionierung davon abhängt, wie überraschend ein Ergebnis ist, und nicht von der bloßen Paarung: Ein Reiz, der von etwas anderem bereits vorhergesagt wird, gewinnt kaum an Verknüpfungsstärke. Die Theorie des bestärkenden Lernens drückte dasselbe Prinzip später als Lernen über zeitliche Differenzen aus, bei dem eine Wertschätzung im Verhältnis zum Fehler mal einer Lernrate korrigiert wird (Sutton & Barto, 2018).

1.4 Überraschung allein erzeugt kein Lernen

Es liegt nahe, das Modell auf „Überraschung lehrt“ zu verkürzen, und die Kurzfassung ist auf eine Weise falsch, die zählt. Eine Abweichung erzeugt nur dort Lernen, wo das Tier sie auf etwas beziehen kann: auf ein Ergebnis, das es wahrnehmen kann, auf einen Ankündiger, auf den es tatsächlich geachtet hat, und auf einen Zustand, in dem es die Information überhaupt verarbeiten kann.

Ein Ereignis, das bloß unerwartet ist und an das keine Konsequenz geknüpft ist, gibt dem System nichts zu aktualisieren. Ebenso wenig eine Abweichung bei einem Hund über seinem Arbeitsbereich oder eine, die an einem Merkmal hängt, das der Mensch nie gemeint hat (wo Erregung als eigene Variable behandelt wird). Überraschung ist eine Bedingung für Lernen und keine Methode, es herzustellen.

1.5 Warum die Idee den Aufwand lohnt

Der Vorhersagefehler erklärt eine Reihe von Befunden, die sonst unverbunden aussehen: warum der Zeitpunkt zählt, warum ein blockiertes Signal nicht gelernt wird, warum unregelmäßige Belohnung haltbarer ist und warum die Löschung langsam verläuft. Ein Prinzip, das vier Phänomene abdeckt, ist der Grund, warum die Idee die Lerntheorie übernommen hat.

Diese Reichweite ist zugleich der Grund zur Vorsicht, denn ein Rahmen, der viel erklärt, lässt sich leicht über das hinaus ausdehnen, wo er geprüft wurde (wo Löschung und Rückfall ausführlich behandelt werden). Die vier genannten Phänomene liegen in seinem Bereich, vieles, was ihm zugeschrieben wird, nicht.

2. Dopamin, Erwartung und Vorhersagefehler

2.1 Phasische und tonische Signale

Zwei Formen gehören getrennt. Phasische Dopaminreaktionen sind kurze, schubartige Anstiege oder Abfälle im Bereich von Sekundenbruchteilen, und sie tragen das Fehlersignal. Tonisches Dopamin ist der anhaltende Grundpegel, der Motivation und Nachdruck beim Verfolgen beeinflusst, aber selbst keinen Vorhersagefehler abbildet. Beides zu verwechseln, erzeugt den verbreiteten Fehler, Dopamin als allgemeine „Motivationschemie“ zu behandeln, deren Pegel man einfach anheben sollte.

2.2 Was die Ableitungen zeigten

Schultz, Dayan und Montague (1997) leiteten von Dopaminneuronen im Mittelhirn von Affen ab und fanden das Muster, das das Modell bestimmt: ein Schub bei unvorhergesagter Belohnung, keine Veränderung, wenn eine vollständig vorhergesagte Belohnung pünktlich eintrifft, und ein Einbruch unter das Ausgangsniveau, wenn eine vorhergesagte Belohnung ausbleibt. Mit dem Lernen wandert der Schub rückwärts zum frühesten verlässlichen Ankündiger der Belohnung, und das ist die mechanistische Erklärung dafür, warum ein Markersignal verstärkend wird.

Waelti, Dickinson und Schultz (2001) lieferten die entscheidende Prüfung mit einem Blockierungsversuch. Blockierung ist der klassische Nachweis, dass Paarung allein nicht genügt: Ein Reiz, der mit einer Belohnung gepaart wird, die ein anderer Reiz bereits vollständig vorhersagt, erzeugt kaum Lernen. Sie zeigten, dass die Dopaminreaktionen dem Vorhersagefehler folgten und nicht der Paarung von Reiz und Belohnung und dass das Lernen im Verhalten demselben Muster folgte. Die Dopaminreaktionen folgten in dieser Arbeit also der Erwartung und ihrer Verletzung und nicht der Belohnung als solcher.

2.3 Vorzeichenbehaftete und vorzeichenfreie Fehler

Der größte Teil dieses Beitrags betrifft den vorzeichenbehafteten Vorhersagefehler, bei dem die Richtung bestimmt, ob der Wert steigt oder sinkt. Lernmodelle nehmen außerdem ein vorzeichenfreies Fehlersignal an, das das Ausmaß der Überraschung unabhängig von der Richtung abbildet und eher mit Aufmerksamkeit und der Anpassung der Lernrate verbunden wird als mit dem Wert selbst. Es ist schlechter beschrieben und beim Hund im Grunde nicht untersucht.

2.4 Ein zweites Lernsignal

Das Bild ist zuletzt vielschichtiger geworden. Greenstreet et al. (2025) zeigten bei Mäusen, dass bewegungsbezogenes Dopamin im Schwanz des Striatums einen Handlungs-Vorhersagefehler abbildet, ein wertfreies Signal, das Wiederholung verstärkt statt Belohnung und das zusammen mit den Schaltkreisen des Belohnungsfehlers stabile Verknüpfungen von Reiz und Handlung festigt. Das sind Daten von Mäusen mit ursächlicher Prüfung, beim Hund vollständig ungeprüft, und sie legen nahe, dass „Dopamin lehrt Wert“ selbst in der Art, in der es begründet wurde, eine unvollständige Zusammenfassung ist (wie Gewohnheiten und selbsttätiges Verhalten allgemein behandelt werden).

2.5 Warum die einfache Darstellung überarbeitet wird

Die Darstellung, nach der Dopaminneurone einen einzigen skalaren Belohnungsfehler abbilden, ist durch neuere Arbeiten mit uneinheitlicheren Signalen komplizierter geworden (Greenstreet et al., 2025). Diese Überarbeitung findet in der Art statt, in der Ableitungen möglich sind.

Ein Trainingsartikel, der die einfache Fassung selbstsicher vorträgt, zitiert also eine Position, von der sich das Feld gerade entfernt (wo die Dopaminliteratur ausführlich geprüft wird). Die Vorhersagen zum Verhalten sind von dieser Überarbeitung nicht betroffen, und das ist der Grund, mit ihnen zu beginnen.

3. Was die Evidenz vom Hund tatsächlich zeigt

3.1 Beim Hund gibt es keine Dopaminableitung

Das gehört deutlich gesagt, weil die Trainingsliteratur häufig etwas anderes nahelegt. Niemand hat die Aktivität von Dopaminneuronen bei einem Hund abgeleitet. Es gibt keine Optogenetik beim Hund, keine Mikrodialyse während des Lernens, keine Einzelzellableitung. Jede Aussage über phasische Dopaminschübe im Gehirn eines Hundes ist von Primaten und Nagern übertragen.

3.2 Was die Bildgebung am Hund beiträgt

Die fMRT an wachen Hunden liefert die nächstbeste verfügbare Evidenz, und sie stützt das Modell innerhalb ihrer Grenzen tatsächlich. Berns, Brooks und Spivak (2012) brachten zwei Hunden bei, im Scanner stillzuliegen, und fanden eine Aktivierung des Nucleus caudatus auf ein Handzeichen, das Futter ankündigte, im Vergleich zu einem, das nichts ankündigte. Die Wiederholung weitete das auf dreizehn Hunde aus und fand bei acht von dreizehn eine positive Differenz im Caudatus, mit einem Mittelwert von 0,09 Prozent, vergleichbar mit Studien am Menschen (Berns et al., 2013). Cook et al. (2016) zeigten später, dass die Reaktionen des ventralen Caudatus auf Signale, die Futter oder Lob ankündigten, zwischen Individuen schwankten und die späteren Entscheidungen jedes Hundes vorhersagten.

Drei Vorbehalte gehören überall dazu: Die fMRT misst die Sauerstoffsättigung des Blutes und kein Dopamin, die Stichproben sind klein und bestehen aus ungewöhnlich kooperativen, scannertrainierten Hunden, und etwa ein Drittel der Hunde zeigte den Gruppeneffekt überhaupt nicht (dieselben Vorbehalte gelten für die Bildgebung zur frontalen Kontrolle beim Hund).

3.3 Die Evidenz vom Hund aus dem Verhalten

Das Verhalten bietet den direkteren Weg. Reicher et al. (2024) trainierten 24 Familienhunde in einem kontrollierenden und einem großzügigen Stil und fanden, dass Hunde, die die lohnendere Bedingung als erwartet erlebten, also eine positive Erwartungsverletzung, nach dem Schlafen besser abschnitten. Das ist ein Nachweis am Hund, dass Ergebnisse jenseits der Erwartung verändern, was behalten wird, ohne eine Aussage über die zugrunde liegende Neurochemie (und der Schlaf leistet daran einen erheblichen Teil).

3.4 Was die fMRT an wachen Hunden kann und was nicht

Sie misst die Durchblutung bei einem scannertrainierten Hund, der stillhält. Das ist eine echte Leistung, und sie ist mehrere Schritte davon entfernt, einzelne Dopaminneurone während des Lernens abzuleiten (Berns, Brooks & Spivak, 2012).

Zeigen kann sie, dass belohnungsbezogene Regionen auf verschiedene Reize verschieden reagieren und dass diese Unterschiede das Verhalten außerhalb des Scanners vorhersagen (Cook et al., 2016). Zeigen kann sie kein Signal eines Vorhersagefehlers, denn dafür müssten einzelne Neurone in einer zeitlichen Auflösung erfasst werden, die die fMRT nicht erreicht.

3.5 Die Verhaltensevidenz ist die stärkere Spalte

Ob Hunde sich so verhalten, wie das Modell es vorhersagt, lässt sich ohne jede Bildgebung prüfen, und mehrere dieser Vorhersagen wurden bei dieser Art untersucht, darunter Blockierung, Wirkungen des Zeitpunkts und Wirkungen der Verstärkerpläne. Diese Evidenz trägt die praktischen Aussagen und wird selten zitiert, denn ein Verhaltensergebnis lässt sich weniger eindrucksvoll wiederholen als ein Hirnbefund.

Ein Beitrag, der auf Verhalten vom Hund beruht und den Mechanismus von Primaten leiht, steht besser da als einer, der es umgekehrt macht (wofür es gut ist, eine Verhaltensaussage messbar zu machen). Die umgekehrte Bauweise ist im Trainingsmaterial verbreitet und erzeugt die selbstsicheren Aussagen, die beim Nachprüfen zusammenfallen.

4. Was das Modell nicht erklärt

4.1 Woher die Vorhersage kommt

Der Vorhersagefehler ist der Unterschied zwischen dem Erwarteten und dem Eingetretenen. Was die Erwartung überhaupt bestimmt und wie sie aufgebaut wird, also wie ein Hund dazu kommt, aus einer Situation, die er ein paarmal erlebt hat, überhaupt etwas zu erwarten, setzt das Modell voraus.

Das ist kein Mangel, sondern der Zuschnitt des Modells. Zum Mangel wird es, wenn es als vollständige Darstellung des Lernens präsentiert wird, und so kommt es in Trainingsmaterial meist an.

4.2 Worauf der Hund achtet

Das Fehlersignal aktualisiert den Wert dessen, was das Tier als Ankündiger behandelt hat. Was das Tier als Ankündiger behandelt hat, ist eine Frage der Aufmerksamkeit und der Wahrnehmung, und dazu sagt das Modell nichts. Zwei Hunde können in derselben Einheit aus demselben Ereignis völlig verschiedene Verknüpfungen aktualisieren.

Praktisch liegt hier der größte Teil der Trainingsfehler: Der Hund hat etwas gelernt, und es war nicht das, was der Mensch zu markieren glaubte (wofür es gut ist, eine Verhaltensaussage messbar zu machen). Das Fehlersignal hat seine Arbeit korrekt an der falschen Verknüpfung getan, und deshalb scheint der Hund nichts gelernt zu haben, während er in Wahrheit etwas anderes gelernt hat.

4.3 Motivation und Zustand

Dieselbe Belohnung erzeugt je nach Hunger, Müdigkeit, Erregung oder Unwohlsein einen anderen Fehler. Das Modell behandelt das, indem es den Belohnungswert als Größe einsetzt, und das verschiebt die Frage, statt sie zu beantworten (wo Erregung als eigene Variable behandelt wird). Für einen Menschen am anderen Ende der Leine ist diese Größe das eigentliche Problem: wofür dieser Hund heute an diesem Ort arbeitet.

4.4 Individuelle Unterschiede

Zwei Hunde lernen unter gleichen Bedingungen verschieden schnell, und das Modell fängt das mit einer Lernrate auf, die im Nachhinein angepasst wird. Das ist beschreibend nützlich und erklärt nicht, warum die Raten sich unterscheiden (individuelle Unterschiede wiegen mehr, als Gruppenmittelwerte vermuten lassen). Eine an ein Ergebnis angepasste Größe ist eine Zusammenfassung des Ergebnisses und keine Erklärung dafür.

4.5 Warum die Grenzen hier besonders zählen

Der Vorhersagefehler gehört zu den elegantesten Ideen in diesem Bereich, und Eleganz lädt zur Überdehnung ein. Ein Rahmen, der Zeitpunkt, Blockierung, Löschung und Planeffekte abdeckt, sieht aus, als müsste er alles abdecken, und wird entsprechend zitiert.

Zu wissen, was er auslässt, hält ihn nützlich, und die oben genannten Auslassungen sind genau die Größen, mit denen eine Fachkraft die meiste Zeit verbringt: worauf der Hund achtet, wie es ihm geht und warum dieser Hund nicht der letzte ist.

5. Vorhersagefehler beim operanten und beim klassischen Lernen

5.1 Operant: den Wert von Handlungen aktualisieren

Wenn ein Hund ein Verhalten zeigt und ein Ergebnis folgt, wird der Wert dieses Verhaltens durch den Fehler korrigiert. Die allererste Belohnung für ein Sitz erzeugt einen großen positiven Fehler und schnellen Erwerb. Eine unerwartet hochwertige Belohnung erzeugt einen positiven Fehler und stärkt das Verhalten, das ihr vorausging. Das übliche Leckerchen, das genau wie erwartet eintrifft, erzeugt annähernd nichts, das Verhalten wird erhalten und nicht gestärkt.

Eine begriffliche Unterscheidung lohnt sich hier. Die Wertminderung durch einen negativen Vorhersagefehler ist nicht dasselbe wie Strafe. Strafe ist eine von außen eingesetzte Konsequenz, ein negativer Vorhersagefehler ist das eigene Aktualisierungssignal des Systems, erzeugt durch das Ausbleiben eines erwarteten Ergebnisses. Die Folge im Verhalten, also eine geringere Wahrscheinlichkeit, kann ähnlich aussehen, doch Mechanismus und Folgen für das Wohlbefinden unterscheiden sich.

5.2 Klassisch: wie ein Marker Wert bekommt

Dieselbe Logik treibt das Lernen von Signalen an. Anfangs kündigt ein Clicker nichts an und erzeugt keine Reaktion. Während des Lernens folgt auf den Klick Futter, und der Fehler entsteht beim Futter. Nach dem Lernen hat sich die Reaktion auf den Klick selbst verschoben, und das Futter erzeugt, weil es nun vollständig vorhergesagt ist, keinen Fehler mehr. Der Marker ist genau deshalb zum konditionierten Verstärker geworden, weil er jetzt die Stelle besetzt, an der der Vorhersagefehler entsteht.

5.3 Löschung

Die Belohnung nach einem eingeführten Signal vorzuenthalten, erzeugt in dem Moment einen negativen Vorhersagefehler, in dem die Belohnung fällig war. Wiederholt verringert das den erwarteten Wert des Signals. Entscheidend ist, dass es die ursprüngliche Verknüpfung nicht entfernt: Die Löschung erzeugt ein neues hemmendes Lernen, das mit dem ursprünglichen konkurriert, das verfügbar bleibt. Deshalb treten Spontanerholung, Erneuerung in einem anderen Zusammenhang und schnelles Wiedererlernen auf (die vollständige Darstellung, warum gelöschtes Verhalten zurückkehrt), und deshalb zählt es mehr, eine konkurrierende Alternative aufzubauen, als das Ursprüngliche zu tilgen (die Flexibilitätsseite desselben Vorgangs).

5.4 Warum der Zeitpunkt so sehr zählt

Ein Marker, der in dem Moment kommt, in dem das Verhalten auftritt, bestimmt, welches Verhalten das Fehlersignal aktualisieren soll. Zwei Sekunden später bestimmt er, was der Hund dann gerade tat.

Das ist die klarste praktische Folge des ganzen Rahmens, und sie ergibt sich aus dem Modell, ohne dass eine Aussage über Botenstoffe nötig wäre (wie die Literatur zur Verstärkung darlegt). Wer nichts weiter verbessert als den Zeitpunkt seines Markers, sieht meist einen Unterschied, und das auszuprobieren kostet nichts, bevor irgendetwas anderes verändert wird.

6. Negativer Vorhersagefehler: Frustration und vergiftete Signale

6.1 Die emotionalen Kosten

Ein negativer Vorhersagefehler ist keine emotional neutrale Rechenoperation. Das unerwartete Ausbleiben einer Belohnung geht mit negativem Erleben und mit Aktivierung von Regionen wie dem anterioren cingulären Kortex und der Amygdala einher, Befunde aus Arbeiten an Menschen und Nagern, die auf den Hund übertragen und dort nicht gemessen wurden.

Im Verhalten ist das Bild beim Hund auch ohne die Neurowissenschaft deutlich genug: Hunde mit geringer Frustrationstoleranz reagieren auf unerwartet ausbleibende Verstärkung mit Hochschaukeln, Umlenken oder Aussteigen, und für diese Hunde ist die alleinige Löschung ein schlechtes Werkzeug (die Neurobiologie der Frustration beim Hund im Detail).

6.2 Löschungsbursts sind weniger allgemein als behauptet

Der vorübergehende Anstieg des Verhaltens zu Beginn der Löschung wird meist als unvermeidlich dargestellt. Das ist er nicht. Lerman und Iwata (1995) werteten 113 Datensätze zur Löschung aus und fanden einen Burst in 24 Prozent der Fälle und, für die Praxis wichtig, in 36 Prozent der Fälle, in denen die Löschung allein eingesetzt wurde, gegenüber nur 12 Prozent, wenn sie mit anderen Verfahren wie der Verstärkung eines Alternativverhaltens verbunden war.

Das ist ein ungewöhnlich handlungsnaher Befund: Löschung mit differenzieller Verstärkung zu verbinden, senkt die Burst-Rate ungefähr auf ein Drittel. Die Arbeit stammt aus der angewandten Verhaltensanalyse mit menschlichen Teilnehmern und nicht von Hunden, die Prozentzahlen sollten also nicht wörtlich übertragen werden. Die Richtung des Effekts passt zur Darstellung über den Vorhersagefehler, denn eine verfügbare Alternative, die sich weiterhin auszahlt, hält positive Fehler im Spiel.

6.3 Vergiftete Signale

Ein Signal, auf das manchmal etwas Unangenehmes folgte, kündigt eine Mischung von Ergebnissen an. Sein erwarteter Wert sinkt, und die Streuung dieser Erwartung steigt, was Zögern, Konflikt oder Verweigerung erzeugt.

Der Begriff stammt aus der Praxis und hat beim Hund keine eigene experimentelle Literatur. Die härteste Evidenz in der Nähe ist Schilder und van der Borg (2004): Schutzhunde, die mit Teletaktgeräten trainiert worden waren, zeigten weiterhin Stressverhalten in Situationen, in denen kein Reiz gegeben wurde, weil sie gelernt hatten, dass die Anwesenheit und die Signale ihres Menschen ihn ankündigten. Das ist derselbe Vorgang auf der Ebene der Person statt eines einzelnen Signals (die weiteren Folgen aversiver Methoden).

6.4 Warum vergiftete Signale das beste Beispiel dieses Beitrags sind

Ein Signal, das manchmal etwas Unangenehmes ankündigt, bekommt einen gemischten Wert, und die Reaktion des Hundes spiegelt diese Mischung und nicht die Absicht dahinter. Das ist eine Vorhersage, die das Modell sauber macht und die Menschen ständig beobachten (wo Frustration als eigenes Thema behandelt wird).

Es erklärt auch, warum ein Rückrufsignal an Wert verliert, wenn damit angenehme Beschäftigung beendet wird, und das ist ein verbreitetes und vermeidbares Problem mit einem Mechanismus dahinter. Einen Hund vom Spaziergang abzurufen, nur um ihn anzuleinen und heimzugehen, ist der übliche Weg, das wichtigste Signal eines Haushalts zu vergiften.

6.5 Negative Fehler sind kein Trainingswerkzeug

Weil negative Vorhersagefehler Lernen antreiben, liegt es nahe, sie herzustellen. Der Preis ist Frustration, und die Verhaltensevidenz zur Frustration beim Hund ermutigt nicht dazu, sie absichtlich zu erzeugen.

Negative Fehler zu steuern statt sie zu maximieren, ist die Position, die die Evidenz stützt, und der Beitrag sagt das in seinem praktischen Kapitel (wo Erregung als eigene Variable behandelt wird). Etwas negativer Fehler ist bei jedem Lernen unvermeidlich, ihn absichtlich zu erzeugen, ist eine andere Entscheidung.

7. Verstärkerpläne: was der Vorhersagefehler erklärt und was nicht

7.1 Die Aussage, die korrigiert gehört

Es heißt verbreitet, variable Verstärkung erzeuge stärkeres Lernen als durchgehende. Das wirft zwei verschiedene Dinge zusammen. Was variable Pläne verlässlich erzeugen, ist ein größerer Löschungswiderstand, also der Effekt der partiellen Verstärkung, weil ein Tier, das durch unbelohnte Durchgänge hindurch trainiert wurde, das Ausbleiben der Belohnung weniger überraschend findet, wenn die Verstärkung endet. Das ist nicht dasselbe wie schnellerer oder besserer Erwerb.

7.2 Die Prüfung am Hund

Cimarelli et al. (2021) prüften das direkt. Zwei Gruppen unerfahrener Hunde wurden per Clicker auf ein neues Verhalten trainiert, eine bekam nach jedem Klick Futter, die andere nach 60 Prozent der Klicks. Teilweises Belohnen verbesserte die Lerngeschwindigkeit nicht, und die teilweise belohnten Hunde zeigten anschließend eine pessimistischere Bewertung mehrdeutiger Reize als die durchgehend belohnte Gruppe.

Die Logik des Vorhersagefehlers, die Variabilität attraktiv macht, hat also eine Randbedingung, und sie liegt früh. Bei einem Hund, der die Verknüpfung noch nicht gebildet hat, sind ausgelassene Belohnungen schlicht negative Vorhersagefehler mit emotionalen Kosten und ohne ausgleichenden Nutzen (Verstärkerpläne und ihre Wirkungen ausführlich).

7.3 Hunde bevorzugen die überraschende Möglichkeit nicht durchgängig

Wäre Unvorhersehbarkeit für sich verstärkend, müssten Hunde bei der Wahl zwischen einer gleichbleibenden und einer wechselnden Belohnung die wechselnde bevorzugen. Bremhorst, Bütler, Würbel und Riemer (2018) führten diese Prüfung mit 16 Familienhunden in einem Wahlversuch mit zwei gleichzeitigen Möglichkeiten durch. Auf Gruppenebene unterschieden sich die Entscheidungen nicht vom Zufall: Sechs Hunde bevorzugten die wechselnde Belohnung, sechs die gleichbleibende, und vier zeigten keine Vorliebe.

Das ist eine kleine Stichprobe und ein Wahlversuch und kein Lernversuch, und es ist trotzdem die direkteste verfügbare Prüfung am Hund für eine Aussage, die Trainer ständig wiederholen. Variabilität ist eine Eigenschaft des Plans, die den Löschungswiderstand beeinflusst, und nichts, was Hunde als Art suchen (individuelle Unterschiede wiegen mehr, als Gruppenmittelwerte vermuten lassen).

7.4 Die praktische Zusammenfassung

Durchgehend verstärken, solange ein Verhalten erworben wird. Sobald es flüssig läuft, Variabilität und gelegentlich größere Belohnungen als erwartet einführen, um positive Vorhersagefehler zu erhalten und Löschungswiderstand aufzubauen. Die Reihenfolge ist keine Geschmacksfrage, ihre Umkehrung wurde am Hund geprüft und funktionierte nicht (und ein Hund, der ein Verhalten gar nicht abrufen kann, ist wieder ein anderes Problem).

7.5 Was die Prüfung am Hund beiträgt

Teilweise Belohnung im Clickertraining beim Hund zu verändern (Cimarelli et al., 2021), prüft eine Vorhersage des Modells und zugleich eine Empfehlung, die Trainer geben. Diese Verbindung, also eine theoretische Aussage mit einer Prüfung am Hund daneben, ist in diesem Feld selten genug, um sie zu benennen.

Sie brachte außerdem ein Ergebnis hervor, das den üblichen Rat verkompliziert, und das ist das aufschlussreichere Ergebnis (wie die Literatur zur Verstärkung darlegt). Eine Prüfung am Hund, die die Empfehlung bestätigt hätte, hätte weniger beigetragen.

8. Training mit dem Vorhersagefehler im Blick

8.1 Der Mensch als Quelle von Vorhersagefehlern

Ein Mensch ist Teil der Umgebung, die der Hund vorhersagt. Unbeständige Zusammenhänge, also ein Signal, das mal bezahlt und mal nicht, Kriterien, die sich unangekündigt verschieben, Belohnungen, die von der Laune abhängen, erzeugen Vorhersagefehler ohne nützliche Information, weil ihnen nichts entspricht, worauf der Hund reagieren könnte.

Es gibt außerdem direkte Evidenz, dass der Gefühlszustand von Menschen die Entscheidungen von Hunden erreicht: Parr-Cortes et al. (2024) fanden, dass der Geruch einer fremden gestressten Person Hunde langsamer machte, sich einem von drei mehrdeutigen Orten in einem Test zur Bewertungsverzerrung zu nähern, achtzehn Hunde in einer einzelnen Studie, aber ein Nachweis, dass der Mensch kein neutrales Element ist (wie Gefühlszustände zwischen den Arten übergehen).

8.2 Überraschung dort einsetzen, wo sie hilft

Gelegentliche Jackpots und unerwartete Aufwertungen der Belohnung erzeugen große positive Fehler und stärken das, was ihnen vorausging. Neue Verstärker wirken aus demselben Grund. Das ist eine Technik für die Erhaltungsphase und nicht für die Erwerbsphase.

8.3 Zusammenhänge lesbar halten

Klare Kriterien, gleichbleibende Zeitpunkte und ein genau eingesetzter Marker verringern das Rauschen in den Vorhersagen des Hundes. Das Ziel ist nicht das Fehlen von Überraschung, sondern dass Überraschung Information trägt (und das hält auch die Erregung in einem brauchbaren Bereich).

8.4 Negative Fehler steuern statt maximieren

Wo ein Verhalten abnehmen soll, eine Alternative aufbauen, die sich auszahlt. Differenzielle Verstärkung gibt dem Hund einen Weg zu positiven Fehlern, während das alte Verhalten gelöscht wird, und senkt nach Lerman und Iwata (1995) den Burst erheblich. Den Belohnungswert schrittweise zu senken, bevor er wegfällt, erzeugt kleinere Fehler als ein abruptes Ende.

Der häufig empfohlene Marker für ausbleibende Belohnung gehört in eine vorsichtigere Kategorie. Die Begründung ist stimmig: Ein Signal, dass keine Verstärkung kommt, sollte Unsicherheit verringern und das Aktualisieren beschleunigen. Ob es das beim Hund tut, ohne selbst aversive Eigenschaften zu bekommen, wurde experimentell nicht geklärt, und es sollte mit dieser Unsicherheit eingesetzt werden (und an messbaren Kriterien beobachtet werden statt am Eindruck).

8.5 Den Wert von Signalen schützen

Auf ein Signal keine unangenehme Konsequenz folgen lassen und keine Signale geben, die der Hund voraussichtlich nicht ausführen kann. Wo ein Signal bereits beschädigt ist, verlangt der Wiederaufbau viele positive Fehler gegen eine gefestigte negative Vorgeschichte, und ein Alternativsignal neu aufzubauen, ist oft schneller, als das beschädigte zu reparieren.

9. Wie man das nutzt, ohne zu viel zu behaupten

9.1 Überraschung sagen, nicht Dopamin

Jeder praktische Punkt dieses Beitrags lässt sich sagen, ohne einen Botenstoff zu nennen. Lernen passiert dort, wo Ergebnisse von Erwartungen abweichen und der Hund die Abweichung auf etwas beziehen kann, ein Marker wirkt, weil er kommt, solange das Ergebnis noch ungewiss ist, und eine vollständig vorhersehbare Belohnung trägt wenig zum Aufbau bei.

Nichts davon braucht die Neurochemie, und es ohne sie zu sagen, vermeidet eine Aussage, die die Evidenz vom Hund nicht stützt (wo die Dopaminliteratur ausführlich geprüft wird). Einen Botenstoff zu nennen, fügt Autorität hinzu und keine Information.

9.2 Wie ein sorgfältiger Satz aussieht

Nicht „der Klick löst eine Dopaminausschüttung aus“, sondern „der Klick ist aufschlussreich, weil er kommt, während das Ergebnis noch ungewiss ist“. Das Zweite ist im Verhalten gezeigt, das Erste ist ein Schluss aus Ableitungen bei Primaten, formuliert, als hätte jemand es bei dem Hund gemessen, der vor einem steht.

Der Unterschied kostet nichts an Klarheit und viel an Haltbarkeit, besonders vor einem Publikum, in dem eine Tierärztin sitzt.

9.3 Wo das Modell einem Menschen wirklich hilft

Es erklärt, warum ein Signal, das immer dasselbe ankündigt, aufhört, aufschlussreich zu sein, warum eine bereits vorhergesagte Belohnung weniger lehrt, warum ein zweites Signal neben einem zuverlässigen nicht gelernt wird und warum der Zeitpunkt des Markierens mehr zählt als die Größe der Belohnung.

Diese Punkte sind widersinnig, sie verändern das Handeln, und sie folgen aus dem Verhaltensmodell und nicht aus dem neuronalen. Mehr muss eine Theorie nicht leisten, um sich ihren Platz in der Praxis zu verdienen, und mehr schaffen die wenigsten.

9.4 Was tun, wenn jemand die Neurowissenschaft zitiert

Nach der Art fragen. Die Antwort lautet fast immer Primat oder Nager, und die nützliche Nachfrage ist, ob die Verhaltensvorhersage beim Hund geprüft wurde, was für mehrere Aussagen dieses Beitrags zutrifft (wie die Literatur zur Verstärkung darlegt). Eine Aussage mit einer Verhaltensprüfung am Hund dahinter ist es wert, danach zu handeln, wie auch immer sich der Mechanismus herausstellt.

Das ist eine faire und keine feindselige Frage, und sie trennt die Aussagen, nach denen zu handeln sich lohnt, von denen, die man zur Kenntnis nimmt. Die meisten, die die Neurowissenschaft zitieren, geben etwas wieder, das sie gelesen haben, statt eine Position zu verteidigen.

10. Welche Befunde von welcher Art stammen

10.1 Die Trennung ist deutlich, und der Beitrag sagt das

Der Mechanismus stammt aus der Neurophysiologie von Primaten und Nagern, die Theorie aus der mathematischen Psychologie, und der Beitrag vom Hund besteht aus Bildgebung und Verhalten. Dieser Beitrag ist darin ungewöhnlich, dass er das in seinem dritten Kapitel sagt, statt es zu verstecken.

10.2 Der Mechanismus wurde bei Affen abgeleitet und bei Nagern bestätigt

Dopaminneurone, die den Unterschied zwischen erwarteter und erhaltener Belohnung abbilden, wurden bei Primaten abgeleitet (Schultz, Dayan & Montague, 1997), und der Befund, dass diese Reaktionen der formalen Lerntheorie folgen, ebenso (Waelti, Dickinson & Schultz, 2001). Die ursächliche Arbeit, die zeigt, dass das Signal Lernen antreibt und es nicht nur begleitet, wurde bei Nagern durchgeführt, wo die nötigen Eingriffe möglich sind.

Neuere Arbeiten haben die einfache Fassung erheblich verkompliziert (Greenstreet et al., 2025), und das zählt, weil die einfache Fassung im Trainingsmaterial kursiert (wo die Dopaminliteratur ausführlich geprüft wird).

10.3 Die Theorie ist überhaupt nicht empirisch

Das Rescorla-Wagner-Modell ist eine formale Darstellung des Verknüpfungslernens (Rescorla & Wagner, 1972), und der Rahmen des bestärkenden Lernens ist rechnerisch (Sutton & Barto, 2018). Keines von beiden ist ein Befund über ein Tier, beides sind Rahmen, die zu Befunden passen.

Ein Lehrbuch des bestärkenden Lernens in einem Beitrag über Hunde zu zitieren, begründet eine Sprache und kein Ergebnis, und es lohnt sich zu bemerken, welche Einträge in einem Verzeichnis von dieser Art sind (wofür es gut ist, eine Verhaltensaussage messbar zu machen). Eine lange Quellenliste unterscheidet nicht zwischen Befunden, Rahmen und Lehrbüchern.

10.4 Was am Hund gemessen wurde

Die fMRT an wachen, nicht fixierten Hunden wurde als Verfahren begründet (Berns, Brooks & Spivak, 2012, 2013) und zur Vorhersage von Vorlieben eingesetzt (Cook et al., 2016). Teilweises Belohnen im Clickertraining wurde verändert (Cimarelli et al., 2021), die Vorliebe für gleichbleibende gegenüber wechselnden Belohnungen wurde direkt geprüft (Bremhorst et al., 2018), der Geruch eines gestressten Menschen verschiebt die Bewertung (Parr-Cortes et al., 2024), und die Wirkungen von Teletaktgeräten sind dokumentiert (Schilder & van der Borg, 2004).

Sieben Quellen vom Hund, keine davon mit einer Ableitung eines Dopaminsignals, denn das wurde bei dieser Art nie gemacht. Die invasive Ableitung, die die Arbeit an Primaten verlangte, wird niemand an einem Familienhund vornehmen, und diese Lücke ist deshalb dauerhaft und nicht offen. Das gehört deutlich gesagt, denn Lücken, die als künftige Arbeit beschrieben werden, legen nahe, dass jemand daran arbeitet.

10.5 Warum die praktischen Kapitel trotzdem tragen

Die Empfehlungen hier, also Zusammenhänge lesbar halten, genau markieren, den Wert von Signalen schützen und keine Frustration herstellen, folgen aus Verhaltensbefunden und würden eine erhebliche Überarbeitung der Dopamin-Darstellung überstehen.

Das ist die Prüfung, auf die es ankommt, und dieser Beitrag besteht sie bequemer als die meisten, weil sein praktisches Material nie auf der Neurophysiologie beruhte (wie die Literatur zur Verstärkung darlegt). Die Neurowissenschaft erklärt, warum die Verhaltensbefunde so aussehen, und sie ist nicht das, was sie wahr macht.

11. Arten von Vorhersagefehlern auf einen Blick

Positiver Vorhersagefehler – Bedeutung: Ergebnis besser als erwartet. Signal: phasischer Dopaminschub, bei Primaten und Nagern belegt. Wirkung: stärkt das vorausgehende Verhalten oder Signal, treibt den Erwerb an. Einsatz: Jackpots, neue Verstärker, Variabilität nach erreichter Flüssigkeit.

Vorhersagefehler von null – Bedeutung: Ergebnis genau wie vorhergesagt. Signal: keine Nettoveränderung. Wirkung: keine Wertänderung, das Verhalten wird erhalten, und Wiederholung kann es über andere Mechanismen festigen. Einsatz: Erhaltung, kein Aufbau.

Negativer Vorhersagefehler – Bedeutung: Ergebnis schlechter als erwartet oder ausbleibend. Signal: Einbruch unter das Ausgangsniveau. Wirkung: senkt den Wert, treibt die Löschung an. Einsatz: Löschung, am besten mit differenzieller Verstärkung, mit emotionalen Kosten verbunden.

Vorzeichenfreier Vorhersagefehler – Bedeutung: Ausmaß der Überraschung unabhängig von der Richtung. Signal: vermutlich nicht rein dopaminerg. Wirkung: beeinflusst Aufmerksamkeit und Lernrate statt des Werts. Einsatz: begrifflich, beim Hund nicht untersucht.

Handlungs-Vorhersagefehler – Bedeutung: Unterschied zwischen ausgeführter und vorhergesagter Handlung. Signal: bewegungsbezogenes Dopamin im Schwanz des Striatums, bei Mäusen. Wirkung: wertfreie Verstärkung der Wiederholung, festigt Gewohnheiten. Einsatz: noch keiner, rein erklärend.

12. Forschungslücken und kritische Einordnung

Der Mechanismus wurde bei keinem Hund gemessen. Die Abbildung des Vorhersagefehlers wurde durch Einzelzellableitung bei Affen begründet (Schultz et al., 1997; Waelti et al., 2001) und bei Nagern ursächlich bestätigt. Ein Gegenstück beim Hund gibt es nicht, und Aussagen, das Modell sei „beim Hund bestätigt“, sind nicht haltbar.

Die Bildgebung am Hund ist indirekt und uneinheitlich. Das BOLD-Signal ist kein Dopamin, die Stichproben liegen im niedrigen zweistelligen Bereich, und in der Wiederholung zeigten nur 8 von 13 Hunden die Differenz im Caudatus (Berns et al., 2013).

Die emotionale Seite ist weitgehend übertragen. Der Zusammenhang zwischen ausbleibender Belohnung und Aktivität im anterioren cingulären Kortex und in der Amygdala stammt aus Arbeiten an Menschen und Nagern (wie der größte Teil der Neurochemie-Literatur zum Hund).

Planeffekte werden verbreitet falsch dargestellt. Variable Verstärkung erhöht den Löschungswiderstand, sie verbessert den Erwerb nicht ohne Weiteres, und bei unerfahrenen Hunden beschleunigte teilweises Belohnen das Lernen nicht und ließ den Gefühlszustand nicht unberührt (Cimarelli et al., 2021). Hunde bevorzugen wechselnde Belohnungen auch nicht als Gruppe: In einem Wahlversuch entschieden sich 6 von 16 für die wechselnde, 6 für die gleichbleibende und 4 für keine von beiden (Bremhorst et al., 2018).

Löschungsbursts sind die Ausnahme und nicht die Regel. Sie traten in 24 Prozent der ausgewerteten Fälle auf und in 12 Prozent, wenn die Löschung mit anderen Verfahren verbunden war (Lerman & Iwata, 1995), wobei dieser Datensatz aus der angewandten Verhaltensanalyse beim Menschen stammt und nicht vom Hund.

Vergiftete Signale und Marker für ausbleibende Belohnung sind Begriffe aus der Praxis. Beide sind im Rahmen des Vorhersagefehlers stimmig, und keiner hat beim Hund eine eigene experimentelle Literatur.

Der Handlungs-Vorhersagefehler stammt von Mäusen. Greenstreet et al. (2025) ist starke ursächliche Arbeit in einem Teilbereich des Striatums bei einer Aufgabe, und ihre Ausweitung auf Hunde ist Spekulation.

Die individuellen Unterschiede sind erheblich und zu wenig abgebildet. Die Ansprechbarkeit auf Belohnung unterscheidet sich zwischen Hunden deutlich, sodass derselbe Zusammenhang bei verschiedenen Tieren verschiedene Fehler erzeugt (wie es die Temperamentforschung erwarten ließe).

Beim Hund gibt es keine Dopaminableitung. Der Mechanismus wurde bei Primaten abgeleitet (Schultz et al., 1997; Waelti et al., 2001), bei Nagern ursächlich bestätigt und für diese Art erschlossen.

Die einfache Dopamin-Darstellung wird überarbeitet. Neuere Arbeiten berichten uneinheitlichere Signale als einen einzigen skalaren Fehler (Greenstreet et al., 2025), und zwar in der Art, in der Ableitungen möglich sind.

Zwei der Quellen sind theoretisch. Das Rescorla-Wagner-Modell und der Rahmen des bestärkenden Lernens sind formale Darstellungen und keine Befunde über Tiere.

Das Modell bestimmt die Aufmerksamkeit nicht. Welches Merkmal der Hund als Ankündiger behandelt, entscheidet darüber, was gelernt wird, und der Rahmen setzt das voraus.

13. Fazit

Der Vorhersagefehler ist das nützlichste einzelne Modell, das für das Nachdenken über das Lernen von Hunden zur Verfügung steht, denn er erklärt Erwerb, Löschung, Frustration, den Wert von Signalen und Planeffekte mit einem Mechanismus statt mit fünf Regeln. Sein praktischer Inhalt ist schlicht: Lernen passiert dort, wo Ergebnisse von Erwartungen abweichen, deshalb erhält eine vollständig vorhersehbare Verstärkung Verhalten, ohne es aufzubauen, und deshalb lehrt unerwartet ausbleibende Verstärkung etwas zu emotionalen Kosten, die gesteuert und nicht übergangen werden müssen. Seine Grenzen gehören ebenso deutlich gesagt. Die Dopamin-Darstellung beruht auf Ableitungen bei Primaten und Nagern ohne Gegenstück beim Hund, die Bildgebung beim Hund ist indirekt und zwischen Individuen uneinheitlich, und mindestens eine beliebte Anwendung des Rahmens, nämlich früh auszudünnen, um das Lernen zu stärken, wurde am Hund geprüft und hielt der Prüfung nicht stand. Als Art, über Erwartung nachzudenken, und nicht als Satz neurochemischer Behauptungen verdient sich der Rahmen seinen Platz: Jeder Marker, jede Belohnung und jede vorenthaltene Belohnung ist Information darüber, was der Hund als Nächstes erwarten soll, und Training besteht zum großen Teil darin, diese Information brauchbar zu machen.

Wichtigste Erkenntnisse im Überblick

  • Lernen folgt dem Abstand zwischen Erwartung und Ergebnis und nicht der Paarung selbst. Rescorla und Wagner (1972) haben das formuliert, und Blockierungsversuche zeigten, dass Dopaminreaktionen dem Vorhersagefehler folgen und nicht der bloßen Verknüpfung von Reiz und Belohnung (Waelti et al., 2001). Eine vollständig vorhergesagte Belohnung lehrt demnach fast nichts.

  • Der Dopaminmechanismus wurde bei keinem Hund gemessen. Er beruht auf Einzelzellableitungen bei Affen und ursächlicher Arbeit bei Nagern, die Evidenz vom Hund ist fMRT-basiert, indirekt und zwischen Individuen uneinheitlich, mit nur 8 von 13 Hunden, die in der Wiederholung die Differenz im Caudatus zeigten (Berns et al., 2013).

  • Variable Verstärkung baut Löschungswiderstand auf und kein schnelleres Lernen. Beides wird regelmäßig verwechselt. Bei unerfahrenen Hunden verbesserte das Belohnen von 60 Prozent der Klicks die Lerngeschwindigkeit nicht und ließ die Hunde mit einer pessimistischeren Bewertung zurück (Cimarelli et al., 2021), und bei freier Wahl bevorzugten Hunde als Gruppe die wechselnde Belohnung nicht gegenüber der gleichbleibenden (Bremhorst et al., 2018). Also durchgehend verstärken beim Erwerb und Variabilität erst einführen, wenn das Verhalten flüssig ist.

  • Löschungsbursts sind nicht unvermeidlich. Sie traten in 24 Prozent der ausgewerteten Fälle auf und nur in 12 Prozent, wenn die Löschung mit der Verstärkung eines Alternativverhaltens verbunden war (Lerman & Iwata, 1995). Differenzielle Verstärkung ist der praktische Hebel.

  • Ein Signal, das gemischte Ergebnisse ankündigt, verliert seinen Wert. Mit Strom trainierte Hunde lernten, dass die Anwesenheit ihres Menschen Schmerz ankündigt, und trugen das aus dem Trainingszusammenhang hinaus (Schilder & van der Borg, 2004), dieselbe Entwertung, die der Begriff „vergiftetes Signal“ beschreibt, hier auf der Ebene der Person.

Quellen

Berns, G. S., Brooks, A., & Spivak, M. (2013). Replicability and heterogeneity of awake unrestrained canine fMRI responses. PLoS ONE, 8(12), e81698. https://doi.org/10.1371/journal.pone.0081698

Berns, G. S., Brooks, A. M., & Spivak, M. (2012). Functional MRI in awake unrestrained dogs. PLoS ONE, 7(5), e38027. https://doi.org/10.1371/journal.pone.0038027

Bremhorst, A., Bütler, S., Würbel, H., & Riemer, S. (2018). Incentive motivation in pet dogs – preference for constant vs varied food rewards. Scientific Reports, 8, 9756. https://doi.org/10.1038/s41598-018-28079-5

Cimarelli, G., Schoesswender, J., Vitiello, R., Huber, L., & Virányi, Z. (2021). Partial rewarding during clicker training does not improve naïve dogs' learning speed and induces a pessimistic-like affective state. Animal Cognition, 24(1), 107–119. https://doi.org/10.1007/s10071-020-01425-9

Cook, P. F., Prichard, A., Spivak, M., & Berns, G. S. (2016). Awake canine fMRI predicts dogs' preference for praise vs food. Social Cognitive and Affective Neuroscience, 11(12), 1853–1862. https://doi.org/10.1093/scan/nsw102

Greenstreet, F., Martinez Vergara, H., Johansson, Y., Pati, S., Schwarz, L., Lenzi, S. C., Geerts, J. P., Wisdom, M., Gubanova, A., Rollik, L. B., Kaur, J., Moskovitz, T., Cohen, J., Thompson, E., Margrie, T. W., Clopath, C., & Stephenson-Jones, M. (2025). Dopaminergic action prediction errors serve as a value-free teaching signal. Nature, 643(8074), 1333–1342. https://doi.org/10.1038/s41586-025-09008-9

Lerman, D. C., & Iwata, B. A. (1995). Prevalence of the extinction burst and its attenuation during treatment. Journal of Applied Behavior Analysis, 28(1), 93–94. https://doi.org/10.1901/jaba.1995.28-93

Parr-Cortes, Z., Müller, C. T., Talas, L., Mendl, M., Guest, C., & Rooney, N. J. (2024). The odour of an unfamiliar stressed or relaxed person affects dogs' responses to a cognitive bias test. Scientific Reports, 14(1), 15843. https://doi.org/10.1038/s41598-024-66147-1

Reicher, V., Kovács, T., Csibra, B., & Gácsi, M. (2024). Potential interactive effect of positive expectancy violation and sleep on memory consolidation in dogs. Scientific Reports, 14(1), 9487. https://doi.org/10.1038/s41598-024-60166-8

Rescorla, R. A., & Wagner, A. R. (1972). A theory of Pavlovian conditioning: Variations in the effectiveness of reinforcement and nonreinforcement. In A. H. Black & W. F. Prokasy (Hrsg.), Classical conditioning II: Current research and theory (S. 64–99). Appleton-Century-Crofts.

Schilder, M. B. H., & van der Borg, J. A. M. (2004). Training dogs with help of the shock collar: Short and long term behavioural effects. Applied Animal Behaviour Science, 85(3–4), 319–334. https://doi.org/10.1016/j.applanim.2003.10.004

Schultz, W., Dayan, P., & Montague, P. R. (1997). A neural substrate of prediction and reward. Science, 275(5306), 1593–1599. https://doi.org/10.1126/science.275.5306.1593

Sutton, R. S., & Barto, A. G. (2018). Reinforcement learning: An introduction (2. Aufl.). MIT Press.

Waelti, P., Dickinson, A., & Schultz, W. (2001). Dopamine responses comply with basic assumptions of formal learning theory. Nature, 412(6842), 43–48. https://doi.org/10.1038/35083500

Zum Hören

Diesen Beitrag gibt es auch als Podcastfolge

ca. 10 Min. · Alle Folgen

Zum Weiterlesen

Lehrbuch Hundetraining

284 Seiten über Lernverhalten, Ausdrucksverhalten, Rassegeschichte und Berufspraxis – für alle, die es genauer wissen wollen als ein Blogbeitrag es leisten kann.

Zum Buch Alle Lernangebote