Hunderatgeber · Wissenschaft und Hundewissen
Hundeverhalten messbar machen: Verhalten definieren und erfassen
Zählt ein Knurren schon als aggressiv oder erst der Schnapper? Ohne saubere Definition misst niemand dasselbe, und daran scheitern viele Aussagen über Hunde.
Michael Sauerwein · 27. April 2026
Was heißt es, einen Hund aggressiv zu nennen? Zählt ein einzelnes Knurren? Eine steife Haltung ohne Laut? Ist ein Hund ängstlich, wenn er die Rute einzieht, oder erst, wenn er flieht? Diese Fragen haben keine Antwort, solange niemand festlegt, was zählen soll, und festzulegen, was zählt, ist der ganze Inhalt der Operationalisierung.
Dieser Beitrag behandelt, wie aus abstrakten Begriffen messbare Verfahren werden, welche Maße zu welchen Fragen passen, ausgearbeitete Beispiele aus der Forschung am Hund zu Furcht, Aggression, Spiel, Bindung und Gefühlszustand, den Unterschied zwischen übereinstimmenden Beobachtern und einer zutreffenden Definition und wie dasselbe Denken die Trainingspraxis schärft. Eine Einordnung zieht sich durch, und sie ist der Kern dieses Beitrags und kein Vorbehalt. Eine operationale Definition misst einen Stellvertreter und nicht den Begriff. Eine Definition von Furcht zählt Rutenhaltung und Körperhaltung, sie zählt keine Furcht. Ob der Stellvertreter dem Begriff folgt, ist eine eigene empirische Frage, und in der Forschung am Hund gibt es belegte Fälle, in denen sich herausstellte, dass etablierte Verfahren etwas anderes messen als alle annahmen (das ist die praktische Folge davon, dass Verhalten nicht gleich Emotion ist).
1. Was Operationalisierung ist
1.1 Begriff und Definition
Ein Begriff ist eine abstrakte Vorstellung, die sich nicht unmittelbar beobachten lässt, etwa Furcht, Bindung, Impulsivität, Reaktivität. Eine operationale Definition legt genau fest, welche beobachtbaren Ereignisse als Hinweis darauf gelten sollen.
Nicht operational: „Der Hund sieht ängstlich aus.“ Operational: „Innerhalb von 10 Sekunden nach Darbietung des Reizes zeigt der Hund mindestens zwei von: Rute unterhalb der Waagerechten, Ohren an den Kopf angelegt, abgesenkte Körperhaltung, Lecken über die Lefzen, Gähnen außerhalb von Müdigkeit und Fressen, Kopf abgewandt unter Abbruch des Blickkontakts.“
Die zweite Fassung lässt sich zählen, bestreiten und prüfen. Die erste nicht.
1.2 Die vier Anforderungen
Eine brauchbare Definition ist beobachtbar (eine außenstehende Person kann sie festhalten), messbar (zählbar, in der Zeit erfassbar oder einordbar), zuverlässig (unabhängige Beobachtende kommen damit zu ähnlichen Werten) und gültig (sie bildet den Begriff ab, den sie abzubilden beansprucht).
Die ersten drei liegen weitgehend in der Hand der Forschenden. Die vierte nicht, und dort liegt der größte Teil der Schwierigkeit.
1.3 Die Grenze, die im Verfahren steckt
Hohe Zuverlässigkeit bedeutet keine Gültigkeit. Zwei Beobachtende können sich vollständig über ein Verhalten einig sein, das mit dem Begriff nichts zu tun hat. Sie können in einer Definition von Furcht zuverlässig Ohrenzucken zählen, während sich das Ohrenzucken nach Temperatur oder Aufmerksamkeit richtet.
Gültigkeit muss eigens belegt werden, meist über zusammenlaufende Gültigkeit: Bewegt sich das Verhaltensmaß gemeinsam mit begrifflich unabhängigen Maßen wie Cortisol, Herzfrequenz oder Bewertungsverzerrung unter Bedingungen, in denen der Begriff vorliegen sollte? Einzelne Verhaltensweisen sind für sich fast nie beweisend (wie die Neurobiologie der Stressmessung zeigt).
1.4 Warum dieser Beitrag unter den anderen liegt
Jede Aussage in diesem Bereich beruht darauf, dass jemand ein Verhalten definiert und gezählt hat. Wo die Definition locker war, erbt der darauf aufbauende Befund diese Lockerheit, wie ausgefeilt die Statistik auch sein mag.
Das macht dieses Thema zum unscheinbarsten mit der größten Reichweite (weil Beobachtetes und Erschlossenes ständig vermischt werden). Wer aus diesem Bereich nur einen Beitrag mitnimmt, könnte es schlechter treffen als mit diesem.
1.5 Nicht alles Wichtige lässt sich gleich gut messen
Manche Begriffe lassen sich leicht in beobachtbare Kriterien übersetzen, etwa die Verzögerung bis zur Annäherung, die Häufigkeit des Bellens, der tolerierte Abstand. Andere sperren sich. Beziehung, Vertrauen und empfundene Sicherheit sind real und folgenreich, und kein einzelnes festgelegtes Verhalten erfasst eines davon.
Die Antwort darauf ist nicht, sie für unmessbar zu erklären oder so zu tun, als genüge ein Stellvertreter. Sie ist, sich ihnen aus mehreren Richtungen zugleich zu nähern, etwa über das Verhalten beim Wiedersehen, die Zeit bis zum Zurruhekommen, die Bereitschaft, nach einer Pause wieder mitzumachen, und Cortisol über eine Trennung hinweg, und das Zusammenlaufen als den Beleg zu nehmen (so geht die Bindungsforschung vor). Wo ein Begriff vier Annäherungen braucht und eine Untersuchung eine verwendet hat, lohnt sich der Hinweis darauf.
1.6 Operationalisierung ist keine Aussage über die Wirklichkeit
Furcht als eine Menge beobachtbarer Verhaltensweisen zu definieren, behauptet nicht, Furcht sei nichts weiter als diese Verhaltensweisen. Es behauptet, dass in dieser Untersuchung diese Verhaltensweisen gezählt werden.
Beides zu verwechseln, erzeugt den vertrauten Einwand, die Wissenschaft reduziere Hunde auf Mechanismen, und das liest ein Arbeitsverfahren als weltanschauliche Position. Niemand, der Furcht operational definiert, glaubt, das sei alles, was Furcht ist. Er glaubt, das sei, was sich heute Nachmittag zählen lässt.
2. Warum das in der Forschung am Hund zählt
2.1 Was lockere Definitionen kosten
Wiederholbarkeit. Eine Untersuchung zu „Furcht bei Tierheimhunden“ mit unscharfem Kriterium lässt sich von niemand anderem wiederholen. Ausdrückliche Aufnahmekriterien und Messregeln sind es, die eine Wiederholung überhaupt möglich machen.
Weniger Verzerrung durch Beobachtende. Ohne Definition sehen Beobachtende, was sie erwarten. Vereinbarte Ereignisse zu zählen, begrenzt das, und zwar unvollständig. Auch ein gut festgelegtes Verhalten verlangt an den Rändern eine Einschätzung, etwa wann genau ein Rutenanziehen beginnt, deshalb verringern Schulung und regelmäßige Prüfungen der Übereinstimmung die Subjektivität, statt sie zu beseitigen. Es wird also objektiver gemessen und nicht objektiv.
Vergleich zwischen Untersuchungen. Gemeinsame operationale Rahmen sind die Voraussetzung für Zusammenfassungen mehrerer Studien. Wo sie fehlen, lassen sich scheinbar ähnliche Untersuchungen nicht zusammenführen.
Nutzen in Praxis und Training. „Der Hund bleibt 30 Sekunden auf einer Decke liegen, während eine Person in zwei Metern Abstand vorbeigeht“ lässt sich beurteilen. „Der Hund ist ruhig“ nicht (und der Unterschied zählt dort am meisten, wo die Erregung die begrenzende Größe ist).
2.2 Die Kosten fallen beim Vergleich an
Eine einzelne Untersuchung mit eigenwilliger Definition kann in sich stimmig sein. Verloren geht die Möglichkeit, sie mit irgendetwas zu vergleichen, und genau dort wächst Wissen.
Wo drei Untersuchungen die Häufigkeit desselben Verhaltens mit drei Definitionen berichten, sind die drei Zahlen kein Beleg für eine Spanne, sie sind ein Beleg über drei Definitionen, und sie zu mitteln, erzeugt eine Zahl über nichts (wie die weitere Literatur zur Aggression darlegt).
2.3 Und in der Praxis
Einem Haushalt, dem gesagt wird, ein Verhalten komme bei einem bestimmten Prozentsatz der Hunde vor, wird eine Zahl gegeben, deren Bedeutung an einer Definition hängt, die er nie zu sehen bekommt. War diese Definition weit, ist die Zahl überhöht, war sie eng, ist sie zu niedrig.
Die praktische Anweisung ist bescheiden: Jede Häufigkeitsangabe als Aussage über eine Definition behandeln, bis die Definition bekannt ist.
3. Regeln für Stichprobe und Aufzeichnung
3.1 Die Entscheidung, die niemand erwähnt
Ein Verhalten zu definieren, ist die halbe Aufgabe. Die andere Hälfte ist die Entscheidung, wann hingesehen und was aufgeschrieben wird, und diese Entscheidungen verändern die Zahlen ebenso stark wie die Definition (Martin & Bateson, 2007).
3.2 Wer beobachtet wird
Die Fokusbeobachtung verfolgt ein Tier über eine festgelegte Zeit und hält alles fest, was es tut. Die Momentaufnahme hält in festen Abständen fest, was jedes Tier einer Gruppe gerade tut. Das freie Notieren hält fest, was auffällt, und das ist das Verfahren, das die meisten Haushalte verwenden, und das am wenigsten dafür taugt, Zahlen zu erzeugen.
Die Fokusbeobachtung liefert gute Daten über Einzeltiere und übersieht, was sonst passiert. Die Momentaufnahme liefert Muster einer Gruppe und übersieht seltene Ereignisse, und dazu gehört das meiste, worum es in einer Verhaltensberatung geht. Keines ist im Grundsatz richtig, die Frage entscheidet.
3.3 Wann aufgezeichnet wird
Die durchgehende Aufzeichnung erfasst jedes Auftreten und seine Dauer, und das ist es, was die meisten Fragen tatsächlich verlangen und was am teuersten zu erheben ist. Die Zeitstichprobe prüft stattdessen in Abständen, und was sie erzeugt, hängt vom gewählten Abstand ab.
Die Ja-Nein-Stichprobe, bei der nur festgehalten wird, ob ein Verhalten in einem Abschnitt überhaupt auftrat, überschätzt Dauern systematisch und wird weiterhin viel verwendet, weil sie einfach ist. Ihre Verzerrung ist bekannt und vorhersehbar, und das macht sie dort vertretbar, wo sie angegeben wird, und irreführend, wo nicht (weil die Übertragung über Situationen hinweg nicht selbstverständlich ist).
3.4 Warum die Wahl im Ergebnis auftaucht
Ein seltenes, kurzes Verhalten wird von der Zeitstichprobe verfehlt und von der durchgehenden Aufzeichnung erfasst. Ein häufiges, anhaltendes wird von beiden angemessen geschätzt. Untersuchungen an denselben Hunden mit verschiedenen Regeln werden deshalb voneinander abweichen, und die Abweichung liegt am Verfahren und nicht an der Sache.
Wo zwei Arbeiten verschiedene Raten desselben Verhaltens berichten, ist die Stichprobenregel das Erste, was zu vergleichen ist.
3.5 Was die Praxis daraus mitnehmen sollte
Wer irgendetwas an einem Hund zählt, wählt eine Stichprobenregel, meist ohne es zu bemerken. Vorher zu entscheiden, jedes Auftreten in einem festen Zehnminutenfenster festzuhalten, erzeugt andere Information, als über einen Nachmittag zu notieren, was aufgefallen ist.
Das Erste lässt sich über Wochen vergleichen. Das Zweite nicht, und deshalb sind Berichte von Haushalten über Besserung so schwer zu deuten und deshalb verändert es eine Beratung, nach einer Zahl statt nach einem Eindruck zu fragen.
4. Arten von Verhaltensmaßen
4.1 Ereignisse und Zustände
Ereignisverhalten ist einzeln und kurz, mit klarem Anfang und Ende, etwa ein Bellen, ein Schnappen, eine Spielverbeugung. Es wird gezählt. Zustandsverhalten erstreckt sich über Zeit, etwa Umherlaufen, Schnüffeln, Liegen, Erstarren. Es wird in der Zeit erfasst.
Die Unterscheidung entscheidet, welche Statistik überhaupt sinnvoll ist. Die Häufigkeit von „Liegen“ zu zählen, sagt fast nichts, die Dauer zu erfassen sehr viel.
4.2 Häufigkeit und Rate
Die Häufigkeit ist die reine Anzahl. Die Rate ist die Häufigkeit geteilt durch die Beobachtungszeit. Die Rate ist immer dann nötig, wenn die Beobachtungszeiten unterschiedlich lang sind, und in der Feldforschung sind sie das fast immer.
4.3 Dauer
Die Gesamtzeit in einem Verhalten oder die mittlere Zeit je Auftreten. Beides beantwortet verschiedene Fragen: Zehn kurze Erstarrungen und eine lange können dieselbe Gesamtzeit ergeben und sehr Verschiedenes bedeuten.
4.4 Verzögerung
Die Zeit vom Beginn des Reizes bis zum Beginn des Verhaltens. Die Verzögerung ist das Maß der Wahl für Zögern, Belastungsgrenze und Entscheidungsgeschwindigkeit, und sie liegt dem gesamten Verfahren zur Bewertungsverzerrung zugrunde (ebenso wie Maßen für Lernen und Erwartung).
4.5 Stärke
Das Ausmaß, meist auf einer kurzen Rangskala mit ausdrücklichen Ankern, für Furcht etwa: 0 = keine sichtbaren Zeichen, 1 = ein oder zwei schwache Zeichen, 2 = mehrere Zeichen einschließlich eingezogener Rute, angelegter Ohren, Ducken, 3 = Erstarren, Zittern, Absetzen von Kot oder Urin oder Fluchtversuch.
Die Stärke verdient ihren Platz dort, wo Häufigkeit und Dauer den Schweregrad verfehlen. Eine einzelne Erstarrung von zehn Sekunden kann weit mehr bedeuten als drei kurze Ohrenzucken.
4.6 Kategorial und stetig
Kategoriale Maße ordnen Verhalten benannten, einander ausschließenden Klassen zu. Stetige Maße setzen es auf eine Zahlenskala. Beides unachtsam zu mischen, ist eine häufige Fehlerquelle in der Auswertung.
4.7 Die Auswahl
Das Maß soll der Frage folgen. Wie oft ist eine Frage nach der Häufigkeit, wie lange eine nach der Dauer, wie schnell eine nach der Verzögerung, und wie stark eine nach der Stärke, die eine Skala verlangt, die jemand festlegen muss.
Die meiste Verwirrung entsteht dadurch, dass eines berichtet und ein anderes beantwortet wird. Eine Untersuchung, die Verzögerungen misst und über Motivation schließt, ist ein verbreitetes Beispiel.
4.8 Die Stärke ist die schwierige Größe
Häufigkeit und Dauer werden gezählt, die Stärke wird eingeschätzt, und das Einschätzen verlangt eine Skala mit festgelegten Ankern. Wo die Anker unscharf sind, wird das Maß zu einem Eindruck mit Zahlen daran.
Deshalb lohnen Stärkeskalen in der Forschung am Hund meist die Lektüre des Methodenteils (wo Erregung als eigene Variable behandelt wird).
5. Ausgearbeitete Beispiele aus der Forschung am Hund
5.1 Furcht vor neuen Gegenständen
Definition. Als ängstlich gewertet, wenn innerhalb von 30 Sekunden nach Einführung des Gegenstands mindestens drei der folgenden auftreten: Rute unterhalb der Waagerechten, angelegte Ohren, geduckte Haltung, Bewegung von mehr als einem Meter weg, Erstarren von drei Sekunden oder mehr, Winseln oder Knurren.
Maße. Summenwert oder Verzögerung bis zur Annäherung.
Anmerkung zur Gültigkeit. Beerda et al. (1998) liefern einen großen Teil der empirischen Grundlage für dieses Bündel: Zehn Hunde wurden sechs aversiven Reizen ausgesetzt, nämlich Lärmstößen, kurzen Stromreizen, einem fallenden Sack, einem sich öffnenden Schirm und zwei Formen des Festhaltens, bei gleichzeitiger Messung von Cortisol im Speichel und der Herzfrequenz. Dieses Design ist es, das die Verhaltensweisen an die Physiologie bindet, statt sie vorauszusetzen. Ebenso gehört gesehen, was es einschränkt: Das sind Reaktionen auf akute, starke, weitgehend unkontrollierbare unangenehme Ereignisse, und das ist nicht dieselbe Menge an Situationen wie alltägliche Ängstlichkeit.
5.2 Aggression: Form plus Zusammenhang
Definition (Verhalten). Ein Biss mit Hautkontakt, oder ein Schnappen, festgelegt als schnelles Schließen des Fangs innerhalb von 5 cm einer Gliedmaße, oder ein Knurren gleichzeitig mit steifer Haltung und sichtbaren Zähnen von mindestens einer Sekunde Dauer.
Nur „Knurren“ oder „Biss“ zu erfassen, wirft Kategorien zusammen, die sich verschieden verhalten. Die Verhaltensforschung unterscheidet sie nach beobachtbarem Zusammenhang und Folge und nicht nach erschlossener Motivation: Aggression in Zusammenhängen, die mit dem Abwenden einer Bedrohung vereinbar sind (in die Enge getrieben, kein Fluchtweg, Annäherung nach gezeigtem Ausweichen, typisch tiefe Haltung, angelegte Ohren, Zurückweichen unter Knurren), im Wettbewerb um Ressourcen (im Besitz von Futter, Liegeplatz oder Spielzeug, Annäherung auf unter einen Meter, typisch hohe Haltung, Ohren nach vorn, stehend nahe der Ressource) und bei Frustration an einer Grenze (hinter einem Zaun oder an der Leine, ohne den Reiz erreichen zu können, hohe Erregung, Bellen, Vorschnellen).
Diese drei sind Beschreibungen von Zusammenhängen und hier ausgearbeitete Beispiele und keine vollständige Einteilung der Aggression beim Hund. Ein Erfassungsschema für eine bestimmte Untersuchung würde die Zusammenhänge festlegen, die diese Untersuchung braucht, samt einer Regel für alles, was außerhalb davon liegt.
Maße. Zusammenhang und Verhalten getrennt erfasst, dazu eine Rangskala des Schweregrads von Knurren über Zähnezeigen, Schnappen und Bissversuch bis zum Biss mit Hautkontakt.
Herron, Shofer und Reisner (2009) zeigen, warum das Erfassen des Zusammenhangs zählt: Ihre Befragung zu konfrontativen Techniken fand, dass einzelne Maßnahmen aggressive Reaktionen in deutlich verschiedenen Anteilen auslösten, und das ist unsichtbar, wenn Aggression als eine einzige ununterschiedene Kategorie erfasst wird (und der Rahmen, den das ablöst, hat keine wissenschaftliche Stütze).
5.3 Soziales Spiel
Definition. Die folgenden Merkmale folgen der ethologischen Beschreibung des sozialen Spiels von Bekoff und Byers (1981). Spiel wird gewertet, wenn mindestens zwei Merkmale auftreten: Spielverbeugung (Vorderbeine gestreckt, Ellbogen abgesenkt, Hinterhand erhoben), übertrieben federnde Fortbewegung, Selbstbehinderung (auf den Rücken rollen, den Partner oben sein lassen), schneller Rollentausch innerhalb von etwa drei Sekunden, entspannt geöffneter Fang ohne Gesichtsspannung.
Maße. Dauer der Spielsequenzen und Häufigkeit der Spielverbeugungen pro Minute, wobei der Rollentausch als eigenes Ereignis erfasst wird (wobei Flexibilität der schwerer fassbare Begriff ist).
Die Forderung nach mehreren gleichzeitigen Merkmalen ist es, die Spiel von dem trennt, was ihm oberflächlich ähnelt, etwa einer bloßen Jagd oder einem sich aufschaukelnden Konflikt (die Entwicklung und Neurobiologie des Spiels beim Hund).
5.4 Bindung
Definition (Fremde-Situations-Test). Nach einer zweiminütigen Trennung wird das Wiedersehensverhalten erfasst: Begrüßung innerhalb von 10 Sekunden, Beruhigung innerhalb von 30 Sekunden, festgelegt als Ende von Anspringen, Maulen und anhaltendem Lautgeben, Wiederaufnahme des Erkundens innerhalb von 60 Sekunden.
Maße. Verzögerung bis zur Begrüßung, Dauer bis zur Beruhigung, Verzögerung bis zur Wiederaufnahme des Erkundens.
Topál et al. (1998) übertrugen das Verfahren aus der Entwicklungspsychologie auf Hunde, und Schöberl et al. (2016) ergänzten Cortisolproben, und das ist es, was aus einer Verhaltenseinordnung etwas mit körperlicher Stütze macht (Bindungsstile beim Hund im Detail).
5.5 Bewertungsverzerrung
Definition. Der Hund lernt, dass ein Ort eine Belohnung enthält und ein anderer nicht, dann wird ein dazwischenliegender, mehrdeutiger Ort angeboten. Die Verzögerung bis zur Annäherung an den mehrdeutigen Ort ist das Maß, eine kürzere Verzögerung wird als zuversichtlicherer Gefühlszustand gedeutet, auf Grundlage des Rahmens aus Erregung und Wertigkeit, der dem Verfahren zugrunde liegt (Mendl, Burman & Paul, 2010) (eines von mehreren Verfahren zur Prüfung kognitiver Leistungen beim Hund).
Maße. Mittlere Verzögerung bis zum Kontakt über die Durchgänge.
Das ist das Verfahren hinter einem großen Teil dessen, was über die Wirkung von Trainingsmethoden auf die Stimmung bekannt ist, und Kapitel 6.2 erklärt, warum es auch das beste warnende Beispiel dieses Beitrags ist.
5.6 Was die ausgearbeiteten Beispiele gemeinsam haben
In jedem Fall, bei Furcht, Aggression, Spiel, Bindung und Bewertungsverzerrung, wurde ein vertrautes Wort durch eine festgelegte Menge an Beobachtungen ersetzt, und in jedem Fall ging dabei etwas verloren.
Dieser Verlust ist der Preis des Messens und kein Fehler darin. Die Alternative ist ein Begriff, den alle verwenden und niemand zählen kann, und dort beginnt der meiste Streit in diesem Feld.
5.7 Die Definitionen sind nicht austauschbar
Zwei Untersuchungen zur Aggression beim Hund mit verschiedenen Verhaltensformen und verschiedenen Kriterien für den Zusammenhang untersuchen unter einem Namen verschiedene Dinge. Keine ist falsch, und ihre Ergebnisse gehören nicht zusammengeführt.
Zusammenfassungen mehrerer Studien in diesem Bereich verwenden einen Großteil ihrer Mühe auf genau dieses Problem, und deshalb berichten sie häufig große Uneinheitlichkeit. Uneinheitlichkeit in einer solchen Zusammenfassung ist häufig eine Aussage über Definitionen und nicht über Hunde.
6. Zuverlässigkeit, Gültigkeit und der Abstand dazwischen
6.1 Übereinstimmung messen
Die prozentuale Übereinstimmung ist einfach und überschätzt die Einigkeit, weil sie den Zufall außer Acht lässt, für eine Veröffentlichung reicht sie meist nicht. Cohens Kappa rechnet die zufällige Übereinstimmung heraus und ist bei kategorialem Erfassen üblich. Die Intraklassenkorrelation dient stetigen Maßen wie Verzögerung und Dauer.
Ein Punkt gehört deutlich gesagt, denn die Zahlen werden oft zitiert, als wären sie Tatsachen: Die sprachlichen Etiketten für Kappa-Bereiche, also „ausgezeichnet“ über 0,75, „gut“ von 0,60 bis 0,75 und so weiter, sind Übereinkünfte aus der Methodenliteratur, und verschiedene Quellen schlagen verschiedene Grenzen mit verschiedenen Etiketten vor. Sie sind eine nützliche Kurzform und keine statistischen Schwellen. Was angemessen ist, hängt vom Bereich ab: Bei sicherheitsrelevantem Verhalten wie dem Bissrisiko ist mehr nötig als beim Erfassen von Fortbewegung. Bei komplexen sozialen Interaktionen wie Spiel oder Konflikt ist ein Kappa über 0,80 wirklich schwer zu erreichen.
6.2 Warum Übereinstimmung keine Richtigkeit ist
Beobachtende können zuverlässig falsch einordnen. Ist die Definition falsch, gibt Beständigkeit den Fehler einfach wieder. Das ist in der Forschung am Hund nicht hypothetisch, und zwei Fälle gehören gekannt.
Hemmungskontrolle. Verschiedene Verhaltensmaße, die denselben Begriff erfassen sollen, hängen beim Hund untereinander nicht zusammen (Brucks et al., 2017), und die Leistung ist situationsgebunden statt allgemein. Jede Aufgabe ist zuverlässig, ob sie einen gemeinsamen Begriff messen, ist genau das, was die Daten infrage stellen (die Literatur zur frontalen Kontrolle stößt auf dasselbe Problem).
Bewertungsverzerrung. Krahn et al. (2024) zeigten, dass vorheriges Unterscheidungstraining die spätere Leistung von Hunden in einem solchen Test verändert, das Maß bildet also neben dem Gefühlszustand auch die Lerngeschichte ab. Das entwertet das Verfahren nicht, es bedeutet aber, dass ein Unterschied in der Verzögerung zwischen Gruppen nicht selbstverständlich ein Unterschied in der Stimmung ist.
Olsen (2018) prüfte die Forschung zu exekutiven Funktionen beim Hund und hielt fest, dass das Feld eine gründliche methodische Überarbeitung braucht, bevor starke Aussagen gerechtfertigt sind. Das ist die ehrliche Position für die Verhaltensmessung beim Hund insgesamt.
6.3 Das Problem der positiven Wertigkeit
Es gibt eine systematische Ungleichheit darin, was das Feld derzeit messen kann. Flint et al. (2024) prüften mögliche Anzeichen an 60 Hunden in sechs Szenarien: Cortisol, ACTH, Herzratenvariabilität, Hecheln, Winseln und Schütteln unterschieden alle Erregungsniveaus, aber nur innerhalb der Szenarien mit negativer Wertigkeit. Die Herzfrequenz leistete das in beiden. Csoltova und Mehinagic (2020) kamen in ihrer Übersicht zur Erfassung positiver Emotionen beim Hund zu dem Schluss, dass kein einziges Anzeichen für einen positiven Gefühlszustand geprüft worden ist.
Die Folge für die Operationalisierung ist bestimmt: Eine Definition von Belastung lässt sich an zusammenlaufende Maße binden. Eine Definition von Zufriedenheit derzeit nicht, und das Fehlen von Belastungsanzeichen ist kein Maß für einen guten Zustand.
6.4 Verbreitete Fallstricke
Subjektive Begriffe. „Aufgeregt“, „glücklich“, „ruhig“ sind unbrauchbar, bis sie über beobachtbare Ereignisse festgelegt sind. „Der Hund liegt auf der Seite mit geschlossenen Augen, atmet weniger als 30 Mal pro Minute und schreckt bei einem Händeklatschen aus einem Meter Entfernung nicht auf“ ist brauchbar.
Der Fehlschluss vom einzelnen Zeichen. Gähnen zeigt Stress, Müdigkeit, Wärmeregulation oder soziale Mitteilung an. Lecken über die Lefzen zeigt Übelkeit, Stress oder die Erwartung von Futter an. Kein einzelnes Verhalten bestimmt einen Zustand (was das allgemeine Problem des Lesens von Emotion aus Handlung ist).
Abdriften der Beobachtenden. Die Anwendung einer Definition verschiebt sich über Wochen des Erfassens unbemerkt. Regelmäßige Nachschulung und wiederholte Prüfungen der Übereinstimmung sind das Mittel.
Die fehlende medizinische Abklärung. Eine Verhaltensdefinition, die den körperlichen Zustand nicht festhält, schreibt dem Begriff zu, was Schmerz, Krankheit oder nachlassende Sinne beitragen, und der Zusammenhang zwischen Schmerz und Problemverhalten ist gut dokumentiert (Mills et al., 2020) (Schmerz als wiederkehrende Differenzialdiagnose).
Zusammenfallen des Zusammenhangs. Ein Rutenwedeln im Spiel und ein Rutenwedeln in einer Pattsituation sind nicht dasselbe Ereignis. Definitionen sollten festlegen, in welchem Zusammenhang sie gelten.
Zu komplexe Definitionen. Eine Definition, die gleichzeitige Aufmerksamkeit auf zehn Verhaltensweisen verlangt, erzeugt schlechte Übereinstimmung. Einfachheit und Checklisten schlagen Vollständigkeit.
Stärke oder Dauer übergehen. Die Häufigkeit allein führt in die Irre. Maße verbinden.
Zuverlässigkeit für Gültigkeit halten. Oben behandelt und der folgenreichste dieser Punkte.
6.5 Warum die Zuverlässigkeit die leichtere Hälfte ist
Die Übereinstimmung zwischen Beobachtenden lässt sich durch Schulung, engere Definitionen und Übung verbessern. Die Gültigkeit, also ob das Maß den Begriff erfasst, lässt sich durch nichts davon verbessern, denn sie ist eine Frage nach dem Verhältnis zwischen dem Maß und etwas Unbeobachtbarem.
Diese Ungleichheit erklärt, warum die Forschung am Hund Zuverlässigkeit weit häufiger berichtet als Gültigkeit: Das eine ist erreichbar und das andere bestreitbar (weil Beobachtetes und Erschlossenes ständig vermischt werden). Eine Arbeit, die ausgezeichnete Übereinstimmung berichtet, hat belegt, dass ihre Beobachtenden beständig waren, und das ist notwendig und nicht hinreichend.
7. Wo Operationalisierung in der Praxis scheitert
7.1 Definitionen, die den Schluss einschmuggeln
Eine Definition, die die Deutung enthält, ist keine Definition mehr. Ein Verhalten als „ängstliches Umherlaufen“ zu erfassen, verlangt von der beobachtenden Person, bereits entschieden zu haben, dass der Hund ängstlich ist, und jede folgende Zählung erbt diese Entscheidung (weil Beobachtetes und Erschlossenes ständig vermischt werden).
Die Prüfung ist, ob eine Person, die über den Zustand des Hundes anderer Meinung ist, die Definition trotzdem anwenden könnte. Wenn nicht, ist die Definition ein Schluss im Gewand einer Messung, und die Untersuchung bestätigt, was ihre Erfassenden ohnehin glaubten.
7.2 Kategorien, die einander nicht ausschließen
Wo ein Verhalten unter zwei Kategorien fallen kann, verteilen verschiedene Beobachtende es verschieden, und die Zahlen sind nicht vergleichbar. Ein Vorschnellen, das zugleich ein Bellen und zugleich eine Vorwärtsbewegung ist, braucht eine Regel, welche Kategorie Vorrang hat.
Die meisten Erfassungsschemata legen das fest und die meisten formlosen Einschätzungen nicht, und das ist ein Grund, warum zwei Trainer beim selben Video zu verschiedenen Berichten kommen.
7.3 Schwellen, die den Beobachtenden überlassen bleiben
Begriffe wie „hoch“, „lang anhaltend“ oder „stark“ verlangen eine Schwelle, und wo das Schema keine liefert, liefert jede beobachtende Person ihre eigene. Die Übereinstimmung misst dann, wie ähnlich sich die Beobachtenden sind, und nichts über den Hund (wo Erregung als eigene Variable behandelt wird).
Die Schwelle in der Definition festzulegen, ist das Mittel, und deshalb lesen sich gute Schemata langweilig. Langeweile in einem Methodenteil ist meist ein Zeichen dafür, dass jemand sorgfältig nachgedacht hat.
7.4 Der Zusammenhang, der nicht festgehalten wurde
Ein Verhalten, das ohne seinen Zusammenhang gezählt wird, ist eine Zahl, die sich nicht deuten lässt. Drei Vorschnellen bedeuten bei zwei Metern Abstand zu einem stehenden Hund etwas anderes als bei zwanzig Metern zu einem laufenden.
Den Zusammenhang neben der Zählung festzuhalten, verdoppelt die Arbeit und macht die Zählung brauchbar.
7.5 Messen, was leicht ist
Der stärkste Sog in diesem ganzen Bereich geht dahin, zu messen, was sich messen lässt, statt was zählt. Verzögerung ist leicht, Häufigkeit ist leicht, und keines von beiden behandelt, ob es dem Hund besser geht.
Dieser Sog ist nicht vermeidbar und gehört benannt, denn eine Literatur voller bequemer Maße sieht aus wie eine Literatur voller Befunde (wo das Verfahren zur Bewertungsverzerrung ausführlich beschrieben wird). Bequemlichkeit und Bedeutung hängen nicht zusammen.
8. Über Verhalten hinaus: Messen über mehrere Kanäle
8.1 Kanäle hinzunehmen
Die heutige Forschung verlässt sich selten auf Verhalten allein, denn Zusammenlaufen über begrifflich unabhängige Kanäle ist das, woraus Belege für Gültigkeit tatsächlich bestehen, und weil Abweichungen für sich aufschlussreich sind, etwa wenn ein im Verhalten ruhiger Hund erhöhtes Cortisol zeigt.
Herzfrequenz und Herzratenvariabilität: praktisch, am Körper tragbar und nach Flint et al. (2024) das von der Wertigkeit unabhängigere Maß für Erregung. Cortisol: in Speichel, Blut, Kot oder Haar, bildet die Aktivität der Stressachse über verschiedene Zeiträume ab, es steigt bei Erregung beider Wertigkeiten und ist deshalb für sich kein Maß für Belastung. Wärmebildaufnahmen: Temperaturänderungen an Auge und Ohr, die der vegetativen Erregung folgen. Pupillenmessung: Erregung, wiederum ohne Angabe zur Wertigkeit. Beschleunigungsmessung: Aktivität, Unruhe, Auffahren. Kognitive Aufgaben: Bewertungsverzerrung und Verfahren zu Schlussfolgern und Wissenssuche (kausales Denken und Metakognition). Automatische Haltungserkennung: Werkzeuge wie DeepLabCut und SLEAP erhöhen die Beständigkeit und nehmen einen Teil des Abdriftens heraus, und sie sind nicht neutral. Sie erben die Beschriftungsentscheidungen, die Rassenverteilung und die Merkmalsauswahl ihrer Trainingsdaten. Sie vereinheitlichen die Deutung, statt sie zu beseitigen.
Jeder Kanal hat eine bestimmte Schwäche, und genau deshalb trägt das Zusammenlaufen das Argument und nicht ein einzelnes Maß (und das Messen am Körper hat eigene umfangreiche Vorbehalte).
8.2 Das Zusammenlaufen ist das Argument
Maße aus Verhalten, Körper und Wahl versagen jeweils anders, und Übereinstimmung zwischen ihnen ist mehr wert als Genauigkeit in einem einzelnen. Wo sie sich widersprechen, ist der Widerspruch aufschlussreich und kein Ärgernis (wo das Verfahren zur Bewertungsverzerrung ausführlich beschrieben wird).
Das ist derselbe Maßstab, der in diesem ganzen Bereich angewandt wird, und er kommt von hier.
8.3 Mehr Maße sind nicht automatisch besser
Kanäle hinzuzunehmen, erhöht auch die Freiheit in der Auswertung, und eine Untersuchung, die sechs Maße berichtet, von denen eines bedeutsam wurde, hat nicht sechs Dinge gefunden. Vorher festzulegen, welches Maß das führende ist, verhindert das.
Mehrere Kanäle sind eine Stärke, wenn die Maße vorher gewählt wurden, und eine Schwäche, wenn sie sich angesammelt haben (individuelle Unterschiede wiegen mehr, als Gruppenmittelwerte vermuten lassen). Die vorherige Anmeldung einer Studie unterscheidet beides, und sie ist in der Forschung am Hund weiterhin selten.
9. Operationales Denken in der Trainingspraxis
9.1 Operationales Denken ohne Labor
Die Praxis braucht keine Kappa-Werte. Sie profitiert erheblich von der zugrunde liegenden Disziplin, und der Zweck gehört vor das Verfahren, denn er wird leicht missverstanden. Es geht nicht darum, einen Hund zu vermessen. Es geht darum, erkennen zu können, ob ein Plan wirkt, und das ist der Unterschied zwischen einer Kursänderung in Woche drei und dem Feststellen im sechsten Monat.
Das Problemverhalten festlegen. Nicht „mein Hund ist reaktiv“, sondern „wenn ein Hund auf derselben Straßenseite näher als 15 Meter vorbeigeht, wird mein Hund steif, fixiert und bellt dreimal oder öfter, solange der Hund vorbeigeht“ (so sieht Reaktivität gemessen statt benannt aus).
Das Zielverhalten festlegen. Nicht „ich will, dass er ruhig ist“, sondern „bei einem Hund, der in 10 Metern Abstand vorbeigeht, bleibt mein Hund auf der Decke und kaut ohne Unterbrechung weiter, solange der Hund vorbeigeht“.
Etwas mitschreiben. Häufigkeit pro Spaziergang, Verzögerung vom Erkennen des Auslösers bis zur Reaktion, Dauer der Reaktion und der kürzeste tolerierte Abstand. Vier Zahlen, von denen keine Ausrüstung verlangt.
Die moralische Sprache weglassen. Eine operationale Beschreibung entfernt „stur“, „dominant“ und „aus Trotz“ aus der Einschätzung, und das verbessert sowohl den Plan als auch die Beziehung (und Verhalten, das nach Verweigerung aussieht, ist meist etwas ganz anderes).
Nach der Maßnahme erneut messen. Eine Definition, die genau genug war, um das Problem zu beschreiben, ist genau genug, um zu zeigen, ob es sich verändert hat, einschließlich der Frage, ob eine scheinbare Besserung echt ist oder ein unterdrücktes Verhalten, das auf die passenden Bedingungen zur Rückkehr wartet (wie es die Forschung zur Löschung vorhersagt).
9.2 Festlegen vor dem Einschätzen
Ein Haushalt, der gefragt wird, ob sein Hund ängstlich ist, antwortet aus dem Eindruck. Gefragt, wie oft der Hund diese Woche Futter verweigert hat, das er sonst nimmt, antwortet er aus Beobachtung, und die zweite Antwort lässt sich mit der nächsten Woche vergleichen.
Eine Frage nach einem Begriff in eine Frage nach etwas Beobachtbarem zu verwandeln, ist der Kern der Technik, und sie funktioniert ohne jede Ausbildung (wo Erregung als eigene Variable behandelt wird). Sie erzeugt außerdem eine Zahl, deren Bewegung der Haushalt verfolgen kann, und das ist mehr wert als jede Beruhigung.
9.3 Wo es eine Beratung verändert
Die meisten Verhaltensvorgeschichten bestehen aus Deutungen, die als Tatsachen vorgetragen werden. Zu fragen, was der Hund tat, in welcher Reihenfolge, in welchem Abstand, erzeugt einen anderen Bericht und häufig ein anderes Problem als das, mit dem der Haushalt gekommen ist.
Das Ziel ist durchgehend eine bessere Entscheidung und keine dickere Akte. Ein Haushalt, der sagen kann, dass der Abstand von 30 Metern auf 12 gesunken ist, hat etwas, worauf er handeln kann, einer, der berichtet, es gehe „besser“, hat etwas, worauf er hoffen kann. Das ist keine Skepsis gegenüber dem Bericht des Halters. Die Beobachtung stimmt meist, und das Etikett daran ist der Teil, der eine Prüfung lohnt (Schmerz als wiederkehrende Differenzialdiagnose). Haushalte beobachten oft genau und deuten weniger verlässlich, und das ist dieselbe Kombination, die die Literatur zum Erfassen beschreibt. Manche Halter lesen ihre Hunde sehr gut, was dem ungeschulten Bericht fehlt, ist nicht Aufmerksamkeit, sondern ein festgelegtes Schema, gegen das aufgezeichnet wird.
10. Wie gute Berichterstattung aussieht
10.1 Die Definition im Wortlaut
Eine Arbeit, die berichtet, Aggression gemessen zu haben, ohne die Definition abzudrucken, hat ihr Verfahren nicht berichtet. Die Definition ist keine Vorstufe der Untersuchung, sie ist das Instrument.
Wo der Platz knapp ist, gehört die Definition in ergänzendes Material und nicht nirgendwohin, und wer auf einen Begriff ohne Definition stößt, sollte die Zahlen entsprechend behandeln. Der offene Umgang mit Daten hat das erheblich und ungleichmäßig verbessert.
10.2 Die Angabe zur Übereinstimmung und wie sie zustande kam
Eine Übereinstimmung zwischen Beobachtenden, die als einzelne Zahl berichtet wird, ohne zu sagen, wie viel Material doppelt erfasst wurde, von wem und ob die Erfassenden unabhängig waren, sagt weniger, als es scheint.
Eine Übereinstimmung, die an einem leichten Teilstück berechnet wurde, ist keine Übereinstimmung über den Datensatz, und das Teilstück wird selten beschrieben.
10.3 Was ausgeschlossen wurde und warum
Hunde, die ausgeschieden sind, verworfene Durchgänge und abgebrochene Einheiten gehören zum Verfahren. Wo Ausschlüsse nicht berichtet werden, lässt sich nicht erkennen, ob die verbleibende Stichprobe repräsentativ ist.
Das zählt am meisten bei Aufgaben, die anhaltende Mitarbeit verlangen, wo die ausgeschlossenen Tiere plausibel diejenigen sind, um die es in der Untersuchung ging (wo das Verfahren zur Bewertungsverzerrung ausführlich beschrieben wird). Eine Ausschlussregel, die nach dem Blick auf die Daten angewandt wurde, ist etwas anderes als eine vorher festgelegte.
10.4 Die Stichprobenregel
Fokus oder Momentaufnahme, durchgehend oder in Abständen, und in welchem Abstand. Vier Wörter in einem Methodenteil, häufig nicht vorhanden, und sie entscheiden, ob sich zwei Untersuchungen überhaupt vergleichen lassen.
Wer auf diese vier Dinge achtet, wird feststellen, dass ein guter Teil der Literatur zum Hund sie nicht liefert und dass der Anteil mit dem Erscheinungsjahr besser wird.
11. Operationalisierung auf einen Blick
Operationale Definition – Was sie leistet: übersetzt einen Begriff in beobachtbare, zählbare Verfahren. Anforderungen: beobachtbar, messbar, zuverlässig, gültig. Grenze: misst einen Stellvertreter, nie den inneren Zustand selbst.
Arten von Maßen – Ereignisverhalten als Häufigkeit oder Rate gezählt, Zustandsverhalten als Dauer erfasst, Verzögerung für Zögern und Belastungsgrenze, Stärke für den Schweregrad auf einer verankerten Rangskala, kategorial für einander ausschließende Klassen.
Zuverlässigkeit – Was sie ist: Übereinstimmung zwischen unabhängigen Beobachtenden, beziffert mit Cohens Kappa für kategoriale Daten und der Intraklassenkorrelation für stetige. Was sie nicht ist: ein Beleg dafür, dass die Definition den gemeinten Begriff misst.
Gültigkeit – Wie sie belegt wird: durch Zusammenlaufen über begrifflich unabhängige Kanäle, also Verhalten, Körper, kognitive Maße. Wo sie beim Hund scheitert: Maße der Hemmungskontrolle, die zwischen Aufgaben nicht zusammenhängen, Bewertungsverzerrung, die von vorherigem Training geprägt ist, kein geprüftes Anzeichen für positive Emotionen.
Messen über mehrere Kanäle – Verhaltenserfassung, Herzfrequenz und Herzratenvariabilität, Cortisol über verschiedene Zeiträume, Wärmebild, Pupillenmessung, Beschleunigungsmessung, automatische Haltungserkennung. Jedes hat eine bestimmte Schwäche, das Zusammenlaufen trägt das Argument.
12. Forschungslücken und kritische Einordnung
Die Verhaltensmessung beim Hund braucht methodische Arbeit. Olsen (2018) vertritt das für die exekutiven Funktionen im Besonderen, und das Argument gilt allgemein: Begriffe werden häufig vorausgesetzt statt geprüft.
Manche etablierten Begriffe sind womöglich keine einheitlichen Dinge. Maße der Hemmungskontrolle hängen beim Hund zwischen Aufgaben nicht zusammen (Brucks et al., 2017), und genau das wäre zu erwarten, wenn die Aufgaben verschiedene Dinge unter einem Namen messen.
Ein viel genutztes Verfahren misst mehr als gemeint. Die Leistung in der Bewertungsverzerrung wird von vorherigem Unterscheidungstraining beeinflusst (Krahn et al., 2024), Unterschiede in der Verzögerung zwischen Gruppen verlangen also sorgfältige Deutung.
Positive Zustände bleiben weitgehend nicht messbar. Es gibt kein geprüftes Anzeichen (Csoltova & Mehinagic, 2020), und die üblichen Anzeichen unterscheiden Erregung nur bei negativer Wertigkeit (Flint et al., 2024).
Körperliche Maße sind peripher und unspezifisch. Cortisol reagiert auf Erregung beider Wertigkeiten, die Pupillenweite ebenso. Sie grenzen die Deutung ein, ohne sie zu klären.
Die Richtwerte für Zuverlässigkeit sind Übereinkünfte. Die Etiketten für Kappa-Bereiche stammen aus methodischer Übereinkunft und nicht aus statistischer Notwendigkeit und unterscheiden sich zwischen Quellen.
Automatisches Erfassen erbt seine Trainingsdaten. Die Haltungserkennung verbessert die Beständigkeit und bringt zugleich alle Verzerrungen mit, die in der Beschriftung steckten, einschließlich der Rassenverteilung und menschzentrierter Merkmalsauswahl.
Individuelle Unterschiede erschweren Definitionen auf Gruppenebene. Eine an einer Population geeichte Definition passt nur unvollkommen auf einen einzelnen Hund (wie es die Temperamentforschung erwarten ließe).
Definitionen werden häufig nicht berichtet. Ein erheblicher Teil der Verhaltensforschung am Hund beschreibt die Messung eines Begriffs, ohne die verwendete operationale Definition abzudrucken, und das macht Vergleiche unmöglich.
Stichprobenregeln fehlen oft. Ob im Fokus oder als Momentaufnahme aufgezeichnet wurde, durchgehend oder in Abständen und in welchem Abstand, bestimmt die Zahlen und fehlt regelmäßig in Methodenteilen (Martin & Bateson, 2007).
Zuverlässigkeit wird häufiger berichtet als Gültigkeit. Übereinstimmung zwischen Beobachtenden ist erreichbar und berichtbar, ob das Maß den Begriff erfasst, ist beides nicht, und die Literatur bildet diese Ungleichheit ab.
13. Fazit
Operationale Definitionen sind es, die aus Verhalten einen Gegenstand statt eines Eindrucks machen. Sie ermöglichen Wiederholung, Vergleich, Zusammenfassung mehrerer Studien und, für die Praxis, Ziele, die sich tatsächlich beurteilen lassen. Sie tragen zugleich eine dauerhafte Grenze, die keine methodische Sorgfalt beseitigt: Sie messen beobachtbare Stellvertreter, und ob ein Stellvertreter dem Begriff dahinter folgt, ist eine empirische Frage, die eigens, wiederholt und manchmal mit unangenehmem Ergebnis beantwortet werden muss. Die Forschung am Hund hat echte Beispiele dafür, wie das lehrreich schiefgeht, von Maßen der Hemmungskontrolle, die untereinander nicht zusammenhängen, bis zu einem Verfahren zur Bewertungsverzerrung, das neben der Stimmung auch die Lerngeschichte abbildet. Die Arbeitsdisziplin folgt daraus. Genau sagen, was zählen soll. Prüfen, ob eine andere Person dieselbe Regel anwenden und zur selben Zahl kommen kann. Dann die schwerere Frage stellen, nämlich ob das Gezählte das ist, worauf es ankommt, und die Antwort als vorläufig behandeln. Gute Wissenschaft und gutes Training beginnen an derselben Stelle: damit zu beschreiben, was man tatsächlich sieht, in Worten, die genau genug sind, dass man sich widerlegen lassen könnte.
Wichtigste Erkenntnisse im Überblick
Eine operationale Definition misst einen Stellvertreter und nie den inneren Zustand. Rutenhaltung und Körperhaltung zu zählen, heißt nicht, Furcht zu zählen, und die Verbindung zwischen beidem muss eigens belegt und nicht vorausgesetzt werden.
Zuverlässigkeit und Gültigkeit sind verschiedene Dinge, und der Unterschied ist nicht akademisch. Beobachtende können sich vollständig über ein Maß einig sein, das nichts Einschlägiges abbildet. Gültigkeit entsteht aus dem Zusammenlaufen unabhängiger Kanäle, also Verhalten, Körper, Kognition.
Die Forschung am Hund hat belegte Fälle, in denen etablierte Maße diese Prüfung nicht bestanden. Maße der Hemmungskontrolle hängen zwischen Aufgaben nicht zusammen (Brucks et al., 2017), und die Leistung in der Bewertungsverzerrung wird neben der Stimmung von vorherigem Unterscheidungstraining geprägt (Krahn et al., 2024).
Positive Gefühlszustände bleiben beim Hund weitgehend nicht messbar. Die üblichen Anzeichen unterschieden Erregung nur bei negativer Wertigkeit, mit der Herzfrequenz als Ausnahme (Flint et al., 2024), und ein geprüftes Anzeichen für positive Emotionen gibt es derzeit nicht (Csoltova & Mehinagic, 2020).
Aggression sollte nach beobachtbarem Zusammenhang und Form erfasst werden und nicht nach erschlossener Motivation. Abwenden einer Bedrohung, Wettbewerb um Ressourcen und Frustration an einer Grenze unterscheiden sich durch die Situation und ihre Folgen. Nur „Knurren“ oder „Biss“ zu erfassen, wirft Kategorien zusammen, die sich verschieden verhalten und auf Maßnahmen verschieden ansprechen.
Quellen
Beerda, B., Schilder, M. B. H., van Hooff, J. A. R. A. M., de Vries, H. W., & Mol, J. A. (1998). Behavioural, saliva cortisol and heart rate responses to different types of stimuli in dogs. Applied Animal Behaviour Science, 58(3–4), 365–381. https://doi.org/10.1016/S0168-1591(97)00145-7
Bekoff, M., & Byers, J. A. (1981). A critical reanalysis of the ontogeny and phylogeny of mammalian social and locomotor play: An ethological hornet's nest. In K. Immelmann, G. W. Barlow, L. Petrinovich, & M. Main (Hrsg.), Behavioral development: The Bielefeld interdisciplinary project (S. 296–337). Cambridge University Press.
Brucks, D., Marshall-Pescini, S., Wallis, L. J., Huber, L., & Range, F. (2017). Measures of dogs' inhibitory control abilities do not correlate across tasks. Frontiers in Psychology, 8, 849. https://doi.org/10.3389/fpsyg.2017.00849
Csoltova, E., & Mehinagic, E. (2020). Where do we stand in the domestic dog (Canis familiaris) positive-emotion assessment: A state-of-the-art review and future directions. Frontiers in Psychology, 11, 2131. https://doi.org/10.3389/fpsyg.2020.02131
Flint, H. E., Weller, J. E., Parry-Howells, N., Ellerby, Z. W., McKay, S. L., & King, T. (2024). Evaluation of indicators of acute emotional states in dogs. Scientific Reports, 14(1), 6406. https://doi.org/10.1038/s41598-024-56859-9
Herron, M. E., Shofer, F. S., & Reisner, I. R. (2009). Survey of the use and outcome of confrontational and non-confrontational training methods in client-owned dogs showing undesired behaviors. Applied Animal Behaviour Science, 117(1–2), 47–54. https://doi.org/10.1016/j.applanim.2008.12.011
Krahn, J., Azadian, A., Cavalli, C., Miller, J., & Protopopova, A. (2024). Effect of pre-session discrimination training on performance in a judgement bias test in dogs. Animal Cognition, 27(1), 66. https://doi.org/10.1007/s10071-024-01905-2
Martin, P., & Bateson, P. (2007). Measuring behaviour: An introductory guide (3. Aufl.). Cambridge University Press.
Mendl, M., Burman, O. H. P., & Paul, E. S. (2010). An integrative and functional framework for the study of animal emotion and mood. Proceedings of the Royal Society B, 277(1696), 2895–2904. https://doi.org/10.1098/rspb.2010.0303
Mills, D. S., Demontigny-Bédard, I., Gruen, M., Klinck, M. P., McPeake, K. J., Barcelos, A. M., Hewison, L., Van Haevermaet, H., Denenberg, S., Hauser, H., Koch, C., Ballantyne, K., Wilson, C., Mathkari, C. V., Pounder, J., Garcia, E., Darder, P., Fatjó, J., & Levine, E. (2020). Pain and problem behavior in cats and dogs. Animals, 10(2), 318. https://doi.org/10.3390/ani10020318
Olsen, M. R. (2018). A case for methodological overhaul and increased study of executive function in the domestic dog (Canis lupus familiaris). Animal Cognition, 21(2), 175–195. https://doi.org/10.1007/s10071-018-1162-6
Schöberl, I., Beetz, A., Solomon, J., Wedl, M., Gee, N., & Kotrschal, K. (2016). Social factors influencing cortisol modulation in dogs during a Strange Situation Procedure. Journal of Veterinary Behavior, 11, 77–85. https://doi.org/10.1016/j.jveb.2015.09.007
Topál, J., Miklósi, Á., Csányi, V., & Dóka, A. (1998). Attachment behavior in dogs (Canis familiaris): A new application of Ainsworth's (1969) Strange Situation Test. Journal of Comparative Psychology, 112(3), 219–229. https://doi.org/10.1037/0735-7036.112.3.219