Lehrevaluation an Hochschulen: Feedback auswerten und für die akademische Karriere nutzen
Lehrevaluationen sind nicht perfekt, aber wichtig. Sie geben Hinweise auf Struktur, Verständlichkeit, Arbeitsaufwand, Betreuung und Prüfungslogik. Für die akademische Karriere können gute Evaluationen ein starkes Signal sein, wenn sie mit Reflexion und Weiterentwicklung verbunden werden.
Welche Ergebnisarten es gibt
Ein Evaluationsbericht enthält mehrere Sorten von Information, die verschieden belastbar sind und getrennt gelesen werden müssen:
- Skalenwerte geben an, wie die Antwortenden eine Aussage eingestuft haben. Sie sind vergleichbar, sagen aber nichts darüber, warum.
- Freitext nennt Gründe und konkrete Situationen. Er ist die einzige Stelle, an der etwas Unerwartetes auftauchen kann – und zugleich die, an der einzelne Stimmen stark wirken.
- Rücklauf sagt, auf wie vielen Antworten alles beruht. Ohne diese Zahl ist ein Mittelwert nicht einzuordnen.
- Qualitative Zwischenevaluation – drei Fragen in der Mitte des Semesters – liefert Hinweise, die noch im laufenden Kurs umsetzbar sind. Die Abschlussevaluation kommt dafür immer zu spät.
- Eigene Beobachtungen: Abgabequoten, Anwesenheit, Fragen in der Sprechstunde, typische Fehler in der Prüfung. Sie sind keine Evaluation, aber sie erklären oft, was die Zahlen zeigen.
Was studentische Evaluationen erheben, sind Einschätzungen der Antwortenden zum Zeitpunkt der Befragung. Sie sind deshalb eine Informationsquelle über die Lehre und keine Messung der Lehrqualität. Ob und wie stark einzelne Merkmale – Gruppengröße, Pflichtstatus, Notenerwartung, Erhebungszeitpunkt – die Werte systematisch verschieben, ist Gegenstand eigener Forschung; wer solche Effekte behauptet, sollte sie belegen können. Für die eigene Auswertung genügt der vorsichtigere Schluss: Ein einzelner Wert trägt keine Aussage, ein wiederkehrendes Muster schon.
Quantitative Werte einordnen
Ein Mittelwert ohne Kontext ist keine Information. Vier Angaben gehören dazu, bevor eine Zahl gedeutet wird: Rücklaufquote, Gruppengröße, Veranstaltungsart und Erhebungszeitpunkt. Eine Pflichtvorlesung mit 300 Teilnehmenden und 18 Prozent Rücklauf ist mit einem Wahlseminar mit 15 Teilnehmenden und 80 Prozent Rücklauf nicht vergleichbar – auch dann nicht, wenn beide Berichte dieselbe Skala verwenden.
Für die eigene Auswertung empfiehlt sich der Vergleich über mehrere Semester eher als der Vergleich mit anderen Veranstaltungen. Interessant sind Ausreißer einzelner Items gegenüber dem eigenen Durchschnitt: Wenn die Verständlichkeit stabil ist und nur der Arbeitsaufwand abfällt, ist das ein konkreter Ansatzpunkt.
Bei kleinen Gruppen bewegt eine einzelne Stimme den Mittelwert rechnerisch stark. Dort trägt die Zahl am wenigsten – ein Freitext nennt wenigstens einen Grund, an dem sich weiterarbeiten lässt.
Was die Forschung zu Verzerrungen zeigt
Zwei Untersuchungen tragen dazu belastbare Aussagen bei, und sie sagen Verschiedenes. Die erste wertete 523.703 studentische Befragungen aus fünf Fakultäten einer australischen Universität aus den Jahren 2010 bis 2016 aus, zu 2.392 Veranstaltungen und 3.123 Lehrpersonen (Fan et al. 2019, S. 2). Auch nachdem Veranstaltung, Lehrperson, Kursgröße, Veranstaltungsart und durchschnittliche Studienleistung im Modell berücksichtigt waren (S. 5), fielen die Bewertungen von Frauen und von Lehrenden ohne englischsprachigen Hintergrund statistisch signifikant schlechter aus – allerdings, wie die Autorinnen und Autoren ausdrücklich festhalten, nicht in jeder Fakultät (S. 14). An derselben Stelle halten sie fest, dass ihre Daten nur Zusammenhänge zeigen: Weiblich zu sein geht mit einer niedrigeren Bewertung einher; was die Ursache war, lässt sich daraus nicht sagen. Eine zweite Grenze benennt die Arbeit ebenfalls selbst: Die Befragung ist freiwillig, der Rücklauf liegt universitätsweit bei etwa 30 Prozent, und die Ergebnisse geben das Antwortverhalten derer wieder, die geantwortet haben (S. 13).
Die zweite Untersuchung zeigt, dass schon die Form der Befragung auf das Ergebnis wirkt. In vier großen Einführungskursen einer US-amerikanischen Universität – zwei in Biologie, zwei in Politikwissenschaft, jeweils eine Veranstaltung mit einer weiblichen und eine mit einer männlichen Lehrperson (Peterson et al. 2019, S. 2) – erhielt ein zufällig bestimmter Teil der Studierenden den üblichen Evaluationsbogen, der andere Teil zusätzlich einen Hinweis auf mögliche Bewertungsverzerrungen (S. 3). Bei den weiblichen Lehrpersonen lag die Gesamtbewertung der Lehrperson in der Hinweisgruppe um 0,41 Punkte und die des Kurses um 0,51 Punkte höher, gemessen auf einer Fünfpunkteskala; bei den männlichen Lehrpersonen betrug der Unterschied 0,04 Punkte und war nicht statistisch signifikant (S. 3 und S. 4). Die Autorinnen und Autoren halten selbst fest, dass Studierende den Hinweis auch überkompensiert haben könnten (S. 8).
Weiter reichen diese beiden Belege nicht. Sie stammen von je einer australischen und einer US-amerikanischen Hochschule; ein eigener Befund für deutsche Hochschulen liegt damit nicht vor, und zu Pflichtstatus oder Notenerwartung sagen sie nichts Eigenständiges aus. Für die eigene Auswertung heißt das vor allem: Ein Vergleich zwischen Personen ist heikler, als die Zahlen aussehen. Welcher Vergleich stattdessen mehr trägt, sagen beide Arbeiten nicht – als Arbeitsregel bleibt der eigene Verlauf über mehrere Semester bei vergleichbaren Erhebungsbedingungen.
Passende Stellen
518 Professuren aktuell ausgeschrieben
Freitext professionell lesen
Freitext kann hilfreich, verletzend, widersprüchlich oder unsachlich sein. Lehrende sollten Kommentare sortieren: konkrete Verbesserungshinweise, wiederkehrende Muster, Einzelmeinungen, Missverständnisse und nicht verwertbare Aussagen. Besonders wichtig sind Kommentare, die konkrete Situationen benennen.
Es hilft, Evaluationen nicht unmittelbar emotional zu beantworten, sondern mit Abstand auszuwerten und zwei bis drei realistische Änderungen für den nächsten Durchlauf festzulegen.
Auswertung in fünf Schritten
Aus einem Befund wird eine Änderung, wenn er fünf Schritte durchläuft. Ein durchgespieltes Beispiel:
- Beobachtung. Vier Freitexte nennen die Prüfungsanforderungen unklar; das entsprechende Item liegt unter dem eigenen Durchschnitt der letzten Semester.
- Mögliche Erklärungen. Die Aufgabenstellung wurde erst spät ausgegeben; die Bewertungskriterien standen nur mündlich im Raum; oder die Prüfungsform passt nicht zu dem, was im Semester geübt wurde.
- Zusätzliche Information. Nachsehen, wann die Aufgabe im Kursraum stand, welche Fragen in der Sprechstunde kamen und welcher Aufgabentyp in der Prüfung am schlechtesten bearbeitet wurde. Das entscheidet zwischen den Erklärungen.
- Konkrete Änderung. Wenn es die Kriterien waren: Bewertungsraster mit der Aufgabenstellung ausgeben und eine Beispielarbeit besprechen. Eine Änderung, nicht fünf.
- Spätere Überprüfung. Im nächsten Durchlauf dasselbe Item und dieselbe Freitextfrage ansehen – und zu Beginn sagen, was aus der letzten Evaluation geändert wurde.
Der häufigste Fehler ist der Sprung von Schritt 1 zu Schritt 4. Ohne Schritt 2 und 3 wird die erstbeste Erklärung geändert, und die Ursache bleibt.
Verletzende und diskriminierende Kommentare
Freitextfelder enthalten gelegentlich Kommentare, die nichts mit der Veranstaltung zu tun haben: Bemerkungen über Aussehen, Herkunft, Geschlecht, Akzent oder persönliche Angriffe. Sie sind keine Rückmeldung zur Lehre und müssen nicht ausgewertet werden.
Drei Punkte helfen im Umgang damit. Erstens: den Bericht nicht am Tag des Eingangs auswerten, sondern mit Abstand – das trennt die Kränkung von der Analyse. Zweitens: solche Kommentare benennen, statt sie zu übergehen; wer sie mit einer Kollegin oder einem Kollegen liest, sortiert sie schneller ein. Drittens: bei diskriminierenden Inhalten gibt es an Hochschulen zuständige Stellen – Gleichstellungsbeauftragte, Beschwerdestelle nach dem Allgemeinen Gleichbehandlungsgesetz oder die in der jeweiligen Richtlinie benannte Anlaufstelle. Wie Freitexte erhoben, weitergegeben und gegebenenfalls gefiltert werden, regelt die Evaluationsordnung der Hochschule; sie ist auch die Stelle, an der sich ein Verfahren ändern lässt.
Evaluationen als Nachweis
Evaluationen sind ein möglicher Nachweis unter mehreren und kein Gesamturteil über die Lehrqualität. Neben ihnen stehen Lehrkonzept, Prüfungsmaterialien, Betreuungserfahrung, kollegiale Hospitation und hochschuldidaktische Weiterbildung.
Wenn Evaluationen in eine Bewerbung oder ein Portfolio aufgenommen werden, gehört der Kontext dazu: Art der Veranstaltung, Gruppengröße, Rücklauf, zentrale Ergebnisse, die daraus abgeleitete Änderung und deren Überprüfung im nächsten Durchlauf. Ein einzelner Spitzenwert ohne diese Angaben sagt wenig; eine dokumentierte Veränderung nach Kritik sagt mehr. Was sonst in ein Lehrportfolio gehört, steht in Lehrportfolio für die wissenschaftliche Karriere.
Was nicht aus Evaluationen folgt
Aus einer Evaluation folgt nicht, wie viel gelernt wurde: Gemessen wird die Einschätzung der Antwortenden, nicht der Lernstand. Sie trägt auch keinen Vergleich zwischen Personen über verschiedene Veranstaltungsarten hinweg, und sie ersetzt keine Prüfungsauswertung. Was sie leistet, ist ein Hinweis darauf, wo Struktur, Tempo, Material, Feedback oder Anforderungen nicht angekommen sind – und genau dafür lohnt sie die Auswertung.
Fragen an den eigenen Evaluationsbericht
- Wie hoch war der Rücklauf, und wie viele Personen stehen hinter dem Mittelwert?
- Welche Aussage wiederholt sich in mehreren Freitexten?
- Welches Item weicht vom eigenen Durchschnitt der Vorsemester ab – nach oben wie nach unten?
- Wo widersprechen sich Skalenwert und Freitext, und welche zusätzliche Information klärt den Widerspruch?
- Welche der möglichen Erklärungen lässt sich mit eigenen Beobachtungen prüfen?
- Welche eine Änderung folgt daraus, und woran wird sie im nächsten Durchlauf gemessen?
Praxisbeispiel: Lehrevaluationen
Angenommener Fall: Eine Evaluation zeigt gute Gesamtwerte, aber wiederkehrende Kritik an unklarer Prüfungsanforderung. Die Lehrperson ergänzt im nächsten Durchlauf ein Bewertungsraster und eine Beispielbesprechung. In der folgenden Evaluation verbessert sich gerade dieser Punkt. Im Lehrportfolio wird nicht nur der gute Wert genannt, sondern die Entwicklung erklärt.
Checkliste für die Umsetzung
- Rücklaufquote, Gruppengröße, Veranstaltungsart und Erhebungszeitpunkt notieren, bevor eine Zahl gedeutet wird
- zwischen Beobachtung, Erklärung und Änderung nicht abkürzen
- Freitext nach Mustern sortieren
- zwei bis drei konkrete Verbesserungen ableiten
- Studierenden Rückmeldung zu Änderungen geben
- Evaluationen im Lehrportfolio reflektiert dokumentieren
Abgrenzung und Weiterlesen
Kritik am Arbeitsaufwand prüft man mit der Rechnung aus Workload und ECTS; Kritik an unklaren Anforderungen mit Bewertungsraster und Rubrics. Wenn Erwartung und Prüfung auseinanderfallen, liegt das Problem meist bei der Passung – dazu Lernziele, Lehrmethoden und Prüfungen. Viele Rückmeldungen zur Struktur entstehen in den ersten Wochen: Die erste Lehrveranstaltung. Für die Aufnahme ins Portfolio ist Lehrportfolio einschlägig.
Typischer Umsetzungskonflikt
Bei Evaluationen besteht der Konflikt zwischen Messbarkeit und Lehrrealität. Zahlen sind leicht vergleichbar, aber nicht immer gerecht. Freitexte sind reichhaltig, aber subjektiv. Eine brauchbare Auswertung liest beides nebeneinander und fragt, welche Änderung daraus folgt. Woran man sie erkennt: Am Ende steht eine Entscheidung mit einem Termin, an dem überprüft wird, ob sie gewirkt hat.
Ein zweiter Konflikt betrifft den Zeitpunkt: Die Abschlussevaluation erreicht die Gruppe nicht mehr, die sie ausgefüllt hat. Wer im laufenden Semester etwas ändern will, braucht eine kurze Zwischenevaluation; die Abschlussevaluation wirkt erst auf den nächsten Durchlauf. Das ist gerade für Lehrende am Anfang hilfreich, deren Lehrerfahrung noch nicht über viele Jahre reicht.
Evaluationen sollten deshalb nie nur als Zufriedenheitsmessung gelesen werden. Eine gute Auswertung trennt zwischen Punkten, die die Lehrperson direkt ändern kann, strukturellen Rahmenbedingungen und Rückmeldungen, die fachlich begründet nicht übernommen werden. Erst diese Sortierung macht aus einem Freitextfeld eine Liste von Punkten, an denen sich arbeiten lässt.
In Berufungsausschüssen können gute Evaluationen positiv auffallen, wenn Kontext und Konsequenz erkennbar sind: Welche Veranstaltung, welche Gruppe, welche Rücklaufquote, welche Änderung danach? Ohne Kontext sind Zahlen leicht angreifbar; mit Kontext zeigen sie reflektierte Lehrentwicklung.
Häufige Fragen
Was messen studentische Lehrevaluationen?
Sie erheben die Einschätzung der Antwortenden zum Zeitpunkt der Befragung – zu Struktur, Verständlichkeit, Arbeitsaufwand, Betreuung und Anforderungen. Sie messen nicht den Lernstand und sind kein Gesamturteil über die Lehrqualität.
Wie sollten quantitative Werte eingeordnet werden?
Ein Mittelwert ohne Rücklaufquote und Kurskontext sagt wenig; wichtiger sind Muster über mehrere Semester und Ausreißer bei Workload, Verständlichkeit oder Betreuung. Bei kleinen Gruppen ist die qualitative Auswertung oft wichtiger als der Durchschnitt.
Wie liest man Freitextkommentare professionell?
Lehrende sollten Kommentare sortieren in konkrete Verbesserungshinweise, wiederkehrende Muster, Einzelmeinungen und nicht verwertbare Aussagen, sie mit Abstand auswerten und zwei bis drei realistische Änderungen für den nächsten Durchlauf festlegen.
Wie werden Evaluationen in Verbesserungen übersetzt?
Über fünf Schritte: Beobachtung, mögliche Erklärungen, zusätzliche Information, eine konkrete Änderung und deren Überprüfung im nächsten Durchlauf. Ohne die Schritte zwei und drei wird die erstbeste Erklärung geändert und die Ursache bleibt.
Welche Bedeutung haben Evaluationen für Berufungsverfahren?
Gute Werte ersetzen kein Lehrkonzept, können aber ein starkes Signal sein, wenn Bewerber:innen zeigen, dass sie Feedback systematisch auswerten und ihre Lehre weiterentwickeln. Überzeugend ist die Verbindung aus Ergebnissen, Reflexion und konkreten Änderungen.
- Hochschulrektorenkonferenz: Qualität in Studium und Lehre.
- Hochschuldidaktik Sachsen: Angebote zu Lehrentwicklung und Feedback.
- Fan, Y., Shepherd, L. J., Slavich, E., Waters, D., Stone, M., Abel, R., Johnston, E. L. (2019): Gender and cultural bias in student evaluations: Why representation matters. PLOS ONE 14(2), e0209749, DOI 10.1371/journal.pone.0209749. Volltext abgerufen am 13. September 2026.
- Peterson, D. A. M., Biederman, L. A., Andersen, D., Ditonto, T. M., Roe, K. (2019): Mitigating gender bias in student evaluations of teaching. PLOS ONE 14(5), e0216241, DOI 10.1371/journal.pone.0216241. Volltext abgerufen am 13. September 2026.
Stand: 13. September 2026.