Bewertungsraster und Rubrics: fair und nachvollziehbar korrigieren
Bewertungsraster, häufig auch Rubrics genannt, machen Leistungserwartungen sichtbar. Sie machen sichtbar, woran eine Leistung gemessen wird – vor der Abgabe für Studierende, bei der Korrektur für die bewertende Person.
Analytisch oder holistisch?
Ein Bewertungsraster übersetzt allgemeine Erwartungen in benannte Kriterien. Statt „gute Argumentation“ steht darin, woran gute Argumentation erkennbar sein soll: klare These, nachvollziehbarer Aufbau, Belege, Umgang mit Gegenargumenten, Bezug zur Fragestellung. Es gibt zwei Bauformen, und die Wahl zwischen ihnen ist die erste Entscheidung.
Analytisch: Jedes Kriterium wird einzeln eingestuft, die Einstufungen ergeben zusammen die Bewertung. Vorteil: Studierende sehen, an welchem Kriterium es lag, und mehrere Korrigierende haben denselben Wortlaut vor sich, an dem sie sich abstimmen können. Nachteil: hoher Erstellungsaufwand, und die Summe einzelner Stufen trifft nicht immer die Gesamtleistung.
Holistisch: Für jede Notenstufe gibt es eine zusammenhängende Beschreibung der Arbeit als Ganzes. Vorteil: schnell anzuwenden, passt zu offenen und gestalterischen Leistungen. Nachteil: als Rückmeldung schwächer, weil nicht sichtbar wird, welcher Aspekt den Ausschlag gab.
Als Faustregel: analytisch, wenn das Raster auch Lerninstrument sein soll oder mehrere Personen korrigieren; holistisch, wenn die Leistung als Ganzes beurteilt wird und die Rückmeldung mündlich erfolgt. Beides lässt sich mischen – analytische Kriterien plus ein Feld für die Gesamteinschätzung.
Kriterien auswählen
Kriterien sollten aus Lernzielen und Prüfungsform abgeleitet werden. Für eine Hausarbeit können Fragestellung, Argumentation, Literaturarbeit, Methode, Struktur und Form relevant sein. Für eine Präsentation kommen Verständlichkeit, Visualisierung, Zeitmanagement und Diskussion hinzu. Für Projekte zählen Prozess, Ergebnis, Reflexion und Zusammenarbeit.
Wichtig ist Begrenzung. Ein Raster mit 25 Kriterien wird unhandlich. Besser sind fünf bis acht zentrale Dimensionen, die wirklich bewertet werden.
Leistungsstufen beschreiben
Ein analytisches Raster beschreibt mehrere Leistungsstufen pro Kriterium, etwa sehr gut, gut, ausreichend, nicht ausreichend. Die Stufen sollten nicht nur Adjektive wiederholen, sondern beobachtbare Unterschiede benennen. „Sehr gut“ heißt dann nicht „überzeugend“, sondern etwa: „entwickelt eine präzise Fragestellung, hält sie durch und verbindet sie mit einer eigenständigen Argumentation“.
Solche Beschreibungen kosten bei der Erstellung Zeit, sparen aber bei Korrektur und Rückfragen.
Passende Stellen
518 Professuren aktuell ausgeschrieben
Ein vollständiges Beispielraster
Konstruiertes Beispiel für ein Essay im Bachelor: drei Kriterien, vier Stufen. Für das Beispiel genügt das; wie viele Kriterien ein eigenes Raster tragen sollte, steht oben unter Kriterien auswählen.
Kriterium 1 – Fragestellung
- Stufe 4: Die Frage ist präzise, im Text durchgehalten und am Schluss beantwortet.
- Stufe 3: Die Frage ist erkennbar, wird aber an einer Stelle verlassen.
- Stufe 2: Es gibt ein Thema, aber keine beantwortbare Frage.
- Stufe 1: Thema und Text hängen nur lose zusammen.
Kriterium 2 – Argumentation
- Stufe 4: Jede Behauptung ist belegt, Gegenpositionen sind genannt und entkräftet oder als offen markiert.
- Stufe 3: Belege sind vorhanden, Gegenpositionen fehlen oder bleiben unbearbeitet.
- Stufe 2: Der Text referiert überwiegend, statt zu argumentieren.
- Stufe 1: Behauptungen stehen ohne Beleg.
Kriterium 3 – Quellenarbeit
- Stufe 4: Auswahl ist begründet, Zitate sind korrekt nachgewiesen, Paraphrasen sind als solche erkennbar.
- Stufe 3: Nachweise sind vorhanden, vereinzelt uneinheitlich.
- Stufe 2: Nachweise fehlen an mehreren Stellen oder sind nicht prüfbar.
- Stufe 1: Übernahmen sind nicht kenntlich gemacht.
Woran man die Stufen erkennt: Sie wiederholen nicht dieselben Adjektive in abgeschwächter Form („sehr überzeugend / überzeugend / weniger überzeugend“), sondern benennen einen beobachtbaren Unterschied. Wer eine Stufe nicht an einer konkreten Textstelle festmachen kann, hat sie noch nicht formuliert.
Vor dem Einsatz testen: zwei oder drei Arbeiten aus einem früheren Durchlauf mit dem Raster bewerten. Kriterien, bei denen man zögert oder zwischen zwei Stufen schwankt, sind unscharf formuliert oder überlappen. Korrigieren mehrere Personen, wird derselbe Durchgang gemeinsam gemacht und die Abweichungen werden besprochen – das ist der einzige Zeitpunkt, an dem sich das Raster noch ändern lässt.
Vor der Abgabe veröffentlichen: Ein Raster, das erst mit der Note sichtbar wird, ist eine Korrekturhilfe, kein Lehrinstrument – und Erwartungen, die vorher nicht erkennbar waren, sind schwer zu begründen. Ausgegeben wird es mit der Aufgabenstellung, am besten zusammen mit einem kurzen Beispiel, wie eine Stufe-4-Passage aussieht.
Gewichtung, Schwellen, Notenbildung
Drei Dinge werden regelmäßig verwechselt, obwohl sie getrennt zu entscheiden sind.
Gewichtung heißt: Wie viel trägt ein Kriterium zum Ergebnis bei? Bei einer Forschungsarbeit wiegt die Methode schwerer als das Layout, bei einer Präsentation die fachliche Qualität schwerer als die Foliengestaltung. Die Gewichtung gehört ins Raster, nicht in den Kopf der korrigierenden Person.
Schwellen heißt: Gibt es Kriterien, die erfüllt sein müssen, unabhängig vom Rest? Eine Arbeit ohne eigene Fragestellung oder mit nicht belegten Übernahmen kann nicht durch gute Formalia ausgeglichen werden. Solche Mindestbedingungen müssen vorher benannt sein, sonst wirken sie wie eine nachträgliche Regel.
Notenbildung heißt: Wie wird aus den Einstufungen eine Note? Hier endet der Gestaltungsspielraum der Lehrperson – Notenskala, Rundung, Bestehensgrenze und die Frage, ob und wie Teilleistungen verrechnet werden dürfen, stehen in der Prüfungsordnung des Studiengangs. Ein Raster, dessen Punktsumme eine andere Note ergibt als die Ordnung vorsieht, ist nicht durchsetzbar.
Feedback mit Rubrics
Rubrics ermöglichen schnelleres, aber nicht automatisches Feedback. Studierende profitieren, wenn markierte Leistungsstufen durch kurze Kommentare ergänzt werden: Was war stark? Was fehlt für die nächste Stufe? Welche konkrete Überarbeitung wäre sinnvoll?
Bei großen Gruppen können Rubrics helfen, Korrekturteams zu kalibrieren. Dafür bewerten alle Korrigierenden vorab dieselben zwei bis drei Beispielarbeiten und besprechen die Abweichungen.
Risiken und Grenzen
Zu starre Raster können Kreativität einschränken oder scheingenaue Noten erzeugen. Nicht jede wissenschaftliche Leistung lässt sich vollständig in Kästchen zerlegen. Deshalb sollten Rubrics Kriterien transparent machen, ohne das Urteil zu mechanisieren.
Außerdem müssen Raster vor der Prüfung kommuniziert werden. Ein nachträglich entwickeltes Raster kann als unfair erlebt werden, wenn es Erwartungen enthält, die vorher nicht erkennbar waren.
Was die Forschung dazu beisteuert, ist begrenzt. Eine Übersicht über 46 Hochschulstudien der Jahre 2005 bis 2017 mit insgesamt 51 untersuchten Instrumenten fand kein erkennbares Muster, nach dem eine Bauform – analytisch oder holistisch – hinsichtlich Zuverlässigkeit oder Gültigkeit einer anderen vorzuziehen wäre. Als einen belastbaren Schluss hält die Autorin fest, dass angemessene Kriterien der Schlüssel zu wirksamen Rastern sind (Brookhart 2018, S. 8 und S. 10). Eine grundsätzliche Überlegenheit einer Bauform lässt sich aus dieser Übersicht also nicht ableiten. Ein nicht gefundener Unterschied ist allerdings auch kein Nachweis von Gleichwertigkeit; was die Wahl trägt, bleibt der Zweck des Rasters.
Wie weit eine Übereinstimmung reichen kann, zeigt eine Anwendung, die die Autorinnen selbst als explorativ bezeichnen. In vier Kursen auf Graduiertenniveau und zwei im grundständigen Studium, zusammen rund 100 Studierende, stimmten studentische Selbsteinschätzung und Bewertung der Lehrenden mit einem Raster aus fünf Kriterien – Relevanz, Umfang, Genauigkeit, Kohärenz und Tiefe – im Mittel zu 75 Prozent überein (Simon/Forgette-Giroux 2001, S. 2). Dazu gehören zwei Einschränkungen aus demselben Text. Die Kurse wurden von den beiden Autorinnen selbst unterrichtet, die an der erziehungswissenschaftlichen Fakultät der Universität Ottawa forschen und in Leistungsmessung erfahren sind (S. 1). Und eine größer angelegte Prüfung der Kriterien stand noch aus (S. 3). Ein prozentualer Anteil ist zudem kein zufallskorrigiertes Maß, und die Übereinstimmung zwischen Studierenden und Lehrperson ist etwas anderes als die zwischen zwei unabhängigen Korrigierenden.
Praxisbeispiel: Bewertungsraster und Rubrics
Angenommener Fall: In einer Hausarbeit beschweren sich Studierende, weil „Argumentation“ unklar bewertet wurde. Im nächsten Durchlauf entwickelt die Lehrperson ein Raster mit Kriterien für Fragestellung, Struktur, Quellenarbeit, Argumentation und Form. Die Kriterien werden vor der Abgabe besprochen. Das Gespräch über die Note führt damit über benannte Kriterien statt über den Gesamteindruck.
Das Raster als Unterlage
Das Raster ist selbst das Dokument, das beim Thema entsteht – und das einzige, das später noch erklärt, wie bewertet wurde. Vier Fassungen lohnt es sich aufzuheben: das ausgegebene Raster, die Notiz aus dem Kalibrierungsdurchgang (welche Kriterien waren unklar?), eine anonymisierte ausgefüllte Korrektur als Beispiel und die überarbeitete Fassung des nächsten Durchlaufs.
Bei einer Rückfrage zur Note ist das ausgegebene Raster die Grundlage des Gesprächs. Kommt es zu einem förmlichen Verfahren, entscheidet nicht das Raster, sondern die Prüfungsordnung; das Raster belegt aber, dass die Bewertung nach vorher bekannten und gleich angewandten Kriterien erfolgt ist.
Checkliste für die Umsetzung
- Kriterien aus Lernzielen ableiten
- maximal fünf bis acht Hauptkriterien wählen
- Leistungsstufen beobachtbar beschreiben
- Gewichtung transparent machen
- Raster mit der Aufgabenstellung ausgeben, nicht mit der Note
- vor dem Einsatz an zwei bis drei Arbeiten testen und nachschaerfen
- Notenbildung gegen die Prüfungsordnung prüfen
Abgrenzung und Weiterlesen
Die Kriterien eines Rasters kommen aus dem Lernziel – wie diese Kette gebaut wird, steht in Lernziele, Lehrmethoden und Prüfungen. Notenskala, Rundung und Verrechnung von Teilleistungen regelt Prüfungsrecht für Dozierende. Für schriftliche Arbeiten gehört der Prozess dazu, nicht nur das Endprodukt: Wissenschaftliches Schreiben vermitteln. Was bei unklarer Eigenleistung gilt, behandelt Plagiate und KI-Nutzung in Hausarbeiten; ein ausgefülltes Raster gehört später ins Lehrportfolio.
Typischer Umsetzungskonflikt
Bei Rubrics liegt der Konflikt zwischen Transparenz und Scheingenauigkeit. Ein Raster soll Kriterien sichtbar machen, darf aber wissenschaftliches Urteil nicht so tun lassen, als sei es eine Rechenaufgabe. Ein brauchbares Raster beschreibt Qualitätsunterschiede, lässt Raum für die fachliche Gesamteinschätzung und wird durch Kommentare ergänzt. Ob ein Raster eine Bewertung tatsächlich zuverlässiger oder gerechter macht, ist eine empirische Frage; sie hängt von Fach, Aufgabe und Kalibrierung ab – was die Forschung dazu zeigt und wo sie aufhört, steht oben unter Risiken und Grenzen.
Bei großen Prüfungsgruppen sollte ein Raster vor der Korrektur gemeinsam getestet werden. Zwei oder drei Beispielarbeiten reichen oft, um unklare Kriterien zu erkennen. Danach kann das Raster nachgeschärft werden, bevor alle Arbeiten bewertet sind. Diese Kalibrierung ist besonders wichtig, wenn mehrere Personen korrigieren.
Ein ausgegebenes Raster macht Erwartungen explizit, die sonst nur implizit gelten. Studierende, die akademische Textsorten noch nicht kennen, sind dann auf das Erraten dieser Erwartungen weniger angewiesen.
Ein gutes Raster ersetzt trotzdem kein Feedback. Studierende sollten erkennen, welches Kriterium erfüllt wurde und welche nächste Verbesserung fachlich sinnvoll wäre. Gerade bei Hausarbeiten, Projektberichten oder mündlichen Leistungen ist eine kurze qualitative Rückmeldung oft entscheidend, damit Rubrics nicht wie ein Verwaltungsformular wirken.
Häufige Fragen
Was leistet ein gutes Bewertungsraster?
Ein Bewertungsraster übersetzt allgemeine Erwartungen in Kriterien und beschreibt, woran etwa gute Argumentation erkennbar ist: klare These, logischer Aufbau, Belege, Gegenargumente, Bezug zur Fragestellung. Dadurch wird Bewertung nachvollziehbarer.
Wie viele Kriterien sollte ein Raster enthalten?
Kriterien werden aus Lernzielen und Prüfungsform abgeleitet. Sinnvoll sind fünf bis acht zentrale Dimensionen, weil ein Raster mit 25 Kriterien unhandlich wird.
Wie sollten Leistungsstufen beschrieben werden?
Ein analytisches Raster beschreibt mehrere Stufen pro Kriterium und benennt beobachtbare Unterschiede, statt nur Adjektive zu wiederholen. Das kostet bei der Erstellung Zeit, spart aber bei Korrektur und Rückfragen.
Warum müssen Rubrics vor der Prüfung kommuniziert werden?
Ein nachträglich entwickeltes Raster kann als unfair erlebt werden, wenn es Erwartungen enthält, die vorher nicht erkennbar waren. Kennen Studierende das Raster vorab, können sie ihre Arbeit gezielter planen und überarbeiten.
Wo liegen die Grenzen von Bewertungsrastern?
Zu starre Raster können Kreativität einschränken oder scheingenaue Noten erzeugen. Nicht jede wissenschaftliche Leistung lässt sich vollständig in Kästchen zerlegen, deshalb sollten Rubrics Kriterien transparent machen, ohne das Urteil zu mechanisieren.
- Universität Zürich Teaching Tools: Rubrics und Bewertung.
- Carnegie Mellon University: Creating and Using Rubrics.
- Universität Bremen: Lernergebnisse formulieren.
- Brookhart, S. M. (2018): Appropriate criteria: Key to effective rubrics. Frontiers in Education 3, Artikel 22, 12 Seiten, DOI 10.3389/feduc.2018.00022. Volltext abgerufen am 13. September 2026.
- Simon, M., Forgette-Giroux, R. (2001): A rubric for scoring postsecondary academic skills. Practical Assessment, Research & Evaluation 7, Artikel 18, DOI 10.7275/bh4d-me80. Volltext abgerufen am 13. September 2026.
Stand: 13. September 2026.