Wissenschaftliche Fundierung
Das Fundament von EvaluatieScore
EvaluatieScore beurteilt, ob ein Projektevaluationsbericht einen Lernmoment liefert oder eine reine Abhak-Übung bleibt, anhand von 7 Prüfsteinen, die aus vier maßgeblichen, unabhängig voneinander entwickelten Rahmenwerken abgeleitet sind: OECD DAC, UK Gateway Gate 5, PRINCE2 und dem CIPP-Evaluationsmodell. In den Niederlanden gibt es, anders als vor dem Start eines Projekts, kein verpflichtendes Instrument für die Evaluation im Nachhinein; selbst der niederländische Rechnungshof stellte fest, dass die Lernfähigkeit des Staates in diesem Punkt noch in den Kinderschuhen steckt. Die Rubrik ruht damit auf einem soliden normativen Fundament, doch EvaluatieScore behauptet nicht, dass eine gute Evaluation wissenschaftlich erwiesen zu besseren zukünftigen Projekten führt — dieser direkte Beleg ist dünn und bleibt, auch nach vertiefter Recherche, die schwächste Stelle dieses Fundaments. Als jüngstes Instrument der Dutchmind-Suite (15 €) passt diese Zurückhaltung: EvaluatieScore prüft gegen die Rahmenwerke, nicht gegen eine Erfolgsgarantie.
So ist diese Bewertung fundiert
Die zugrunde liegende Wissensbasis wurde durch Deep Research entlang sechs Suchlinien sowie eine gezielte Folgerunde erstellt, mit einer kontradiktorischen Verifizierung durch drei unabhängige Prüfungen je Aussage (37 Aussagen geprüft, 20 bestätigt). Nur bestätigte Aussagen sind in dieser Begründung enthalten; abgelehntes oder nicht verifiziertes Material ist ausdrücklich ausgeschlossen.
Was dieses Instrument nicht misst
EvaluatieScore prüft den Evaluationsbericht anhand von vier normativen Rahmenwerken (OECD DAC, UK Gateway Gate 5, PRINCE2, CIPP), doch es existiert kein validiertes wissenschaftliches Instrument, das die Qualität eines Ex-post-Evaluationsberichts direkt mit künftigem Projekterfolg verknüpft — der einzige quantitative Beleg dafür ist über 25 Jahre alt und beruht auf einer einzigen Quelle, weshalb EvaluatieScore diesen Zusammenhang bewusst nicht behauptet. Das Instrument beurteilt, ob der Bericht strukturell den Rahmenwerken entspricht (Unabhängigkeit, Nutzenvergleich, konkrete Lehren), nicht ob die Organisation diese Lehren anschließend tatsächlich anwendet — organisiertes Lernen erweist sich der Forschung zufolge ohne gezielten, zugewiesenen Umsetzungsprozess gerade als schwach. EvaluatieScore beurteilt auch nicht, ob die Verfasser des Berichts gefärbt zurückblicken: Die stärkste verfügbare peer-reviewte Quelle zu Verzerrungen im Projektmanagement verortet diesen Mechanismus ausschließlich vor dem Projektstart, nicht in der Evaluationsphase, im Text wird dies also nicht erkannt. Wie bei PlanScore gibt es für EvaluatieScore noch keine separate, veröffentlichte Messung der Score-Konsistenz oder Rangfolge-Kalibrierung wie bei RapportageScore; jede Analyse läuft jedoch standardmäßig zweimal, mit einem dritten Durchlauf und dem Median bei zu großer Streuung. Als jüngstes Instrument der Suite ersetzt EvaluatieScore keine verpflichtende, unabhängige Metaevaluation, wie sie die niederländische RPE bei Subventionen über 10 Millionen Euro verlangt oder die externe Gate-5-Prüfung im Vereinigten Königreich — Kalibrierungsset und breitere wissenschaftliche Fundierung dieses Produkts befinden sich, wie an anderer Stelle auf der Website vermerkt, noch im Aufbau.
Die Prüfsteine und ihr Fundament
1 Umfang, Ziel & Evaluationsfragen
OECD DAC (EvalNet, überarbeitet 2019) betont, dass Evaluationskriterien nicht mechanisch angewendet werden dürfen, sondern auf Zweck und Kontext der Evaluation zugeschnitten sein müssen. Die niederländische Regeling Periodiek Evaluatieonderzoek (RPE 2022) verlangt, dass Evaluationsfragen zur Projektphase passen und ausdrücklich sowohl Wirksamkeit als auch Wirtschaftlichkeit behandeln.
2 Nutzenrealisierung vs. Business Case/Plan
UK Gateway Gate 5 (Cabinet Office/IPA, jetzt NISTA) prüft als unabhängige externe Review ausdrücklich, ob die Nutzen aus dem Business Case tatsächlich realisiert werden und ob eine Governance für die künftige Nutzenmessung besteht. Ergänzend verweist das OECD-Nachhaltigkeitskriterium auf die institutionelle und finanzielle Fähigkeit, Nutzen über die Zeit aufrechtzuerhalten, und die PRINCE2-Praxis (End Project Report) beschreibt einen Vergleich von realisierten und erwarteten Nutzen.
3 Wirksamkeit & Wirtschaftlichkeit
OECD DAC nennt Wirksamkeit und Wirtschaftlichkeit als zwei der sechs Kernkriterien der Evaluation. Die RPE 2022 verlangt, dass Ministerien Politik und Projekte periodisch sowohl auf Wirksamkeit als auch auf Wirtschaftlichkeit bewerten, jeweils separat begründet statt in einer vagen Gesamtschlussfolgerung.
4 Methodische Qualität & Unabhängigkeit
Stufflebeams CIPP-Modell verlangt, dass die Evaluation selbst an Metaevaluations-Standards gemessen wird, vorzugsweise durch eine unabhängige Metaevaluation. UK Gateway Gate 5 ist selbst eine unabhängige, externe Assurance-Ebene oberhalb der internen Post Implementation Review, und die RPE 2022 schreibt unabhängige Experten für Subventionsevaluationen über 10 Millionen Euro vor — drei unabhängig voneinander entwickelte Rahmenwerke, die jeweils Unabhängigkeit als Qualitätssicherung benennen.
5 Leistung bei Zeit, Kosten, Qualität, Umfang, Risiko
Die PRINCE2-Praxis (End Project Report und Lessons Report) beschreibt einen faktischen Vergleich von Schätzung und Ist-Wert bei Zeit, Kosten und Aufwand sowie eine Bewertung der Wirksamkeit von Management-Kontrollen. Dies ist eine Sekundärquelle (prince2.wiki, kein offizielles AXELOS-Manual) und wird daher als gängige PRINCE2-Praxis dargestellt, nicht als offizielle Anforderung.
6 Lessons Learned & Folgemaßnahmen
Stufflebeams CIPP-Modell verlangt, dass Abschlussevaluationsberichte ausdrücklich Lehren benennen, einschließlich zu vermeidender Fehler. Williams (2007, University of Southampton ePrints) zeigt, dass Lehren aus einzelnen Projekten in der Praxis selten ohne gezielten Aufwand und einen dafür vorgesehenen Prozess in die breitere Politik einer Organisation aufgenommen werden — Dokumentieren ist nicht dasselbe wie Lernen.
7 Kohärenz, breitere Wirkung & Nachhaltigkeit
In der Überarbeitung von 2019 fügte OECD DAC das Kohärenzkriterium hinzu: die Vereinbarkeit einer Intervention mit anderer Politik und anderen Interventionen im selben Sektor oder derselben Organisation. Die Impact- und Nachhaltigkeitskriterien fragen nach breiteren, langfristigen Effekten und der institutionellen Fähigkeit, Nutzen aufrechtzuerhalten.
Kernaussagen aus der Forschung
Jede Aussage unten wurde adversariell verifiziert: drei unabhängige Prüfungen pro Aussage — aufgenommen wurde nur, was standhielt.
Vier maßgebliche, unabhängig voneinander entwickelte Rahmenwerke — OECD DAC, UK Gateway Gate 5, PRINCE2 und das CIPP-Modell — konvergieren nahezu auf dieselben Bausteine für einen guten Evaluationsbericht: Nutzen gegen das ursprüngliche Versprechen prüfen, unabhängige Validierung, vorab festgelegte Kriterien und handlungsorientierte Lessons Learned.
Quelle: OECD DAC (2019); HM Government/Cabinet Office-IPA Gate 5 (2021); PRINCE2-praktijk; Stufflebeam CIPP (2015)
Die OECD-DAC-Evaluationskriterien (überarbeitet 2019) unterscheiden sechs Kriterien — Relevanz, Kohärenz, Wirksamkeit, Wirtschaftlichkeit, Impact, Nachhaltigkeit — mit einer ausdrücklichen Warnung vor mechanischer Anwendung.
Quelle: OECD DAC Network on Development Evaluation (EvalNet), Evaluation Criteria, herzien 2019 (DCD/DAC(2019)58 FINAL)
UK Gateway Gate 5 (Cabinet Office/IPA, jetzt NISTA) ist eine unabhängige, externe Assurance-Review, die ausdrücklich prüft, ob die Nutzen aus dem Business Case tatsächlich realisiert werden und ob eine Governance für die künftige Nutzenmessung besteht.
Quelle: HM Government/Cabinet Office-IPA (nu NISTA), Gate 5: Operations Review and Benefits Realisation (Assurance Portfolio Standard, V1.0, juli 2021)
Stufflebeams CIPP-Modell verlangt, dass die Evaluation selbst an Metaevaluations-Standards (Utility, Feasibility, Propriety, Accuracy, Evaluator Accountability) gemessen wird, vorzugsweise durch eine unabhängige Metaevaluation.
Quelle: Stufflebeam, D.L. (2015). CIPP Model checklist (2e ed.)
Die Elias-Kommission stellte fest, dass vor dem Start von IKT-Projekten zu wenig über das Wie und Warum nachgedacht wird; die daraus entstandenen zehn Grundregeln sind ausschließlich ex-ante ausgerichtet — es gibt kein vergleichbares verpflichtendes Instrument der niederländischen Regierung für die Ex-post-Evaluation nach Abschluss eines IKT-Projekts.
Quelle: Commissie-Elias, Eindrapport 'Grip op ICT' + kabinetsreactie (2014/2015)
Der niederländische Rechnungshof erklärte 2013 wörtlich, dass der gegenseitige Lernprozess auf Basis allgemeiner Lehren aus durchgeführten Gateway Reviews noch in einem Anfangsstadium sei, und stellte fest, dass die Realisierung von Nutzen aus Business Cases noch zu wenig überwacht wird.
Quelle: Algemene Rekenkamer (2013), Aanpak van ICT door het Rijk 2012
Williams (2007) zeigt, dass Lehren aus einzelnen Projekten in der Praxis selten in die breitere Politik einer Organisation aufgenommen werden; ohne gezielten Aufwand und einen dafür vorgesehenen Prozess gehen Lehren verloren und Fehler wiederholen sich.
Quelle: Williams, T. (2007). Post-Project Reviews to Gain Effective Lessons Learned (via University of Southampton ePrints)
Die Regeling Periodiek Evaluatieonderzoek (RPE 2022) verpflichtet niederländische Ministerien, Politik und Projekte periodisch auf Wirksamkeit und Wirtschaftlichkeit zu evaluieren, in Zyklen von 4 bis 7 Jahren, mit verpflichtender unabhängiger Expertenvalidierung bei Subventionsregelungen über 10 Millionen Euro.
Quelle: Regeling periodiek evaluatieonderzoek 2022 (RPE), wetten.overheid.nl
Zentrale Quellen
- OECD DAC Network on Development Evaluation (EvalNet). Evaluation Criteria (herzien 2019, DCD/DAC(2019)58 FINAL). one.oecd.org
- OECD. Evaluation criteria (institutionele samenvattingspagina). oecd.org
- HM Government / Cabinet Office–IPA (nu NISTA). Gate 5: Operations Review and Benefits Realisation (Assurance Portfolio Standard, V1.0, juli 2021). assets.publishing.service.gov.uk
- Stufflebeam, D. L. CIPP Evaluation Model Checklist (Second Edition). The Evaluation Center, Western Michigan University — wmich.edu
- Commissie-Elias. Eindrapport "Grip op ICT" + kabinetsreactie (2014/2015). pianoo.nl
- Regeling periodiek evaluatieonderzoek 2022 (RPE). wetten.overheid.nl
- Kotnour, T. (2000). Organizational learning practices in the project management environment. International Journal of Quality & Reliability Management. researchgate.net
- Algemene Rekenkamer (2013). Aanpak van ICT door het Rijk 2012. rekenkamer.nl + zoek.officielebekendmakingen.nl/kst-33584-2.html
- Williams, T. (2007). Post-Project Reviews to Gain Effective Lessons Learned. eprints.soton.ac.uk
- Flyvbjerg, B. (2021/2022). Top Ten Behavioral Biases in Project Management: An Overview. Project Management Journal 52(6), SAGE; arxiv.org/pdf/2202.00125
Basierend auf unserem Body of Knowledge, v1.1 (11 juli 2026)