Fundamento científico

El fundamento de EvaluatieScore

EvaluatieScore evalúa si un informe de evaluación de proyecto genera un momento de aprendizaje o se queda en un ejercicio de trámite, en 7 piedras de toque derivadas de cuatro marcos de referencia, desarrollados de forma independiente: OECD DAC, UK Gateway Gate 5, PRINCE2 y el modelo de evaluación CIPP. En los Países Bajos, a diferencia de antes del inicio de un proyecto, no existe ningún instrumento obligatorio para la evaluación posterior — incluso el Tribunal de Cuentas neerlandés constató que la capacidad de aprendizaje del Estado en este punto todavía está en pañales. La rúbrica se apoya así en un sólido fundamento normativo, pero EvaluatieScore no afirma que una buena evaluación esté científicamente demostrado que conduzca a mejores proyectos futuros — esa evidencia directa es escasa y sigue siendo, incluso tras una investigación más profunda, el punto más débil de este fundamento. Como instrumento más joven de la suite Dutchmind (15 €), esa modestia encaja: EvaluatieScore comprueba frente a los marcos de referencia, no frente a una garantía de resultados.

Así se fundamenta esta evaluación

La base de conocimiento subyacente se elaboró mediante investigación exhaustiva en seis líneas de búsqueda, complementada con una ronda de seguimiento específica, con verificación adversarial mediante tres comprobaciones independientes por afirmación (37 afirmaciones evaluadas, 20 confirmadas). Solo las afirmaciones confirmadas se incluyen en esta justificación; el material rechazado o no verificado queda explícitamente excluido.

Lo que este instrumento no mide

EvaluatieScore contrasta el informe de evaluación con cuatro marcos normativos (OECD DAC, UK Gateway Gate 5, PRINCE2, CIPP), pero no existe ningún instrumento científico validado que vincule directamente la calidad de un informe de evaluación ex post con el éxito futuro de los proyectos — la única evidencia cuantitativa de ese vínculo tiene más de 25 años y se apoya en una sola fuente, por lo que EvaluatieScore deliberadamente no hace esa afirmación. La herramienta evalúa si el informe cumple estructuralmente con los marcos (independencia, comparación de beneficios, lecciones concretas), no si la organización aplica realmente esas lecciones después — la investigación muestra que el aprendizaje organizado es precisamente débil sin un proceso de implementación dedicado. EvaluatieScore tampoco evalúa si quien redacta el informe mira atrás con sesgo: la fuente revisada por pares más sólida sobre sesgos en gestión de proyectos sitúa ese mecanismo exclusivamente antes del inicio de un proyecto, no en la fase de evaluación, por lo que esto no se detecta en el texto. Al igual que PlanScore, EvaluatieScore aún no cuenta con una medición publicada de consistencia de puntuaciones o calibración de rangos como la de RapportageScore; cada análisis se ejecuta no obstante dos veces por defecto, con una tercera ronda y la mediana si divergen demasiado. Como instrumento más joven de la suite, EvaluatieScore no sustituye una metaevaluación independiente obligatoria como la que exige la RPE neerlandesa para subvenciones superiores a 10 millones de euros o la revisión externa Gate 5 en el Reino Unido — el conjunto de calibración y el fundamento científico más amplio de este producto, como se indica en otro lugar del sitio, siguen en construcción.

Las piedras de toque y su fundamento

1 Alcance, objetivo y preguntas de evaluación

OECD DAC (EvalNet, revisado en 2019) subraya que los criterios de evaluación no deben aplicarse mecánicamente, sino adaptarse al propósito y contexto de la evaluación. El reglamento neerlandés de evaluación periódica (RPE 2022) exige que las preguntas de evaluación se ajusten a la fase del proyecto y aborden explícitamente tanto la eficacia como la eficiencia.

2 Realización de beneficios vs. business case/plan

UK Gateway Gate 5 (Cabinet Office/IPA, ahora NISTA), como revisión externa independiente, evalúa explícitamente si los beneficios del business case se están realizando efectivamente y si existe gobernanza para la medición futura de beneficios. De forma adicional, el criterio de sostenibilidad de la OCDE señala la capacidad institucional y financiera para mantener los beneficios en el tiempo, y la práctica PRINCE2 (End Project Report) describe una comparación entre beneficios realizados y esperados.

3 Eficacia y eficiencia

OECD DAC incluye la eficacia y la eficiencia entre sus seis criterios de evaluación fundamentales. El RPE 2022 exige que los departamentos evalúen periódicamente las políticas y proyectos tanto en eficacia como en eficiencia, cada una fundamentada por separado en lugar de en una conclusión vaga.

4 Calidad metodológica e independencia

El modelo CIPP de Stufflebeam exige que la propia evaluación se someta a estándares de metaevaluación, preferiblemente mediante una metaevaluación independiente. UK Gateway Gate 5 es en sí misma una capa de aseguramiento externa e independiente sobre la Post Implementation Review interna, y el RPE 2022 exige expertos independientes para evaluaciones de subvenciones superiores a 10 millones de euros — tres marcos desarrollados de forma independiente que señalan la independencia como garantía de calidad.

5 Rendimiento en tiempo, coste, calidad, alcance, riesgo

La práctica PRINCE2 (End Project Report y Lessons Report) describe una comparación factual entre estimación y realidad en tiempo, coste y esfuerzo, y una evaluación de la eficacia de los controles de gestión. Se trata de una fuente secundaria (prince2.wiki, no un manual oficial de AXELOS) y por ello se presenta como práctica habitual de PRINCE2, no como requisito oficial.

6 Lecciones aprendidas y acciones de seguimiento

El modelo CIPP de Stufflebeam exige que los informes de evaluación final indiquen explícitamente las lecciones, incluidos los errores a evitar. Williams (2007, University of Southampton ePrints) muestra que, en la práctica, las lecciones de proyectos individuales rara vez se incorporan a la política más amplia de una organización sin un esfuerzo dedicado y un proceso designado — documentar no es lo mismo que aprender.

7 Coherencia, impacto más amplio y sostenibilidad

En su revisión de 2019, OECD DAC añadió el criterio de coherencia: la compatibilidad de una intervención con otras políticas y otras intervenciones en el mismo sector u organización. Los criterios de impacto y sostenibilidad preguntan por efectos más amplios y a largo plazo y por la capacidad institucional para mantener los beneficios.

Afirmaciones clave de la investigación

Cada afirmación se ha verificado de forma adversarial: tres comprobaciones independientes por afirmación, y solo se incluyó lo que resistió.

Cuatro marcos de referencia autorizados, desarrollados de forma independiente entre sí — OECD DAC, UK Gateway Gate 5, PRINCE2 y el modelo CIPP — convergen en casi los mismos componentes de un buen informe de evaluación: comprobar los beneficios frente a la promesa original, validación independiente, criterios predefinidos y lecciones aprendidas orientadas a la acción.

Fuente: OECD DAC (2019); HM Government/Cabinet Office-IPA Gate 5 (2021); PRINCE2-praktijk; Stufflebeam CIPP (2015)

Los criterios de evaluación de la OCDE CAD (revisados en 2019) distinguen seis criterios — pertinencia, coherencia, eficacia, eficiencia, impacto, sostenibilidad — con una advertencia explícita contra su aplicación mecánica.

Fuente: OECD DAC Network on Development Evaluation (EvalNet), Evaluation Criteria, herzien 2019 (DCD/DAC(2019)58 FINAL)

UK Gateway Gate 5 (Cabinet Office/IPA, ahora NISTA) es una revisión de aseguramiento externa e independiente que evalúa explícitamente si los beneficios del business case se están realizando efectivamente y si existe gobernanza para la medición futura de beneficios.

Fuente: HM Government/Cabinet Office-IPA (nu NISTA), Gate 5: Operations Review and Benefits Realisation (Assurance Portfolio Standard, V1.0, juli 2021)

El modelo CIPP de Stufflebeam exige que la propia evaluación se someta a estándares de metaevaluación (utilidad, viabilidad, propiedad, precisión, responsabilidad del evaluador), preferiblemente mediante una metaevaluación independiente.

Fuente: Stufflebeam, D.L. (2015). CIPP Model checklist (2e ed.)

La comisión parlamentaria Elias concluyó que antes del inicio de los proyectos de TI no se reflexiona lo suficiente sobre el cómo y el porqué; las diez reglas básicas resultantes están orientadas exclusivamente ex ante — no existe un instrumento gubernamental neerlandés obligatorio comparable para la evaluación ex post tras la finalización de un proyecto de TI.

Fuente: Commissie-Elias, Eindrapport 'Grip op ICT' + kabinetsreactie (2014/2015)

En 2013, el Tribunal de Cuentas neerlandés declaró literalmente que el proceso de aprendizaje mutuo basado en lecciones generales de las Gateway Reviews realizadas todavía está en una fase inicial, y concluyó que la realización de beneficios de los business cases todavía se supervisa de forma insuficiente.

Fuente: Algemene Rekenkamer (2013), Aanpak van ICT door het Rijk 2012

Williams (2007) muestra que, en la práctica, las lecciones de proyectos individuales rara vez se incorporan a la política más amplia de una organización; sin un esfuerzo dedicado y un proceso designado, las lecciones se pierden y los errores se repiten.

Fuente: Williams, T. (2007). Post-Project Reviews to Gain Effective Lessons Learned (via University of Southampton ePrints)

El Regeling Periodiek Evaluatieonderzoek (RPE 2022) obliga a los ministerios neerlandeses a evaluar periódicamente políticas y proyectos en eficacia y eficiencia, en ciclos de 4 a 7 años, con validación obligatoria por expertos independientes para regímenes de subvención superiores a 10 millones de euros.

Fuente: Regeling periodiek evaluatieonderzoek 2022 (RPE), wetten.overheid.nl

Fuentes principales

  • OECD DAC Network on Development Evaluation (EvalNet). Evaluation Criteria (herzien 2019, DCD/DAC(2019)58 FINAL). one.oecd.org
  • OECD. Evaluation criteria (institutionele samenvattingspagina). oecd.org
  • HM Government / Cabinet Office–IPA (nu NISTA). Gate 5: Operations Review and Benefits Realisation (Assurance Portfolio Standard, V1.0, juli 2021). assets.publishing.service.gov.uk
  • Stufflebeam, D. L. CIPP Evaluation Model Checklist (Second Edition). The Evaluation Center, Western Michigan University — wmich.edu
  • Commissie-Elias. Eindrapport "Grip op ICT" + kabinetsreactie (2014/2015). pianoo.nl
  • Regeling periodiek evaluatieonderzoek 2022 (RPE). wetten.overheid.nl
  • Kotnour, T. (2000). Organizational learning practices in the project management environment. International Journal of Quality & Reliability Management. researchgate.net
  • Algemene Rekenkamer (2013). Aanpak van ICT door het Rijk 2012. rekenkamer.nl + zoek.officielebekendmakingen.nl/kst-33584-2.html
  • Williams, T. (2007). Post-Project Reviews to Gain Effective Lessons Learned. eprints.soton.ac.uk
  • Flyvbjerg, B. (2021/2022). Top Ten Behavioral Biases in Project Management: An Overview. Project Management Journal 52(6), SAGE; arxiv.org/pdf/2202.00125

Basado en nuestro Body of Knowledge, v1.1 (11 juli 2026)