Fundamentos Metodológicos del Reporte Assessment / Talent
Marco conceptual, criterios de selección teórica, arquitectura de medición, salvaguardas metodológicas y posicionamiento frente a instrumentos psicométricos formales.
Qué es este instrumento
El Reporte Assessment/Talent de TeamCook es un instrumento de observación conductual estructurada que evalúa siete dimensiones de talento a partir del análisis del comportamiento verbal de los participantes durante una sesión cooperativa bajo presión.
El reporte no es un test psicométrico autoadministrado ni pretende serlo. Pertenece a una tradición metodológica distinta y complementaria: la de los assessment centers conductuales, cuya práctica sistemática comenzó en los años 50 con los estudios de AT&T (Bray & Grant, 1966) y que hoy constituye uno de los enfoques con mayor validez predictiva documentada para la evaluación de potencial gerencial. TeamCook traslada esa lógica observacional a un entorno gamificado estandarizado y aplica análisis computacional de lenguaje sobre la transcripción de la sesión, con evidencia textual citada como respaldo de cada inferencia.
Una nota sobre el estándar de este documento: el marco teórico del instrumento se apoya exclusivamente en literatura académica abierta, contemporánea y verificable — incluyendo el meta-análisis de referencia del campo de la selección de personal (Sackett, Zhang, Berry & Lievens, 2022, Journal of Applied Psychology) y la taxonomía estándar de desempeño adaptativo (Pulakos et al., 2000). Se evitó deliberadamente construir sobre tipologías comerciales de décadas pasadas o marcos sin respaldo en revistas con referato. Cada fuente citada puede ser consultada y evaluada de forma independiente por el lector.
TeamCook produce evidencia conductual observacional en contexto cooperativo estandarizado bajo presión. Complementa a los instrumentos psicométricos de autorreporte (Hogan, Big Five) aportando lo que ellos no capturan: comportamiento real, no percepción de sí mismo.
Marco conceptual
1.1 La tradición metodológica: assessment center conductual
Metodológicamente, TeamCook pertenece a la familia de los assessment centers: evaluación de comportamiento observable en ejercicios situacionales estandarizados. Esta tradición, iniciada formalmente en el Management Progress Study de AT&T (Bray & Grant, 1966) — un estudio longitudinal que siguió carreras gerenciales durante más de dos décadas y demostró la capacidad predictiva de la observación conductual — y consolidada en las Guidelines and Ethical Considerations for Assessment Center Operations (International Taskforce, 2015), se distingue de los tests de autorreporte en un punto esencial: no le pregunta a la persona cómo cree que se comporta; observa cómo se comporta efectivamente.
Los ejercicios grupales sin roles asignados (leaderless group discussions) son uno de los componentes clásicos del assessment center, con décadas de investigación sobre su capacidad para revelar liderazgo emergente, influencia social y toma de decisiones bajo presión. La sesión TeamCook funciona estructuralmente como un ejercicio grupal sin roles asignados, con tres propiedades que fortalecen la observación:
- Presión como filtro. La presión de tiempo y el caos controlado (comandas con vencimiento, fuegos, cambios de lado) actúan como filtro de autenticidad: bajo presión disminuye la capacidad de sostener comportamiento impostado.
- Estandarización del estímulo. El entorno es idéntico para todos los equipos evaluados: mismas mecánicas, mismos tiempos, mismos tipos de disrupción. Esa estandarización es la condición que permite comparar observaciones dentro del grupo.
- Interdependencia forzada. La cooperación es estructuralmente obligatoria (la cocina dividida impide completar comandas sin coordinación), lo que garantiza que las dimensiones interpersonales tengan oportunidad de manifestarse.
1.2 Por qué un juego: el fundamento del contexto lúdico de observación
Queda una pregunta legítima por responder: si el objetivo es observar comportamiento, ¿por qué hacerlo en un videojuego de cocina y no en un ejercicio corporativo convencional? La respuesta no es estética ni de marketing — es metodológica, y cuenta con su propia línea de investigación: la del game-based assessment y las simulaciones para evaluación de personas (Fetzer & Tuzinski, 2013; Landers, 2014).
El juego cumple tres funciones de medición que un ejercicio convencional cumple peor:
- Medición no intrusiva (stealth assessment). La evaluación ocurre mientras la persona juega, sin interrumpir la experiencia con preguntas ni recordatorios de que está siendo evaluada. Este principio — acuñado como stealth assessment por Shute (2011) — reduce la ansiedad de evaluación y la conducta de examen, dos contaminantes clásicos de los assessment tradicionales. En TeamCook nadie completa un formulario: el dato se produce jugando.
- Autenticidad por inmersión. La inmersión que produce un juego bien diseñado — el estado de flow descrito por Csikszentmihalyi (1990) — disminuye el auto-monitoreo consciente. Una persona absorbida por coordinar la entrega de una comanda a contrarreloj no está administrando su imagen frente al evaluador: está siendo ella misma bajo presión. Este es un argumento de calidad de la medición, no de entretenimiento.
- Participación genuina en lugar de cumplimiento. La literatura de motivación (Self-Determination Theory; Deci & Ryan, 2000) explica por qué el formato lúdico genera compromiso genuino en lugar de cumplimiento formal: el juego satisface las necesidades de autonomía, competencia y relación que la teoría identifica como base de la motivación intrínseca. Los indicadores de engagement observados en las sesiones TeamCook (participación sostenida, comentarios voluntarios post-sesión) son consistentes con este marco.
A estas tres funciones se suma el fundamento pedagógico del ciclo completo de la sesión: la secuencia jugar → reflexionar → conceptualizar → volver a jugar reproduce deliberadamente el ciclo de aprendizaje experiencial de Kolb (1984). El debrief no es un cierre protocolar: es la fase del ciclo donde la experiencia se convierte en aprendizaje verbalizado — y, para el instrumento, la fase donde las dimensiones reflexivas se vuelven observables. La ponderación 1.5x del debrief descrita en la sección 3.1 es la traducción operativa de este fundamento.
El framework NO utiliza taxonomías de tipos de jugador (Bartle) ni marcos de diseño gamificado (Octalysis) como base de inferencia del reporte. Estos marcos son herramientas de diseño de experiencias — y como tales informaron el diseño del juego TeamCook — pero no son instrumentos de medición validados y no participan del análisis de talento. La distinción entre marcos de diseño y marcos de medición es un límite metodológico que este instrumento respeta de forma explícita.
1.3 El insumo de análisis: comportamiento verbal
El análisis se realiza exclusivamente sobre la transcripción del audio de la sesión. Esta decisión de diseño tiene fundamento metodológico: el comportamiento verbal en interacción grupal es un indicador validado de procesos de coordinación, liderazgo emergente y funcionamiento de equipo. La tradición de Interaction Process Analysis (Bales, 1950) y la investigación contemporánea en análisis computacional del lenguaje en equipos de trabajo sustentan la inferencia de constructos conductuales a partir del habla situada en contexto.
El sistema no analiza rasgos de personalidad profundos ni estados internos: analiza actos de habla observables — quién propone, quién coordina, quién verifica, quién pregunta, quién integra el aporte de otros, quién reflexiona sobre lo sucedido — y los mapea contra indicadores conductuales predefinidos por dimensión.
1.4 Criterios de selección del marco teórico
El marco teórico del instrumento no es una acumulación de citas: es el resultado de una decisión de diseño deliberada. Toda teoría candidata a integrar el framework debió superar simultáneamente cuatro criterios:
- Observabilidad en el contexto. El constructo debe poder manifestarse y observarse en 90-120 minutos de interacción cooperativa verbal bajo presión. Quedaron excluidas por este criterio teorías valiosas pero no observables en este formato (motivación intrínseca profunda, valores personales, rasgos clínicos).
- Respaldo académico verificable. Cada fuente debe estar publicada en literatura académica con referato (peer review) o constituir el estándar profesional documentado de su campo. Se excluyeron tipologías comerciales de origen pre-científico y marcos de divulgación sin respaldo empírico verificable.
- Reconocibilidad para la práctica de RRHH. Los constructos elegidos (Learning Agility, high-potential, trayectorias duales de carrera, desempeño adaptativo) forman parte del vocabulario operativo de los equipos de talento corporativos. Un instrumento cuyos resultados se expresan en el lenguaje que la organización ya usa se integra a los procesos de decisión reales.
- Independencia de marcas registradas. El marco se construyó exclusivamente sobre literatura abierta y citable, sin dependencia de modelos con marca registrada cuyo uso requeriría licenciamiento o generaría exposición legal.
Este filtro cuádruple explica tanto lo que el framework incluye como lo que deliberadamente deja afuera.
1.5 Tres tradiciones académicas integradas
El framework Assessment/Talent no es un modelo teórico nuevo. Es una síntesis operacionalizada de tres corrientes consolidadas en la psicología organizacional y la gestión del talento:
a) Performance Prediction (predicción de desempeño)
La investigación en selección de personal ha establecido con solidez qué variables predicen desempeño laboral. El meta-análisis de Schmidt & Hunter (1998) —uno de los trabajos más citados en la historia de la disciplina— y su actualización por Sackett, Zhang, Berry & Lievens (2022) constituyen la referencia obligada del campo. De esta tradición el framework toma dos elementos: la centralidad de la proactividad y la conciencia como predictores estables (operacionalizados en Drive & Initiative y Operational Excellence) y el principio de que las muestras de comportamiento predicen mejor que los autorreportes.
b) High Potential Identification (identificación de alto potencial)
La distinción entre desempeño actual y potencial futuro es el eje de la literatura de high-potentials. El framework se apoya en dos fuentes principales: el modelo de Learning Agility (Lombardo & Eichinger, 2000; De Meuse, Dai & Hallenbeck, 2010), que identifica la agilidad de aprendizaje como el predictor más robusto de éxito en roles futuros de mayor complejidad; y el trabajo de Ready, Conger & Hill (Harvard Business Review, 2010) sobre los marcadores conductuales del empleado de alto potencial. Los cuatro High-Potential Indicators del reporte operacionalizan directamente esta tradición.
c) Strengths-Based Positioning (posicionamiento por fortalezas)
De la psicología positiva aplicada al trabajo (Buckingham & Clifton, 2001) el framework toma un principio de diseño — no un instrumento de medición: el reporte identifica fortalezas diferenciadoras relativas al grupo evaluado, no solo scores absolutos. Este enfoque orienta el reporte hacia el posicionamiento (quién aporta qué) más que hacia rankings.
Las siete dimensiones: definición, anclaje y medición
Cada dimensión tiene definición operacional, indicadores conductuales positivos y negativos, anclas de puntuación por rango (BARS; Smith & Kendall, 1963) y anti-patterns explícitos: confusiones que el sistema tiene instrucción de no cometer.
| Dimensión | Peso | Definición operacional | Anclaje teórico principal |
|---|---|---|---|
| Drive & Initiative | 15% | Energía proactiva, ownership, acción sin instrucción, esfuerzo sostenido bajo presión | Proactive Personality (Bateman & Crant, 1993); Grit (Duckworth et al., 2007); Conscientiousness |
| Learning Agility | 15% | Capacidad de aprender de la experiencia, integrar feedback y mejorar entre iteraciones | Learning Agility (Lombardo & Eichinger, 2000; De Meuse et al., 2010) |
| Adaptabilidad | 10% | Ajuste conductual efectivo ante cambios de contexto e imprevistos | Adaptive Performance (Pulakos et al., 2000) |
| Strategic Thinking | 15% | Anticipación, priorización, mirada de sistema, conexión entre acciones y objetivos | Systems Thinking (Senge, 1990); cognición gerencial |
| Operational Excellence | 10% | Ejecución precisa, verificación, atención al detalle, cierre de calidad | Task Performance (Borman & Motowidlo, 1993) |
| Social Impact | 15% | Influencia sin imposición, cohesión grupal, gestión de conflicto, comunicación efectiva | Influence without Authority (Cohen & Bradford, 1990) |
| Leadership Readiness | 20% | Disposición y capacidad de asumir dirección, decidir bajo incertidumbre y sostener foco grupal | Liderazgo emergente en leaderless group discussions (Thornton & Rupp, 2006) |
El mayor peso de Leadership Readiness (20%) responde al propósito declarado del reporte: apoyar decisiones de identificación de potencial directivo y planes de sucesión. Los pesos son parte del diseño del instrumento y están documentados de forma transparente en la guía del facilitador.
2.1 El Talent Composite Score
El Composite Score (0-100) es una suma ponderada de las siete dimensiones. Su función no es producir un ranking sino ubicar a cada persona en una de cuatro categorías de lectura (Star 80-100, Solid 65-79, Emerging 50-64, Stretch <50) que orientan la conversación de desarrollo. El diseño contempla explícitamente el caso del Star de contribución individual: una persona puede alcanzar categoría Star con Leadership Readiness moderado — el reporte lo señala para evitar la lectura errónea de que todo talento alto implica trayectoria directiva.
2.2 Fit para tipos de rol
El reporte evalúa ajuste a cuatro arquetipos (Leadership Track, Individual Contributor Expert, Cross-Functional Bridge, Execution Specialist) mediante reglas de corte conjuntivas y explícitas — por ejemplo, Leadership Track exige simultáneamente Leadership Readiness ≥ 70, Strategic Thinking ≥ 60 y Social Impact ≥ 60. El uso de umbrales conjuntivos publicados evita la discrecionalidad y responde a la distinción consolidada entre trayectoria de gestión y de especialista (dual career ladder; Schein, 1978). No calificar en ningún arquetipo no constituye un veredicto negativo: el reporte lo informa como perfil que requiere evaluación más extensa.
2.3 Operacionalización: cómo se mide cada dimensión
Cada dimensión se mide mediante una rúbrica de cuatro componentes: (a) definición operacional; (b) indicadores conductuales positivos y negativos, expresados como verbalizaciones tipo; (c) escalas ancladas en comportamiento (BARS) que describen qué caracteriza cada rango de score en cinco niveles; y (d) anti-patterns — confusiones frecuentes que el sistema tiene instrucción explícita de no cometer. La rúbrica completa forma parte del protocolo propietario; la siguiente tabla presenta una muestra representativa de las señales verbales que el sistema busca en cada dimensión, y de lo que tiene prohibido confundir.
| Dimensión | Señales verbales que suman (ejemplos) | No se confunde con (anti-patterns) |
|---|---|---|
| Drive & Initiative | Asume tareas sin que se lo pidan ("Yo voy al sector A", "Empiezo a cortar lechuga"); sostiene energía verbal durante toda la partida; vuelve a la acción rápidamente después de un error | Hablar mucho (puede ser Social Impact); liderar (es Leadership Readiness); ejecutar instrucciones recibidas (es Operational Excellence) |
| Learning Agility | Mejora observable entre rondas; hace preguntas para entender, no para defenderse; reflexiona sobre el propio proceso en el debrief ("lo que nos pasó fue que...") | Hablar de cambios sin integrarlos (describir no es aprender); adaptarse a la mecánica del juego (eso es Adaptabilidad) |
| Adaptabilidad | Se reorganiza rápido ante cambios de lado o de rol; recupera el ritmo tras un fracaso; acepta cambiar el modo de hacer cuando cambia el contexto | Obedecer órdenes (cumplir no es adaptarse); aceptar sin opinión (puede ser pasividad); aprender (Learning Agility es cognitivo; Adaptabilidad es conductual) |
| Strategic Thinking | Anticipa antes de actuar; organiza secuencias y prioridades ("primero X porque después viene Y"); conecta acciones concretas con el objetivo de la partida | Verbalización abundante sin anticipación; coordinar tareas sin explicitar el para qué (es operativo, no estratégico) |
| Operational Excellence | Verifica antes de entregar (revisa ingredientes, confirma la receta); advierte faltantes o errores de otros; completa lo que empieza | Velocidad (rápido no es preciso); hablar del plan sin ejecutarlo; estar ocupado sin cierre de calidad |
| Social Impact | Sus propuestas son adoptadas por el grupo; cohesiona en momentos difíciles; reconoce explícitamente el aporte de otros | Hablar mucho sin efecto observable; dirigir (es Leadership Readiness); amabilidad sin impacto en la dinámica grupal |
| Leadership Readiness | Asume dirección sin nombramiento previo; distribuye trabajo con criterio; decide en momentos de incertidumbre y sostiene el foco grupal | Hablar fuerte o con autoridad aparente; seniority o jerarquía externa (prohibido inferir por cargo); ocupar un rol asignado (ser nombrado no es asumir liderazgo) |
La columna de anti-patterns merece subrayarse: es la principal defensa del instrumento contra el error de atribución más común en la evaluación de grupos — confundir visibilidad con competencia. Cada dimensión tiene documentado qué comportamiento superficialmente similar NO debe puntuar, y esa distinción está codificada como instrucción explícita, no librada al criterio del momento.
2.4 Anclas universales de puntuación y distribución esperada
Además de los anchors específicos de cada dimensión, el protocolo define una escala universal de interpretación de scores con frecuencias esperadas en un grupo típico. Esta tabla es la referencia que impide tanto la inflación de puntajes (todos altos) como la severidad artificial (todos bajos):
| Rango | Significado | Frecuencia esperada |
|---|---|---|
| 90-100 | Excepcional — líder de la dimensión en el grupo | ~5% |
| 75-89 | Alto — consistente y diferenciado | ~20-25% |
| 60-74 | Sólido — competente y confiable | ~30-35% |
| 45-59 | Funcional — adecuado sin destacar | ~25-30% |
| 30-44 | Limitado — por debajo del estándar | ~10-15% |
| 0-29 | Mínimo — apenas observable o ausente | ~3-5% |
Las frecuencias son orientativas, no prescriptivas: el protocolo instruye explícitamente no forzar la normalización si el grupo evaluado es excepcional o débil en alguna dimensión. La distribución esperada funciona como control de calibración, no como cuota.
2.5 Elegibilidad para scoring: quién recibe perfil completo
No toda persona presente en una sesión recibe scores. El protocolo define tres categorías de elegibilidad con criterios explícitos, aplicadas sobre la lista oficial de participantes validada por el facilitador:
- Categoría A — Perfil completo: quien registra cinco o más intervenciones operativas distribuidas en las fases de la sesión, y cuyas intervenciones permiten inferir al menos cuatro de las siete dimensiones con confianza media-alta. Solo esta categoría recibe los siete scores, el Composite, la categoría de talento, el fit-para-rol, los HPI y un mínimo de cuatro citas textuales del transcript como evidencia.
- Categoría B — Evidencia insuficiente: quien estuvo presente y habló, pero con menos intervenciones operativas que el umbral, o con verbalizaciones que no permiten inferir suficientes dimensiones, o con limitaciones documentadas (problemas técnicos, entrada tardía). No recibe scores especulativos: su perfil se publica con la marca "evidencia insuficiente" y la razón observable documentada.
- Categoría C — Solo presente en apertura: quien solo participó de la apertura sin ninguna intervención operativa posterior. No se incluye en el conteo ni recibe perfil.
A nivel de dimensión individual rige además el umbral mínimo de evidencia: cada score requiere al menos dos verbalizaciones independientes que lo respalden. Con una sola, el score se emite como tentativo con caveat explícito. Este doble filtro — elegibilidad por persona y suficiencia por dimensión — es lo que sostiene la afirmación central del instrumento: ningún número del reporte carece de evidencia citable.
Estos umbrales tienen una consecuencia directa: el diseño de la sesión es parte del instrumento. La sesión debe garantizar que cada participante genere suficiente evidencia verbal, en las fases correctas, sin contaminación del facilitador. Por esa razón, la metodología TeamCook incluye un protocolo de facilitación específico para sesiones de assessment — el Guión del Facilitador — que estructura tiempos, consignas e intervenciones para maximizar la calidad de la medición. La facilitación no es logística: es la primera etapa del instrumento.
2.6 Fortalezas diferenciadoras, áreas de desarrollo e indicadores de potencial
Tres salidas del reporte tienen algoritmos de construcción específicos que conviene documentar:
- Fortalezas diferenciadoras (algoritmo relativo al grupo): las "Top 3 fortalezas" de cada perfil NO son los tres scores absolutos más altos. Se calculan como diferencial respecto del grupo: score de la persona menos promedio grupal en cada dimensión, y se seleccionan los tres diferenciales positivos mayores. Una persona con score 70 donde el grupo promedia 50 tiene una fortaleza diferenciadora más relevante que un 75 donde el grupo ronda 78. Si ningún diferencial supera los 10 puntos, el sistema recurre a los scores absolutos como fallback documentado.
- Áreas de desarrollo (con prohibición de inventar gaps): son las dos dimensiones con score más bajo del perfil, pero solo se reportan como críticas si están por debajo de 60. Si todas las dimensiones del perfil están en 60 o más, el protocolo prohíbe inventar gaps: el reporte declara "perfil sólido sin gaps críticos". El tono está prescripto como constructivo — se formula como margen de desarrollo con foco accionable, nunca como debilidad.
- High-Potential Indicators (criterios conjuntivos): los cuatro indicadores (Learning Mindset, Drive Sostenido, Influencia Social, Agilidad Mental) se evalúan en tres niveles mediante criterios conjuntivos: el nivel Alto exige la co-ocurrencia de varias señales, no una sola. Por ejemplo, Learning Mindset Alto requiere simultáneamente mejora notoria entre fases, integración proactiva de feedback y reflexión sobre el propio proceso. Este diseño conjuntivo hace que los niveles Altos sean informativos: no se alcanzan por un buen momento aislado.
Complementariamente, el protocolo incorpora una capa de validación cruzada entre estas salidas: perfiles con combinaciones incoherentes (por ejemplo, HPI de Influencia Social alto con Social Impact bajo) disparan re-evaluación antes de emitir el reporte, como se describe en la sección 3.3.
Arquitectura de medición
3.1 Segmentación por fases y ponderación diferencial de evidencia
Una sesión TeamCook se segmenta en seis fases con distinto valor analítico. Esta ponderación diferencial responde a un problema conocido de los ejercicios de simulación: el contexto de acción sobreexpresa las dimensiones ejecutivas y subexpresa las reflexivas. El diseño lo compensa sobre-ponderando las fases donde el comportamiento reflexivo tiene oportunidad de manifestarse.
| Fase | Contenido | Ponderación | Dimensiones que mejor revela |
|---|---|---|---|
| Apertura | Presentaciones, encuadre del facilitador | 0.3x | — (casi descartada) |
| Partida de prueba | Ronda exploratoria de aprendizaje de controles | 0.7x | — (sub-ponderada) |
| Conversación pre-partida | Planificación del equipo antes de cada partida puntuable | 1.5x | Strategic Thinking, Leadership Readiness, Social Impact |
| Partida activa | Juego bajo presión (5-10 min) | 1.0x | Drive & Initiative, Operational Excellence, Adaptabilidad |
| Pausa entre partidas | Ajustes breves | 0.7x | — (sub-ponderada) |
| Debriefing final | Reflexión grupal guiada | 1.5x | Learning Agility, Strategic Thinking, Social Impact |
La lógica es análoga a la de un assessment center multi-ejercicio: distintas situaciones elicitan distintos constructos, y el evaluador pondera cada observación según la situación en que ocurrió.
3.2 Reglas de scoring: disciplina de evidencia
El sistema opera bajo diez reglas de scoring explícitas que constituyen la disciplina de evidencia del instrumento. Las más relevantes:
- Solo evidencia verbal observable. El sistema tiene prohibido inferir a partir de cámara, apariencia, edad, género o posición jerárquica. Toda inferencia debe anclarse en verbalizaciones citables.
- Umbral mínimo de evidencia. Cada score debe estar respaldado por al menos dos verbalizaciones independientes. Con una sola, el score se marca como tentativo con caveat explícito.
- Control de verbosidad. Volumen de habla no equivale a score alto. El sistema distingue entre hablar mucho y demostrar la dimensión — un anti-pattern documentado para cada una de las siete dimensiones.
- Comportamiento sobre descripción. Describir un comportamiento no equivale a exhibirlo. "Deberíamos habernos organizado mejor" es evidencia de reflexión, no de organización.
- Presión como filtro de autenticidad. La evidencia emitida bajo presión pesa más que la emitida en momentos de calma, por su mayor resistencia a la impostación.
- Mejora entre fases. La mejora observable entre rondas es señal de alta calidad para Learning Agility — el instrumento aprovecha la estructura iterativa de la sesión como medida repetida intra-sujeto.
3.3 Validación cruzada de coherencia inter-dimensión
El sistema aplica una capa de control de coherencia sobre los perfiles generados. Combinaciones de scores estadísticamente improbables o conceptualmente incoherentes (por ejemplo, Strategic Thinking alto con Learning Agility bajo, o Leadership Readiness alto con Social Impact bajo) disparan una instrucción de re-evaluación antes de emitir el reporte. Este mecanismo cumple la función de las reuniones de consenso entre evaluadores de un assessment center tradicional.
3.4 El protocolo de instrucción: anatomía del sistema de análisis
El análisis es ejecutado por un modelo de lenguaje de gran escala operando bajo un protocolo de instrucción propietario de más de 35.000 caracteres, desarrollado con el acompañamiento de una psicometrista senior con experiencia en consultoría global de talento. El protocolo no es un pedido genérico de "analizá esta conversación": es un instrumento de evaluación completo codificado como instrucción. El texto íntegro del protocolo constituye propiedad intelectual central de TeamCook y no se publica — el mismo criterio que aplican los instrumentos formales del mercado respecto de sus algoritmos de scoring.
| Componente del protocolo | Contenido y función |
|---|---|
| 1. Definición de rol experto | Instruye al modelo a operar como evaluador experto en assessment observacional, con la distinción obligatoria de que el resultado no es un test psicométrico formal validado |
| 2. Contexto completo del juego | Descripción exhaustiva de mecánicas, roles, estaciones, disrupciones y recursos (incluida la pausa), para interpretar cada verbalización en su contexto real |
| 3. Segmentación de fases | Marcadores verbales para identificar las 6 fases y tabla de ponderación diferencial (0.3x a 1.5x) |
| 4. Framework de 7 dimensiones | Definición operacional, indicadores positivos y negativos, escalas BARS por rango, anti-patterns explícitos por dimensión |
| 5. Reglas de scoring | Las 10 reglas de disciplina de evidencia |
| 6. Fórmulas y umbrales | Cálculo del Composite con pesos publicados, categorías, reglas conjuntivas de fit-para-rol y niveles de los HPI |
| 7. Reglas de integridad del censo | Lista oficial como ground truth, prohibición de omisión y fusión, desambiguación de nombres, auditoría final obligatoria |
| 8. Validación cruzada | Patrones de coherencia inter-dimensión que disparan re-evaluación |
| 9. Formato de salida controlado | Estructura exacta del reporte, plantillas obligatorias, citas textuales con fase identificada, disclaimers permanentes |
Dos propiedades del protocolo merecen mención específica. Primero, la trazabilidad: cada perfil incluye citas textuales del transcript con identificación de la fase — el lector puede verificar la evidencia detrás de cada inferencia, algo que ningún test de autorreporte ofrece. Segundo, la regla de abstención: el protocolo instruye que "si no hay evidencia para algo, no lo afirmes". El sistema está diseñado para abstenerse, no para rellenar.
El modelo de IA subyacente
El motor de análisis es Claude Sonnet 5, desarrollado por Anthropic — uno de los tres laboratorios de IA de frontera a nivel global, reconocido por su enfoque en seguridad, control de sesgos y fiabilidad. La versión utilizada se encuentra fijada por configuración (pinned). La elección responde a criterios técnicos concretos:
- Adherencia a instrucciones complejas. El análisis exige seguir un protocolo de 35.000+ caracteres con reglas condicionales, umbrales numéricos y prohibiciones explícitas sin desviarse.
- Capacidad de contexto extenso. Una sesión completa (60-120 minutos transcriptos) se analiza íntegra, sin fragmentación — condición necesaria para la ponderación por fases y la detección de evolución entre rondas.
- Fidelidad a la fuente y capacidad de abstención. Baja tendencia a fabricar evidencia y disposición a declarar incertidumbre fueron criterios centrales de selección.
- Competencia bilingüe. Análisis en español (incluidas variantes regionales) e inglés con calidad nativa.
Respecto del tratamiento de datos: el acceso se realiza mediante la API comercial de Anthropic, cuyos términos establecen que los datos enviados por API no se utilizan para entrenar los modelos. Las transcripciones se almacenan en infraestructura propia de TeamCook bajo las condiciones de confidencialidad acordadas con cada cliente. Los cambios de versión del modelo se tratan como cambios del instrumento: se validan contra sesiones de referencia antes de desplegarse y quedan registrados.
El modelo aporta la capacidad general de comprensión de lenguaje; el criterio de evaluación — qué constituye evidencia, cómo se pondera, qué umbrales aplican, qué está prohibido inferir — reside íntegramente en el protocolo TeamCook. El modelo es el motor; el instrumento es el protocolo.
3.5 Integridad del censo de participantes
Un riesgo específico del análisis automatizado de transcripciones es la omisión o fusión de participantes. El instrumento incorpora reglas bloqueantes de integridad: la lista oficial de participantes validada por el facilitador opera como ground truth; ningún participante puede ser omitido silenciosamente; los nombres ambiguos se desambiguan mediante reglas explícitas y está prohibida la fusión de personas distintas; y una auditoría final obligatoria verifica que el conteo del encabezado coincida exactamente con los perfiles generados. Los participantes cuya evidencia verbal resulta insuficiente no reciben scores especulativos: se reportan explícitamente como "evidencia insuficiente" con la razón observable documentada.
Es preferible un reporte con menos hallazgos sólidos que uno con muchos hallazgos especulativos. Cuando la evidencia no alcanza, el instrumento lo dice — no rellena.
Salvaguardas metodológicas y éticas
4.1 Control de sesgos
| Riesgo | Salvaguarda incorporada al diseño |
|---|---|
| Sesgo de verbosidad (confundir hablar mucho con competencia) | Anti-patterns explícitos por dimensión; regla "volumen ≠ score"; los indicadores exigen impacto observable, no cantidad de emisiones |
| Sesgo de contexto (la simulación sobreexpresa acción) | Ponderación 1.5x de fases reflexivas para dimensiones cognitivas |
| Sesgo demográfico | Prohibición de inferir por edad, género, apariencia o jerarquía; análisis ciego a video |
| Halo effect | Indicadores separados por dimensión, evidencia independiente exigida, validación cruzada de coherencia |
| Sobre-interpretación con evidencia escasa | Umbral mínimo de 2 verbalizaciones; categoría formal de "evidencia insuficiente"; prohibición de inventar gaps |
| Deseabilidad social | Mitigada estructuralmente: se observa comportamiento bajo presión, no autorreporte |
| Confusión técnica penalizada injustamente | Problemas de conectividad, aprendizaje de controles y habla del facilitador excluidos del scoring |
4.2 Uso ético y límites de aplicación declarados
- Sí se usa: como input complementario en decisiones de selección, identificación de high-potentials, asignación a proyectos y diseño de planes de desarrollo.
- No se usa: como criterio único de contratación o desvinculación; como reemplazo de instrumentos psicométricos validados; como diagnóstico clínico; para comparar scores entre grupos evaluados en sesiones distintas (los scores son contextuales al grupo).
- Transparencia con el evaluado: cada reporte incluye un disclaimer permanente: "Complementa, no reemplaza, evaluaciones formales de desempeño ni instrumentos psicométricos validados".
Adicionalmente, la guía del facilitador prescribe el encuadre de la devolución: orientar a desarrollo y no a juicio, explicar el significado real de cada categoría (Stretch es punto de partida de desarrollo, no veredicto) y contextualizar los casos de evidencia insuficiente sin estigmatizar la baja verbalización.
4.3 El rol del facilitador como capa de validación humana
El reporte no se entrega de forma autónoma: la metodología TeamCook prescribe que un facilitador certificado conduzca la sesión y la devolución. El facilitador cumple tres funciones de control de calidad: valida la lista de participantes antes del análisis (ground truth del censo), contextualiza los hallazgos con lo observado en vivo (incluyendo dinámicas no verbales que el transcript no captura) y modera la interpretación de los resultados en la devolución. Para usos de assessment de talento, la metodología recomienda facilitadores con formación en psicología o gestión de talento senior.
Posicionamiento frente a instrumentos formales
5.1 Tabla comparativa
| Criterio | Tests de autorreporte (Hogan, Big Five) | Assessment center tradicional | TeamCook Assessment/Talent |
|---|---|---|---|
| Fuente de datos | Percepción de sí mismo (cuestionario) | Observación por evaluadores humanos | Observación computacional del comportamiento verbal |
| Contexto | Sin contexto (ítems abstractos) | Ejercicios situacionales presenciales | Simulación cooperativa estandarizada bajo presión |
| Riesgo de deseabilidad social | Alto (gestionable con escalas de control) | Bajo | Bajo (presión sostenida + observación indirecta) |
| Evidencia por inferencia | Norma estadística poblacional | Registro del evaluador | Citas textuales del transcript en el reporte |
| Base teórica declarada | Modelos propios con décadas de validación | Método validado; teoría varía | Literatura académica abierta, contemporánea y verificable |
| Estatus de validación | Validación psicométrica formal publicada | Validez documentada del método | Sin validación formal propia (en construcción de base normativa); framework anclado en literatura publicada |
| Costo y logística | Bajo costo, asincrónico | Alto costo, 1-2 días, múltiples evaluadores | Costo bajo-medio, 90-120 minutos, remoto |
| Repetibilidad longitudinal | Alta (re-test) | Baja (costo) | Alta (sesiones repetibles para medir evolución) |
5.2 Qué aporta TeamCook que los tests no capturan
Los instrumentos de autorreporte miden disposiciones estables autopercibidas. Su límite conocido es la brecha entre lo que la persona declara y lo que hace — en particular en dimensiones interpersonales y bajo presión. TeamCook aporta la capa que falta: evidencia situacional de comportamiento efectivo en cooperación bajo presión, con registro textual verificable. Para un proceso de talento robusto, la combinación de ambas fuentes (disposicional + situacional) produce una imagen más completa que cualquiera de las dos por separado — el principio de triangulación multi-método que la literatura de assessment recomienda de forma consistente.
5.3 Estatus de validación: declaración honesta
TeamCook no cuenta hoy con validación psicométrica formal (estudios publicados de confiabilidad, validez de constructo y validez predictiva propios del instrumento). Esta limitación se declara en cada reporte y en todos los materiales. El posicionamiento correcto del instrumento en su estadio actual es el de observación estructurada con framework documentado, en proceso de acumulación de base normativa.
La hoja de ruta de validación contempla las siguientes etapas:
- Etapa 1 — Base normativa: consolidación de la base de sesiones analizadas con criterios homogéneos (en curso, con más de 300 equipos y 1.800 participantes acumulados).
- Etapa 2 — Confiabilidad: análisis de consistencia de los scores del sistema frente a jueces humanos expertos (inter-rater agreement IA-humano).
- Etapa 3 — Validez convergente: estudios de correlación entre dimensiones TeamCook e instrumentos establecidos, en alianza con instituciones académicas.
- Etapa 4 — Validez predictiva: seguimiento longitudinal de indicadores de carrera en organizaciones cliente que consientan el estudio.
- Etapa 5 — Certificación: evaluación del proceso completo bajo la norma ISO 10667.
Síntesis y declaración de uso responsable
El Reporte Assessment/Talent de TeamCook es un instrumento de observación conductual estructurada con fundamentos conceptuales explícitos, criterios de selección teórica declarados, arquitectura de medición documentada y salvaguardas metodológicas incorporadas en su diseño. Sus fortalezas distintivas son la evidencia textual citable que respalda cada inferencia, la estandarización del contexto de observación, la ponderación diferencial de fases que compensa el sesgo de acción de las simulaciones, y la disciplina de reportar la insuficiencia de evidencia en lugar de rellenarla.
Sus límites están declarados con la misma claridad: es un instrumento de sesión única, basado exclusivamente en comportamiento verbal, sin validación psicométrica formal a la fecha, y diseñado para complementar — nunca sustituir — los procesos formales de evaluación de las organizaciones.
Utilizado dentro de esos límites, el reporte cumple la función para la que fue diseñado: convertir una experiencia grupal observable en evidencia estructurada que enriquece las decisiones de talento y abre conversaciones de desarrollo fundadas en comportamiento real.
Cada afirmación del reporte está respaldada por evidencia del transcript. Si no hay evidencia para algo, el reporte no lo afirma. Y cada fuente del marco teórico puede consultarse y evaluarse de forma independiente. Evidencia antes que inferencia; verificabilidad antes que confianza ciega. Esos dos principios son el fundamento último del instrumento.
Referencias
Bales, R. F. (1950). Interaction Process Analysis: A Method for the Study of Small Groups. Addison-Wesley.
Bateman, T. S., & Crant, J. M. (1993). The proactive component of organizational behavior: A measure and correlates. Journal of Organizational Behavior, 14(2), 103-118.
Borman, W. C., & Motowidlo, S. J. (1993). Expanding the criterion domain to include elements of contextual performance. En N. Schmitt & W. C. Borman (Eds.), Personnel Selection in Organizations. Jossey-Bass.
Bray, D. W., & Grant, D. L. (1966). The assessment center in the measurement of potential for business management. Psychological Monographs, 80(17).
Buckingham, M., & Clifton, D. O. (2001). Now, Discover Your Strengths. Free Press.
Cohen, A. R., & Bradford, D. L. (1990). Influence Without Authority. John Wiley & Sons.
Credé, M., Tynan, M. C., & Harms, P. D. (2017). Much ado about grit: A meta-analytic synthesis of the grit literature. Journal of Personality and Social Psychology, 113(3), 492-511.
Csikszentmihalyi, M. (1990). Flow: The Psychology of Optimal Experience. Harper & Row.
Deci, E. L., & Ryan, R. M. (2000). The "what" and "why" of goal pursuits: Human needs and the self-determination of behavior. Psychological Inquiry, 11(4), 227-268.
De Meuse, K. P., Dai, G., & Hallenbeck, G. S. (2010). Learning agility: A construct whose time has come. Consulting Psychology Journal: Practice and Research, 62(2), 119-130.
DeRue, D. S., Ashford, S. J., & Myers, C. G. (2012). Learning agility: In search of conceptual clarity and theoretical grounding. Industrial and Organizational Psychology, 5(3), 258-279.
Duckworth, A. L., Peterson, C., Matthews, M. D., & Kelly, D. R. (2007). Grit: Perseverance and passion for long-term goals. Journal of Personality and Social Psychology, 92(6), 1087-1101.
Fetzer, M., & Tuzinski, K. (Eds.) (2013). Simulations for Personnel Selection. Springer.
International Taskforce on Assessment Center Guidelines (2015). Guidelines and ethical considerations for assessment center operations. Journal of Management, 41(4), 1244-1273.
Kolb, D. A. (1984). Experiential Learning: Experience as the Source of Learning and Development. Prentice-Hall.
Landers, R. N. (2014). Developing a theory of gamified learning: Linking serious games and gamification of learning. Simulation & Gaming, 45(6), 752-768.
Lombardo, M. M., & Eichinger, R. W. (2000). High potentials as high learners. Human Resource Management, 39(4), 321-329.
Pulakos, E. D., Arad, S., Donovan, M. A., & Plamondon, K. E. (2000). Adaptability in the workplace: Development of a taxonomy of adaptive performance. Journal of Applied Psychology, 85(4), 612-624.
Ready, D. A., Conger, J. A., & Hill, L. A. (2010). Are you a high potential? Harvard Business Review, 88(6), 78-84.
Sackett, P. R., Zhang, C., Berry, C. M., & Lievens, F. (2022). Revisiting meta-analytic estimates of validity in personnel selection. Journal of Applied Psychology, 107(11), 2040-2068.
Schein, E. H. (1978). Career Dynamics: Matching Individual and Organizational Needs. Addison-Wesley.
Schmidt, F. L., & Hunter, J. E. (1998). The validity and utility of selection methods in personnel psychology. Psychological Bulletin, 124(2), 262-274.
Senge, P. M. (1990). The Fifth Discipline: The Art and Practice of the Learning Organization. Doubleday.
Shute, V. J. (2011). Stealth assessment in computer-based games to support learning. En S. Tobias & J. D. Fletcher (Eds.), Computer Games and Instruction (pp. 503-524). Information Age Publishers.
Smith, P. C., & Kendall, L. M. (1963). Retranslation of expectations: An approach to the construction of unambiguous anchors for rating scales. Journal of Applied Psychology, 47(2), 149-155.
Thornton, G. C., & Rupp, D. E. (2006). Assessment Centers in Human Resource Management. Lawrence Erlbaum.
Este documento tiene fines informativos: describe la metodología del Reporte Assessment/Talent de TeamCook vigente a la fecha de esta versión. No constituye asesoramiento profesional, psicológico ni legal, y no garantiza resultados específicos en ninguna aplicación particular del instrumento.
TeamCook — su marca, metodología, protocolo de análisis, materiales y plataforma — es propiedad intelectual de Jeremías Agis. La distribución de este documento está permitida en el marco de relaciones comerciales o de evaluación con TeamCook; su reproducción total o parcial fuera de ese marco requiere autorización escrita.
El Reporte Assessment/Talent complementa y no reemplaza evaluaciones formales de desempeño ni instrumentos psicométricos validados. No debe utilizarse como criterio único en decisiones de contratación, promoción o desvinculación. Los scores son contextuales al grupo evaluado en cada sesión y no son comparables entre sesiones distintas. La metodología descrita puede evolucionar entre versiones de este documento; la versión vigente prevalece.