TeamCook · Documento Técnico

Fundamentos Metodológicos del Reporte Assessment / Talent

Marco conceptual, criterios de selección teórica, arquitectura de medición, salvaguardas metodológicas y posicionamiento frente a instrumentos psicométricos formales.

AutorTeamCook · Jeremías Agis
Contactoconsultas@teamcookgame.com
Resumen ejecutivo

Qué es este instrumento

El Reporte Assessment/Talent de TeamCook es un instrumento de observación conductual estructurada que evalúa siete dimensiones de talento a partir del análisis del comportamiento verbal de los participantes durante una sesión cooperativa bajo presión.

El reporte no es un test psicométrico autoadministrado ni pretende serlo. Pertenece a una tradición metodológica distinta y complementaria: la de los assessment centers conductuales, cuya práctica sistemática comenzó en los años 50 con los estudios de AT&T (Bray & Grant, 1966) y que hoy constituye uno de los enfoques con mayor validez predictiva documentada para la evaluación de potencial gerencial. TeamCook traslada esa lógica observacional a un entorno gamificado estandarizado y aplica análisis computacional de lenguaje sobre la transcripción de la sesión, con evidencia textual citada como respaldo de cada inferencia.

Una nota sobre el estándar de este documento: el marco teórico del instrumento se apoya exclusivamente en literatura académica abierta, contemporánea y verificable — incluyendo el meta-análisis de referencia del campo de la selección de personal (Sackett, Zhang, Berry & Lievens, 2022, Journal of Applied Psychology) y la taxonomía estándar de desempeño adaptativo (Pulakos et al., 2000). Se evitó deliberadamente construir sobre tipologías comerciales de décadas pasadas o marcos sin respaldo en revistas con referato. Cada fuente citada puede ser consultada y evaluada de forma independiente por el lector.

Posicionamiento en una línea

TeamCook produce evidencia conductual observacional en contexto cooperativo estandarizado bajo presión. Complementa a los instrumentos psicométricos de autorreporte (Hogan, Big Five) aportando lo que ellos no capturan: comportamiento real, no percepción de sí mismo.

Capítulo 1

Marco conceptual

1.1 La tradición metodológica: assessment center conductual

Metodológicamente, TeamCook pertenece a la familia de los assessment centers: evaluación de comportamiento observable en ejercicios situacionales estandarizados. Esta tradición, iniciada formalmente en el Management Progress Study de AT&T (Bray & Grant, 1966) — un estudio longitudinal que siguió carreras gerenciales durante más de dos décadas y demostró la capacidad predictiva de la observación conductual — y consolidada en las Guidelines and Ethical Considerations for Assessment Center Operations (International Taskforce, 2015), se distingue de los tests de autorreporte en un punto esencial: no le pregunta a la persona cómo cree que se comporta; observa cómo se comporta efectivamente.

Los ejercicios grupales sin roles asignados (leaderless group discussions) son uno de los componentes clásicos del assessment center, con décadas de investigación sobre su capacidad para revelar liderazgo emergente, influencia social y toma de decisiones bajo presión. La sesión TeamCook funciona estructuralmente como un ejercicio grupal sin roles asignados, con tres propiedades que fortalecen la observación:

  • Presión como filtro. La presión de tiempo y el caos controlado (comandas con vencimiento, fuegos, cambios de lado) actúan como filtro de autenticidad: bajo presión disminuye la capacidad de sostener comportamiento impostado.
  • Estandarización del estímulo. El entorno es idéntico para todos los equipos evaluados: mismas mecánicas, mismos tiempos, mismos tipos de disrupción. Esa estandarización es la condición que permite comparar observaciones dentro del grupo.
  • Interdependencia forzada. La cooperación es estructuralmente obligatoria (la cocina dividida impide completar comandas sin coordinación), lo que garantiza que las dimensiones interpersonales tengan oportunidad de manifestarse.

1.2 Por qué un juego: el fundamento del contexto lúdico de observación

Queda una pregunta legítima por responder: si el objetivo es observar comportamiento, ¿por qué hacerlo en un videojuego de cocina y no en un ejercicio corporativo convencional? La respuesta no es estética ni de marketing — es metodológica, y cuenta con su propia línea de investigación: la del game-based assessment y las simulaciones para evaluación de personas (Fetzer & Tuzinski, 2013; Landers, 2014).

El juego cumple tres funciones de medición que un ejercicio convencional cumple peor:

  • Medición no intrusiva (stealth assessment). La evaluación ocurre mientras la persona juega, sin interrumpir la experiencia con preguntas ni recordatorios de que está siendo evaluada. Este principio — acuñado como stealth assessment por Shute (2011) — reduce la ansiedad de evaluación y la conducta de examen, dos contaminantes clásicos de los assessment tradicionales. En TeamCook nadie completa un formulario: el dato se produce jugando.
  • Autenticidad por inmersión. La inmersión que produce un juego bien diseñado — el estado de flow descrito por Csikszentmihalyi (1990) — disminuye el auto-monitoreo consciente. Una persona absorbida por coordinar la entrega de una comanda a contrarreloj no está administrando su imagen frente al evaluador: está siendo ella misma bajo presión. Este es un argumento de calidad de la medición, no de entretenimiento.
  • Participación genuina en lugar de cumplimiento. La literatura de motivación (Self-Determination Theory; Deci & Ryan, 2000) explica por qué el formato lúdico genera compromiso genuino en lugar de cumplimiento formal: el juego satisface las necesidades de autonomía, competencia y relación que la teoría identifica como base de la motivación intrínseca. Los indicadores de engagement observados en las sesiones TeamCook (participación sostenida, comentarios voluntarios post-sesión) son consistentes con este marco.

A estas tres funciones se suma el fundamento pedagógico del ciclo completo de la sesión: la secuencia jugar → reflexionar → conceptualizar → volver a jugar reproduce deliberadamente el ciclo de aprendizaje experiencial de Kolb (1984). El debrief no es un cierre protocolar: es la fase del ciclo donde la experiencia se convierte en aprendizaje verbalizado — y, para el instrumento, la fase donde las dimensiones reflexivas se vuelven observables. La ponderación 1.5x del debrief descrita en la sección 3.1 es la traducción operativa de este fundamento.

Una exclusión deliberada

El framework NO utiliza taxonomías de tipos de jugador (Bartle) ni marcos de diseño gamificado (Octalysis) como base de inferencia del reporte. Estos marcos son herramientas de diseño de experiencias — y como tales informaron el diseño del juego TeamCook — pero no son instrumentos de medición validados y no participan del análisis de talento. La distinción entre marcos de diseño y marcos de medición es un límite metodológico que este instrumento respeta de forma explícita.

1.3 El insumo de análisis: comportamiento verbal

El análisis se realiza exclusivamente sobre la transcripción del audio de la sesión. Esta decisión de diseño tiene fundamento metodológico: el comportamiento verbal en interacción grupal es un indicador validado de procesos de coordinación, liderazgo emergente y funcionamiento de equipo. La tradición de Interaction Process Analysis (Bales, 1950) y la investigación contemporánea en análisis computacional del lenguaje en equipos de trabajo sustentan la inferencia de constructos conductuales a partir del habla situada en contexto.

El sistema no analiza rasgos de personalidad profundos ni estados internos: analiza actos de habla observables — quién propone, quién coordina, quién verifica, quién pregunta, quién integra el aporte de otros, quién reflexiona sobre lo sucedido — y los mapea contra indicadores conductuales predefinidos por dimensión.

1.4 Criterios de selección del marco teórico

El marco teórico del instrumento no es una acumulación de citas: es el resultado de una decisión de diseño deliberada. Toda teoría candidata a integrar el framework debió superar simultáneamente cuatro criterios:

  • Observabilidad en el contexto. El constructo debe poder manifestarse y observarse en 90-120 minutos de interacción cooperativa verbal bajo presión. Quedaron excluidas por este criterio teorías valiosas pero no observables en este formato (motivación intrínseca profunda, valores personales, rasgos clínicos).
  • Respaldo académico verificable. Cada fuente debe estar publicada en literatura académica con referato (peer review) o constituir el estándar profesional documentado de su campo. Se excluyeron tipologías comerciales de origen pre-científico y marcos de divulgación sin respaldo empírico verificable.
  • Reconocibilidad para la práctica de RRHH. Los constructos elegidos (Learning Agility, high-potential, trayectorias duales de carrera, desempeño adaptativo) forman parte del vocabulario operativo de los equipos de talento corporativos. Un instrumento cuyos resultados se expresan en el lenguaje que la organización ya usa se integra a los procesos de decisión reales.
  • Independencia de marcas registradas. El marco se construyó exclusivamente sobre literatura abierta y citable, sin dependencia de modelos con marca registrada cuyo uso requeriría licenciamiento o generaría exposición legal.

Este filtro cuádruple explica tanto lo que el framework incluye como lo que deliberadamente deja afuera.

1.5 Tres tradiciones académicas integradas

El framework Assessment/Talent no es un modelo teórico nuevo. Es una síntesis operacionalizada de tres corrientes consolidadas en la psicología organizacional y la gestión del talento:

a) Performance Prediction (predicción de desempeño)

La investigación en selección de personal ha establecido con solidez qué variables predicen desempeño laboral. El meta-análisis de Schmidt & Hunter (1998) —uno de los trabajos más citados en la historia de la disciplina— y su actualización por Sackett, Zhang, Berry & Lievens (2022) constituyen la referencia obligada del campo. De esta tradición el framework toma dos elementos: la centralidad de la proactividad y la conciencia como predictores estables (operacionalizados en Drive & Initiative y Operational Excellence) y el principio de que las muestras de comportamiento predicen mejor que los autorreportes.

b) High Potential Identification (identificación de alto potencial)

La distinción entre desempeño actual y potencial futuro es el eje de la literatura de high-potentials. El framework se apoya en dos fuentes principales: el modelo de Learning Agility (Lombardo & Eichinger, 2000; De Meuse, Dai & Hallenbeck, 2010), que identifica la agilidad de aprendizaje como el predictor más robusto de éxito en roles futuros de mayor complejidad; y el trabajo de Ready, Conger & Hill (Harvard Business Review, 2010) sobre los marcadores conductuales del empleado de alto potencial. Los cuatro High-Potential Indicators del reporte operacionalizan directamente esta tradición.

c) Strengths-Based Positioning (posicionamiento por fortalezas)

De la psicología positiva aplicada al trabajo (Buckingham & Clifton, 2001) el framework toma un principio de diseño — no un instrumento de medición: el reporte identifica fortalezas diferenciadoras relativas al grupo evaluado, no solo scores absolutos. Este enfoque orienta el reporte hacia el posicionamiento (quién aporta qué) más que hacia rankings.

Capítulo 2

Las siete dimensiones: definición, anclaje y medición

Cada dimensión tiene definición operacional, indicadores conductuales positivos y negativos, anclas de puntuación por rango (BARS; Smith & Kendall, 1963) y anti-patterns explícitos: confusiones que el sistema tiene instrucción de no cometer.

DimensiónPesoDefinición operacionalAnclaje teórico principal
Drive & Initiative15%Energía proactiva, ownership, acción sin instrucción, esfuerzo sostenido bajo presiónProactive Personality (Bateman & Crant, 1993); Grit (Duckworth et al., 2007); Conscientiousness
Learning Agility15%Capacidad de aprender de la experiencia, integrar feedback y mejorar entre iteracionesLearning Agility (Lombardo & Eichinger, 2000; De Meuse et al., 2010)
Adaptabilidad10%Ajuste conductual efectivo ante cambios de contexto e imprevistosAdaptive Performance (Pulakos et al., 2000)
Strategic Thinking15%Anticipación, priorización, mirada de sistema, conexión entre acciones y objetivosSystems Thinking (Senge, 1990); cognición gerencial
Operational Excellence10%Ejecución precisa, verificación, atención al detalle, cierre de calidadTask Performance (Borman & Motowidlo, 1993)
Social Impact15%Influencia sin imposición, cohesión grupal, gestión de conflicto, comunicación efectivaInfluence without Authority (Cohen & Bradford, 1990)
Leadership Readiness20%Disposición y capacidad de asumir dirección, decidir bajo incertidumbre y sostener foco grupalLiderazgo emergente en leaderless group discussions (Thornton & Rupp, 2006)

El mayor peso de Leadership Readiness (20%) responde al propósito declarado del reporte: apoyar decisiones de identificación de potencial directivo y planes de sucesión. Los pesos son parte del diseño del instrumento y están documentados de forma transparente en la guía del facilitador.

2.1 El Talent Composite Score

El Composite Score (0-100) es una suma ponderada de las siete dimensiones. Su función no es producir un ranking sino ubicar a cada persona en una de cuatro categorías de lectura (Star 80-100, Solid 65-79, Emerging 50-64, Stretch <50) que orientan la conversación de desarrollo. El diseño contempla explícitamente el caso del Star de contribución individual: una persona puede alcanzar categoría Star con Leadership Readiness moderado — el reporte lo señala para evitar la lectura errónea de que todo talento alto implica trayectoria directiva.

2.2 Fit para tipos de rol

El reporte evalúa ajuste a cuatro arquetipos (Leadership Track, Individual Contributor Expert, Cross-Functional Bridge, Execution Specialist) mediante reglas de corte conjuntivas y explícitas — por ejemplo, Leadership Track exige simultáneamente Leadership Readiness ≥ 70, Strategic Thinking ≥ 60 y Social Impact ≥ 60. El uso de umbrales conjuntivos publicados evita la discrecionalidad y responde a la distinción consolidada entre trayectoria de gestión y de especialista (dual career ladder; Schein, 1978). No calificar en ningún arquetipo no constituye un veredicto negativo: el reporte lo informa como perfil que requiere evaluación más extensa.

2.3 Operacionalización: cómo se mide cada dimensión

Cada dimensión se mide mediante una rúbrica de cuatro componentes: (a) definición operacional; (b) indicadores conductuales positivos y negativos, expresados como verbalizaciones tipo; (c) escalas ancladas en comportamiento (BARS) que describen qué caracteriza cada rango de score en cinco niveles; y (d) anti-patterns — confusiones frecuentes que el sistema tiene instrucción explícita de no cometer. La rúbrica completa forma parte del protocolo propietario; la siguiente tabla presenta una muestra representativa de las señales verbales que el sistema busca en cada dimensión, y de lo que tiene prohibido confundir.

DimensiónSeñales verbales que suman (ejemplos)No se confunde con (anti-patterns)
Drive & InitiativeAsume tareas sin que se lo pidan ("Yo voy al sector A", "Empiezo a cortar lechuga"); sostiene energía verbal durante toda la partida; vuelve a la acción rápidamente después de un errorHablar mucho (puede ser Social Impact); liderar (es Leadership Readiness); ejecutar instrucciones recibidas (es Operational Excellence)
Learning AgilityMejora observable entre rondas; hace preguntas para entender, no para defenderse; reflexiona sobre el propio proceso en el debrief ("lo que nos pasó fue que...")Hablar de cambios sin integrarlos (describir no es aprender); adaptarse a la mecánica del juego (eso es Adaptabilidad)
AdaptabilidadSe reorganiza rápido ante cambios de lado o de rol; recupera el ritmo tras un fracaso; acepta cambiar el modo de hacer cuando cambia el contextoObedecer órdenes (cumplir no es adaptarse); aceptar sin opinión (puede ser pasividad); aprender (Learning Agility es cognitivo; Adaptabilidad es conductual)
Strategic ThinkingAnticipa antes de actuar; organiza secuencias y prioridades ("primero X porque después viene Y"); conecta acciones concretas con el objetivo de la partidaVerbalización abundante sin anticipación; coordinar tareas sin explicitar el para qué (es operativo, no estratégico)
Operational ExcellenceVerifica antes de entregar (revisa ingredientes, confirma la receta); advierte faltantes o errores de otros; completa lo que empiezaVelocidad (rápido no es preciso); hablar del plan sin ejecutarlo; estar ocupado sin cierre de calidad
Social ImpactSus propuestas son adoptadas por el grupo; cohesiona en momentos difíciles; reconoce explícitamente el aporte de otrosHablar mucho sin efecto observable; dirigir (es Leadership Readiness); amabilidad sin impacto en la dinámica grupal
Leadership ReadinessAsume dirección sin nombramiento previo; distribuye trabajo con criterio; decide en momentos de incertidumbre y sostiene el foco grupalHablar fuerte o con autoridad aparente; seniority o jerarquía externa (prohibido inferir por cargo); ocupar un rol asignado (ser nombrado no es asumir liderazgo)

La columna de anti-patterns merece subrayarse: es la principal defensa del instrumento contra el error de atribución más común en la evaluación de grupos — confundir visibilidad con competencia. Cada dimensión tiene documentado qué comportamiento superficialmente similar NO debe puntuar, y esa distinción está codificada como instrucción explícita, no librada al criterio del momento.

2.4 Anclas universales de puntuación y distribución esperada

Además de los anchors específicos de cada dimensión, el protocolo define una escala universal de interpretación de scores con frecuencias esperadas en un grupo típico. Esta tabla es la referencia que impide tanto la inflación de puntajes (todos altos) como la severidad artificial (todos bajos):

RangoSignificadoFrecuencia esperada
90-100Excepcional — líder de la dimensión en el grupo~5%
75-89Alto — consistente y diferenciado~20-25%
60-74Sólido — competente y confiable~30-35%
45-59Funcional — adecuado sin destacar~25-30%
30-44Limitado — por debajo del estándar~10-15%
0-29Mínimo — apenas observable o ausente~3-5%

Las frecuencias son orientativas, no prescriptivas: el protocolo instruye explícitamente no forzar la normalización si el grupo evaluado es excepcional o débil en alguna dimensión. La distribución esperada funciona como control de calibración, no como cuota.

2.5 Elegibilidad para scoring: quién recibe perfil completo

No toda persona presente en una sesión recibe scores. El protocolo define tres categorías de elegibilidad con criterios explícitos, aplicadas sobre la lista oficial de participantes validada por el facilitador:

  • Categoría A — Perfil completo: quien registra cinco o más intervenciones operativas distribuidas en las fases de la sesión, y cuyas intervenciones permiten inferir al menos cuatro de las siete dimensiones con confianza media-alta. Solo esta categoría recibe los siete scores, el Composite, la categoría de talento, el fit-para-rol, los HPI y un mínimo de cuatro citas textuales del transcript como evidencia.
  • Categoría B — Evidencia insuficiente: quien estuvo presente y habló, pero con menos intervenciones operativas que el umbral, o con verbalizaciones que no permiten inferir suficientes dimensiones, o con limitaciones documentadas (problemas técnicos, entrada tardía). No recibe scores especulativos: su perfil se publica con la marca "evidencia insuficiente" y la razón observable documentada.
  • Categoría C — Solo presente en apertura: quien solo participó de la apertura sin ninguna intervención operativa posterior. No se incluye en el conteo ni recibe perfil.

A nivel de dimensión individual rige además el umbral mínimo de evidencia: cada score requiere al menos dos verbalizaciones independientes que lo respalden. Con una sola, el score se emite como tentativo con caveat explícito. Este doble filtro — elegibilidad por persona y suficiencia por dimensión — es lo que sostiene la afirmación central del instrumento: ningún número del reporte carece de evidencia citable.

Implicancia de diseño

Estos umbrales tienen una consecuencia directa: el diseño de la sesión es parte del instrumento. La sesión debe garantizar que cada participante genere suficiente evidencia verbal, en las fases correctas, sin contaminación del facilitador. Por esa razón, la metodología TeamCook incluye un protocolo de facilitación específico para sesiones de assessment — el Guión del Facilitador — que estructura tiempos, consignas e intervenciones para maximizar la calidad de la medición. La facilitación no es logística: es la primera etapa del instrumento.

2.6 Fortalezas diferenciadoras, áreas de desarrollo e indicadores de potencial

Tres salidas del reporte tienen algoritmos de construcción específicos que conviene documentar:

  • Fortalezas diferenciadoras (algoritmo relativo al grupo): las "Top 3 fortalezas" de cada perfil NO son los tres scores absolutos más altos. Se calculan como diferencial respecto del grupo: score de la persona menos promedio grupal en cada dimensión, y se seleccionan los tres diferenciales positivos mayores. Una persona con score 70 donde el grupo promedia 50 tiene una fortaleza diferenciadora más relevante que un 75 donde el grupo ronda 78. Si ningún diferencial supera los 10 puntos, el sistema recurre a los scores absolutos como fallback documentado.
  • Áreas de desarrollo (con prohibición de inventar gaps): son las dos dimensiones con score más bajo del perfil, pero solo se reportan como críticas si están por debajo de 60. Si todas las dimensiones del perfil están en 60 o más, el protocolo prohíbe inventar gaps: el reporte declara "perfil sólido sin gaps críticos". El tono está prescripto como constructivo — se formula como margen de desarrollo con foco accionable, nunca como debilidad.
  • High-Potential Indicators (criterios conjuntivos): los cuatro indicadores (Learning Mindset, Drive Sostenido, Influencia Social, Agilidad Mental) se evalúan en tres niveles mediante criterios conjuntivos: el nivel Alto exige la co-ocurrencia de varias señales, no una sola. Por ejemplo, Learning Mindset Alto requiere simultáneamente mejora notoria entre fases, integración proactiva de feedback y reflexión sobre el propio proceso. Este diseño conjuntivo hace que los niveles Altos sean informativos: no se alcanzan por un buen momento aislado.

Complementariamente, el protocolo incorpora una capa de validación cruzada entre estas salidas: perfiles con combinaciones incoherentes (por ejemplo, HPI de Influencia Social alto con Social Impact bajo) disparan re-evaluación antes de emitir el reporte, como se describe en la sección 3.3.

Capítulo 3

Arquitectura de medición

3.1 Segmentación por fases y ponderación diferencial de evidencia

Una sesión TeamCook se segmenta en seis fases con distinto valor analítico. Esta ponderación diferencial responde a un problema conocido de los ejercicios de simulación: el contexto de acción sobreexpresa las dimensiones ejecutivas y subexpresa las reflexivas. El diseño lo compensa sobre-ponderando las fases donde el comportamiento reflexivo tiene oportunidad de manifestarse.

FaseContenidoPonderaciónDimensiones que mejor revela
AperturaPresentaciones, encuadre del facilitador0.3x— (casi descartada)
Partida de pruebaRonda exploratoria de aprendizaje de controles0.7x— (sub-ponderada)
Conversación pre-partidaPlanificación del equipo antes de cada partida puntuable1.5xStrategic Thinking, Leadership Readiness, Social Impact
Partida activaJuego bajo presión (5-10 min)1.0xDrive & Initiative, Operational Excellence, Adaptabilidad
Pausa entre partidasAjustes breves0.7x— (sub-ponderada)
Debriefing finalReflexión grupal guiada1.5xLearning Agility, Strategic Thinking, Social Impact

La lógica es análoga a la de un assessment center multi-ejercicio: distintas situaciones elicitan distintos constructos, y el evaluador pondera cada observación según la situación en que ocurrió.

3.2 Reglas de scoring: disciplina de evidencia

El sistema opera bajo diez reglas de scoring explícitas que constituyen la disciplina de evidencia del instrumento. Las más relevantes:

  • Solo evidencia verbal observable. El sistema tiene prohibido inferir a partir de cámara, apariencia, edad, género o posición jerárquica. Toda inferencia debe anclarse en verbalizaciones citables.
  • Umbral mínimo de evidencia. Cada score debe estar respaldado por al menos dos verbalizaciones independientes. Con una sola, el score se marca como tentativo con caveat explícito.
  • Control de verbosidad. Volumen de habla no equivale a score alto. El sistema distingue entre hablar mucho y demostrar la dimensión — un anti-pattern documentado para cada una de las siete dimensiones.
  • Comportamiento sobre descripción. Describir un comportamiento no equivale a exhibirlo. "Deberíamos habernos organizado mejor" es evidencia de reflexión, no de organización.
  • Presión como filtro de autenticidad. La evidencia emitida bajo presión pesa más que la emitida en momentos de calma, por su mayor resistencia a la impostación.
  • Mejora entre fases. La mejora observable entre rondas es señal de alta calidad para Learning Agility — el instrumento aprovecha la estructura iterativa de la sesión como medida repetida intra-sujeto.

3.3 Validación cruzada de coherencia inter-dimensión

El sistema aplica una capa de control de coherencia sobre los perfiles generados. Combinaciones de scores estadísticamente improbables o conceptualmente incoherentes (por ejemplo, Strategic Thinking alto con Learning Agility bajo, o Leadership Readiness alto con Social Impact bajo) disparan una instrucción de re-evaluación antes de emitir el reporte. Este mecanismo cumple la función de las reuniones de consenso entre evaluadores de un assessment center tradicional.

3.4 El protocolo de instrucción: anatomía del sistema de análisis

El análisis es ejecutado por un modelo de lenguaje de gran escala operando bajo un protocolo de instrucción propietario de más de 35.000 caracteres, desarrollado con el acompañamiento de una psicometrista senior con experiencia en consultoría global de talento. El protocolo no es un pedido genérico de "analizá esta conversación": es un instrumento de evaluación completo codificado como instrucción. El texto íntegro del protocolo constituye propiedad intelectual central de TeamCook y no se publica — el mismo criterio que aplican los instrumentos formales del mercado respecto de sus algoritmos de scoring.

Componente del protocoloContenido y función
1. Definición de rol expertoInstruye al modelo a operar como evaluador experto en assessment observacional, con la distinción obligatoria de que el resultado no es un test psicométrico formal validado
2. Contexto completo del juegoDescripción exhaustiva de mecánicas, roles, estaciones, disrupciones y recursos (incluida la pausa), para interpretar cada verbalización en su contexto real
3. Segmentación de fasesMarcadores verbales para identificar las 6 fases y tabla de ponderación diferencial (0.3x a 1.5x)
4. Framework de 7 dimensionesDefinición operacional, indicadores positivos y negativos, escalas BARS por rango, anti-patterns explícitos por dimensión
5. Reglas de scoringLas 10 reglas de disciplina de evidencia
6. Fórmulas y umbralesCálculo del Composite con pesos publicados, categorías, reglas conjuntivas de fit-para-rol y niveles de los HPI
7. Reglas de integridad del censoLista oficial como ground truth, prohibición de omisión y fusión, desambiguación de nombres, auditoría final obligatoria
8. Validación cruzadaPatrones de coherencia inter-dimensión que disparan re-evaluación
9. Formato de salida controladoEstructura exacta del reporte, plantillas obligatorias, citas textuales con fase identificada, disclaimers permanentes

Dos propiedades del protocolo merecen mención específica. Primero, la trazabilidad: cada perfil incluye citas textuales del transcript con identificación de la fase — el lector puede verificar la evidencia detrás de cada inferencia, algo que ningún test de autorreporte ofrece. Segundo, la regla de abstención: el protocolo instruye que "si no hay evidencia para algo, no lo afirmes". El sistema está diseñado para abstenerse, no para rellenar.

El modelo de IA subyacente

El motor de análisis es Claude Sonnet 5, desarrollado por Anthropic — uno de los tres laboratorios de IA de frontera a nivel global, reconocido por su enfoque en seguridad, control de sesgos y fiabilidad. La versión utilizada se encuentra fijada por configuración (pinned). La elección responde a criterios técnicos concretos:

  • Adherencia a instrucciones complejas. El análisis exige seguir un protocolo de 35.000+ caracteres con reglas condicionales, umbrales numéricos y prohibiciones explícitas sin desviarse.
  • Capacidad de contexto extenso. Una sesión completa (60-120 minutos transcriptos) se analiza íntegra, sin fragmentación — condición necesaria para la ponderación por fases y la detección de evolución entre rondas.
  • Fidelidad a la fuente y capacidad de abstención. Baja tendencia a fabricar evidencia y disposición a declarar incertidumbre fueron criterios centrales de selección.
  • Competencia bilingüe. Análisis en español (incluidas variantes regionales) e inglés con calidad nativa.

Respecto del tratamiento de datos: el acceso se realiza mediante la API comercial de Anthropic, cuyos términos establecen que los datos enviados por API no se utilizan para entrenar los modelos. Las transcripciones se almacenan en infraestructura propia de TeamCook bajo las condiciones de confidencialidad acordadas con cada cliente. Los cambios de versión del modelo se tratan como cambios del instrumento: se validan contra sesiones de referencia antes de desplegarse y quedan registrados.

División de responsabilidades

El modelo aporta la capacidad general de comprensión de lenguaje; el criterio de evaluación — qué constituye evidencia, cómo se pondera, qué umbrales aplican, qué está prohibido inferir — reside íntegramente en el protocolo TeamCook. El modelo es el motor; el instrumento es el protocolo.

3.5 Integridad del censo de participantes

Un riesgo específico del análisis automatizado de transcripciones es la omisión o fusión de participantes. El instrumento incorpora reglas bloqueantes de integridad: la lista oficial de participantes validada por el facilitador opera como ground truth; ningún participante puede ser omitido silenciosamente; los nombres ambiguos se desambiguan mediante reglas explícitas y está prohibida la fusión de personas distintas; y una auditoría final obligatoria verifica que el conteo del encabezado coincida exactamente con los perfiles generados. Los participantes cuya evidencia verbal resulta insuficiente no reciben scores especulativos: se reportan explícitamente como "evidencia insuficiente" con la razón observable documentada.

Principio rector

Es preferible un reporte con menos hallazgos sólidos que uno con muchos hallazgos especulativos. Cuando la evidencia no alcanza, el instrumento lo dice — no rellena.

Capítulo 4

Salvaguardas metodológicas y éticas

4.1 Control de sesgos

RiesgoSalvaguarda incorporada al diseño
Sesgo de verbosidad (confundir hablar mucho con competencia)Anti-patterns explícitos por dimensión; regla "volumen ≠ score"; los indicadores exigen impacto observable, no cantidad de emisiones
Sesgo de contexto (la simulación sobreexpresa acción)Ponderación 1.5x de fases reflexivas para dimensiones cognitivas
Sesgo demográficoProhibición de inferir por edad, género, apariencia o jerarquía; análisis ciego a video
Halo effectIndicadores separados por dimensión, evidencia independiente exigida, validación cruzada de coherencia
Sobre-interpretación con evidencia escasaUmbral mínimo de 2 verbalizaciones; categoría formal de "evidencia insuficiente"; prohibición de inventar gaps
Deseabilidad socialMitigada estructuralmente: se observa comportamiento bajo presión, no autorreporte
Confusión técnica penalizada injustamenteProblemas de conectividad, aprendizaje de controles y habla del facilitador excluidos del scoring

4.2 Uso ético y límites de aplicación declarados

  • Sí se usa: como input complementario en decisiones de selección, identificación de high-potentials, asignación a proyectos y diseño de planes de desarrollo.
  • No se usa: como criterio único de contratación o desvinculación; como reemplazo de instrumentos psicométricos validados; como diagnóstico clínico; para comparar scores entre grupos evaluados en sesiones distintas (los scores son contextuales al grupo).
  • Transparencia con el evaluado: cada reporte incluye un disclaimer permanente: "Complementa, no reemplaza, evaluaciones formales de desempeño ni instrumentos psicométricos validados".

Adicionalmente, la guía del facilitador prescribe el encuadre de la devolución: orientar a desarrollo y no a juicio, explicar el significado real de cada categoría (Stretch es punto de partida de desarrollo, no veredicto) y contextualizar los casos de evidencia insuficiente sin estigmatizar la baja verbalización.

4.3 El rol del facilitador como capa de validación humana

El reporte no se entrega de forma autónoma: la metodología TeamCook prescribe que un facilitador certificado conduzca la sesión y la devolución. El facilitador cumple tres funciones de control de calidad: valida la lista de participantes antes del análisis (ground truth del censo), contextualiza los hallazgos con lo observado en vivo (incluyendo dinámicas no verbales que el transcript no captura) y modera la interpretación de los resultados en la devolución. Para usos de assessment de talento, la metodología recomienda facilitadores con formación en psicología o gestión de talento senior.

Capítulo 5

Posicionamiento frente a instrumentos formales

5.1 Tabla comparativa

CriterioTests de autorreporte (Hogan, Big Five)Assessment center tradicionalTeamCook Assessment/Talent
Fuente de datosPercepción de sí mismo (cuestionario)Observación por evaluadores humanosObservación computacional del comportamiento verbal
ContextoSin contexto (ítems abstractos)Ejercicios situacionales presencialesSimulación cooperativa estandarizada bajo presión
Riesgo de deseabilidad socialAlto (gestionable con escalas de control)BajoBajo (presión sostenida + observación indirecta)
Evidencia por inferenciaNorma estadística poblacionalRegistro del evaluadorCitas textuales del transcript en el reporte
Base teórica declaradaModelos propios con décadas de validaciónMétodo validado; teoría varíaLiteratura académica abierta, contemporánea y verificable
Estatus de validaciónValidación psicométrica formal publicadaValidez documentada del métodoSin validación formal propia (en construcción de base normativa); framework anclado en literatura publicada
Costo y logísticaBajo costo, asincrónicoAlto costo, 1-2 días, múltiples evaluadoresCosto bajo-medio, 90-120 minutos, remoto
Repetibilidad longitudinalAlta (re-test)Baja (costo)Alta (sesiones repetibles para medir evolución)

5.2 Qué aporta TeamCook que los tests no capturan

Los instrumentos de autorreporte miden disposiciones estables autopercibidas. Su límite conocido es la brecha entre lo que la persona declara y lo que hace — en particular en dimensiones interpersonales y bajo presión. TeamCook aporta la capa que falta: evidencia situacional de comportamiento efectivo en cooperación bajo presión, con registro textual verificable. Para un proceso de talento robusto, la combinación de ambas fuentes (disposicional + situacional) produce una imagen más completa que cualquiera de las dos por separado — el principio de triangulación multi-método que la literatura de assessment recomienda de forma consistente.

5.3 Estatus de validación: declaración honesta

TeamCook no cuenta hoy con validación psicométrica formal (estudios publicados de confiabilidad, validez de constructo y validez predictiva propios del instrumento). Esta limitación se declara en cada reporte y en todos los materiales. El posicionamiento correcto del instrumento en su estadio actual es el de observación estructurada con framework documentado, en proceso de acumulación de base normativa.

La hoja de ruta de validación contempla las siguientes etapas:

  • Etapa 1 — Base normativa: consolidación de la base de sesiones analizadas con criterios homogéneos (en curso, con más de 300 equipos y 1.800 participantes acumulados).
  • Etapa 2 — Confiabilidad: análisis de consistencia de los scores del sistema frente a jueces humanos expertos (inter-rater agreement IA-humano).
  • Etapa 3 — Validez convergente: estudios de correlación entre dimensiones TeamCook e instrumentos establecidos, en alianza con instituciones académicas.
  • Etapa 4 — Validez predictiva: seguimiento longitudinal de indicadores de carrera en organizaciones cliente que consientan el estudio.
  • Etapa 5 — Certificación: evaluación del proceso completo bajo la norma ISO 10667.
Capítulo 6

Síntesis y declaración de uso responsable

El Reporte Assessment/Talent de TeamCook es un instrumento de observación conductual estructurada con fundamentos conceptuales explícitos, criterios de selección teórica declarados, arquitectura de medición documentada y salvaguardas metodológicas incorporadas en su diseño. Sus fortalezas distintivas son la evidencia textual citable que respalda cada inferencia, la estandarización del contexto de observación, la ponderación diferencial de fases que compensa el sesgo de acción de las simulaciones, y la disciplina de reportar la insuficiencia de evidencia en lugar de rellenarla.

Sus límites están declarados con la misma claridad: es un instrumento de sesión única, basado exclusivamente en comportamiento verbal, sin validación psicométrica formal a la fecha, y diseñado para complementar — nunca sustituir — los procesos formales de evaluación de las organizaciones.

Utilizado dentro de esos límites, el reporte cumple la función para la que fue diseñado: convertir una experiencia grupal observable en evidencia estructurada que enriquece las decisiones de talento y abre conversaciones de desarrollo fundadas en comportamiento real.

Declaración final

Cada afirmación del reporte está respaldada por evidencia del transcript. Si no hay evidencia para algo, el reporte no lo afirma. Y cada fuente del marco teórico puede consultarse y evaluarse de forma independiente. Evidencia antes que inferencia; verificabilidad antes que confianza ciega. Esos dos principios son el fundamento último del instrumento.

Bibliografía

Referencias

Bales, R. F. (1950). Interaction Process Analysis: A Method for the Study of Small Groups. Addison-Wesley.

Bateman, T. S., & Crant, J. M. (1993). The proactive component of organizational behavior: A measure and correlates. Journal of Organizational Behavior, 14(2), 103-118.

Borman, W. C., & Motowidlo, S. J. (1993). Expanding the criterion domain to include elements of contextual performance. En N. Schmitt & W. C. Borman (Eds.), Personnel Selection in Organizations. Jossey-Bass.

Bray, D. W., & Grant, D. L. (1966). The assessment center in the measurement of potential for business management. Psychological Monographs, 80(17).

Buckingham, M., & Clifton, D. O. (2001). Now, Discover Your Strengths. Free Press.

Cohen, A. R., & Bradford, D. L. (1990). Influence Without Authority. John Wiley & Sons.

Credé, M., Tynan, M. C., & Harms, P. D. (2017). Much ado about grit: A meta-analytic synthesis of the grit literature. Journal of Personality and Social Psychology, 113(3), 492-511.

Csikszentmihalyi, M. (1990). Flow: The Psychology of Optimal Experience. Harper & Row.

Deci, E. L., & Ryan, R. M. (2000). The "what" and "why" of goal pursuits: Human needs and the self-determination of behavior. Psychological Inquiry, 11(4), 227-268.

De Meuse, K. P., Dai, G., & Hallenbeck, G. S. (2010). Learning agility: A construct whose time has come. Consulting Psychology Journal: Practice and Research, 62(2), 119-130.

DeRue, D. S., Ashford, S. J., & Myers, C. G. (2012). Learning agility: In search of conceptual clarity and theoretical grounding. Industrial and Organizational Psychology, 5(3), 258-279.

Duckworth, A. L., Peterson, C., Matthews, M. D., & Kelly, D. R. (2007). Grit: Perseverance and passion for long-term goals. Journal of Personality and Social Psychology, 92(6), 1087-1101.

Fetzer, M., & Tuzinski, K. (Eds.) (2013). Simulations for Personnel Selection. Springer.

International Taskforce on Assessment Center Guidelines (2015). Guidelines and ethical considerations for assessment center operations. Journal of Management, 41(4), 1244-1273.

Kolb, D. A. (1984). Experiential Learning: Experience as the Source of Learning and Development. Prentice-Hall.

Landers, R. N. (2014). Developing a theory of gamified learning: Linking serious games and gamification of learning. Simulation & Gaming, 45(6), 752-768.

Lombardo, M. M., & Eichinger, R. W. (2000). High potentials as high learners. Human Resource Management, 39(4), 321-329.

Pulakos, E. D., Arad, S., Donovan, M. A., & Plamondon, K. E. (2000). Adaptability in the workplace: Development of a taxonomy of adaptive performance. Journal of Applied Psychology, 85(4), 612-624.

Ready, D. A., Conger, J. A., & Hill, L. A. (2010). Are you a high potential? Harvard Business Review, 88(6), 78-84.

Sackett, P. R., Zhang, C., Berry, C. M., & Lievens, F. (2022). Revisiting meta-analytic estimates of validity in personnel selection. Journal of Applied Psychology, 107(11), 2040-2068.

Schein, E. H. (1978). Career Dynamics: Matching Individual and Organizational Needs. Addison-Wesley.

Schmidt, F. L., & Hunter, J. E. (1998). The validity and utility of selection methods in personnel psychology. Psychological Bulletin, 124(2), 262-274.

Senge, P. M. (1990). The Fifth Discipline: The Art and Practice of the Learning Organization. Doubleday.

Shute, V. J. (2011). Stealth assessment in computer-based games to support learning. En S. Tobias & J. D. Fletcher (Eds.), Computer Games and Instruction (pp. 503-524). Information Age Publishers.

Smith, P. C., & Kendall, L. M. (1963). Retranslation of expectations: An approach to the construction of unambiguous anchors for rating scales. Journal of Applied Psychology, 47(2), 149-155.

Thornton, G. C., & Rupp, D. E. (2006). Assessment Centers in Human Resource Management. Lawrence Erlbaum.

Nota sobre las referencias: se incluyen también las fuentes críticas de los constructos utilizados (Credé et al., 2017 sobre Grit; DeRue et al., 2012 sobre Learning Agility) como parte del compromiso de transparencia de este documento. Un marco teórico serio conoce y declara los debates sobre sus propias fuentes.
Aviso legal y de uso de este documento

Este documento tiene fines informativos: describe la metodología del Reporte Assessment/Talent de TeamCook vigente a la fecha de esta versión. No constituye asesoramiento profesional, psicológico ni legal, y no garantiza resultados específicos en ninguna aplicación particular del instrumento.

TeamCook — su marca, metodología, protocolo de análisis, materiales y plataforma — es propiedad intelectual de Jeremías Agis. La distribución de este documento está permitida en el marco de relaciones comerciales o de evaluación con TeamCook; su reproducción total o parcial fuera de ese marco requiere autorización escrita.

El Reporte Assessment/Talent complementa y no reemplaza evaluaciones formales de desempeño ni instrumentos psicométricos validados. No debe utilizarse como criterio único en decisiones de contratación, promoción o desvinculación. Los scores son contextuales al grupo evaluado en cada sesión y no son comparables entre sesiones distintas. La metodología descrita puede evolucionar entre versiones de este documento; la versión vigente prevalece.