¿Cuál es el mejor detector de fijación para el seguimiento ocular con webcam?
Cada conteo de fijación, duración y tiempo de permanencia depende del detector que lo produjo, y los detectores clásicos fueron construidos para rastreadores de laboratorio que registran entre 500 y 2000 muestras por segundo. ¿Cuál funciona mejor en datos de webcam, a aproximadamente 30? Los probamos contra un EyeLink 1000 y en participantes reales en línea, y encontramos que ninguno funciona bien por sí solo.
Esquema
Resumen
Las fijaciones son la unidad sobre la cual se construyen la mayoría de los análisis de seguimiento ocular: los conteos de fijaciones, duraciones, tiempos de permanencia y áreas de interés heredan lo que hace el algoritmo de detección. Los métodos de detección fueron desarrollados para rastreadores de laboratorio que toman muestras entre 500 y 2000 Hz; una webcam proporciona alrededor de 30 muestras por segundo, con mucho más ruido por muestra. Entonces, ¿qué detector de fijación es la mejor opción para los datos de webcam?
Comparamos los detectores basados en dispersión de Labvanced con el algoritmo basado en velocidad de Engbert y Kliegl, utilizando un puerto exacto en JavaScript del paquete R saccades de Titus von der Malsburg que verificamos contra el original (sin desajustes en 13,790 filas de salida). La comparación se realizó en tres conjuntos de datos: 23 participantes grabados con la webcam y un EyeLink 1000 al mismo tiempo, 94 participantes en una tarea de fijación y persecución, y 225 participantes de Prolific en una tarea de precisión de 45 objetivos.
Los algoritmos fallan en direcciones opuestas. La detección por dispersión nunca fusiona dos fijaciones reales, sino que fragmenta una mirada estable en varias partes: una mediana de 3 donde hay 1, en el 82 % de las miradas estables. Engbert y Kliegl, cuyo umbral se establece a partir del propio ruido de velocidad de cada participante, rara vez fragmentan, pero en los datos de webcam fusiona fijaciones cortas y pequeñas sacádas, y se pierde grandes sacádas objetivo en los participantes más ruidosos. La precisión de la posición depende poco del algoritmo, ya que el error restante de la webcam es un desplazamiento constante en lugar de ruido.
El mejor detector para los datos de webcam no es ninguno de ellos, sino una combinación: construimos un nuevo detector que mantiene la sensibilidad de la detección por dispersión a las sacádas reales y añade un paso de fusión en vivo, que une dos fijaciones consecutivas cuando sus centros están más cerca de lo que el ruido de medición puede explicar. Contra EyeLink, eleva el puntaje F1 uno a uno de 0.58 a 0.75. En 195 participantes de Prolific, duplica la proporción de miradas estables reportadas como una fijación (del 22.5 % al 50 %), alarga la fijación cubriendo una mirada de 847 a 1490 ms, y mejora su precisión ligeramente pero de manera significativa (7.40 a 7.29 % de la diagonal de la pantalla, p = .0003). El precio es la latencia: una fijación se reporta solo una vez que ha comenzado la siguiente, aproximadamente un segundo después, lo cual es importante para los diseños contingentes al enfoque. Las Fijaciones Fusionadas son el detector predeterminado en Eye Tracking 2.0; los detectores en tiempo real y con retraso siguen disponibles.
Más pronto
El análisis está completo. El informe completo, con el método, los tres conjuntos de datos, los resultados detector por detector, las figuras y nuestras recomendaciones para cada diseño de estudio, seguirá en esta nota, junto con sus datos.