Quel est le meilleur détecteur de fixation pour le suivi des yeux par webcam ? {/examples/}
Chaque compte de fixation, durée et temps de présence dépend du détecteur qui l'a produit, et les détecteurs classiques ont été conçus pour des dispositifs de laboratoire enregistrant de 500 à 2000 échantillons par seconde. Lequel fonctionne le mieux sur des données de webcam, à environ 30 ? Nous les avons testés face à un EyeLink 1000 et sur de vrais participants en ligne, et avons constaté qu'aucun d'entre eux ne fait bien seul.
Plan {/examples/}
Résumé {/examples/}
Les fixations sont l'unité sur laquelle sont basées la plupart des analyses de suivi des yeux : les comptes de fixations, les durées, les temps de présence et les zones d'intérêt héritent tous de ce que fait l'algorithme de détection. Les méthodes de détection ont été développées pour des dispositifs de laboratoire échantillonnant à 500 à 2000 Hz ; une webcam délivre environ 30 échantillons par seconde, avec beaucoup plus de bruit par échantillon. Alors, quel détecteur de fixation est le meilleur choix pour des données de webcam ?
Nous avons comparé les détecteurs basés sur la dispersion de Labvanced avec l'algorithme basé sur la vitesse d'Engbert et Kliegl, en utilisant un port JavaScript exact du package R saccades de Titus von der Malsburg que nous avons vérifié par rapport à l'original (sans divergences sur 13 790 lignes de sortie). La comparaison s'est faite sur trois ensembles de données : 23 participants enregistrés avec la webcam et un EyeLink 1000 en même temps, 94 participants d'une tâche de fixation et de poursuite, et 225 participants Prolific d'une tâche de précision à 45 cibles.
Les algorithmes échouent dans des directions opposées. La détection par dispersion ne fusionne jamais deux vraies fixations mais fragmente un regard stable en plusieurs morceaux : une médiane de 3 là où il y en a 1, dans 82 % des regards stables. Engbert et Kliegl, dont le seuil est fixé par le bruit de vitesse de chaque participant, fragmente rarement, mais sur les données de webcam, il fusionne des fixations courtes et de petites saccades, et manque de grandes saccades cibles chez les participants les plus bruyants. La précision de la position dépend peu de l'algorithme, car l'erreur restante de la webcam est un décalage constant plutôt qu'un bruit.
Le meilleur détecteur pour les données de webcam n'est donc aucun d'eux, mais une combinaison : nous avons construit un nouveau détecteur qui conserve la sensibilité de la détection par dispersion aux vraies saccades et ajoute un pas de fusion en temps réel, qui joint deux fixations consécutives lorsque leurs centres sont plus proches que le bruit de mesure ne peut l'expliquer. Par rapport à EyeLink, cela augmente le score F1 un à un de 0.58 à 0.75. Sur 195 participants Prolific, cela double la part de regards stables signalés comme une seule fixation (22.5 % à 50 %), allonge la fixation couvrant un regard de 847 à 1490 ms, et améliore légèrement mais significativement sa précision (7.40 à 7.29 % de la diagonale de l'écran, p = .0003). Le prix à payer est la latence : une fixation est signalée seulement une fois que la suivante a commencé, environ une seconde plus tard, ce qui est important pour les conceptions conditionnées par le regard. Les Fixations Fusionnées sont le détecteur par défaut dans Eye Tracking 2.0 ; les détecteurs en temps réel et avec retard restent disponibles.
Plus à venir bientôt
L'analyse est complète. Le rapport complet, avec la méthode, les trois ensembles de données, les résultats détecteur par détecteur, les figures et nos recommandations pour chaque conception d'étude, suivra dans cette note, avec ses données.