什么是用于网络摄像头眼动追踪的最佳注视检测器? {/examples/}
每一个注视的计数、持续时间和停留时间都依赖于生成它的检测器,而经典检测器是为每秒录制 500 到 2000 个样本的实验室追踪器而构建的。哪一个在大约 30 的网络摄像头数据上效果最好?我们将它们与 EyeLink 1000 进行了比较,并在真实的在线参与者身上测试,发现它们单独使用时都表现不佳。
大纲 {/examples/}
摘要 {/examples/}
注视是大多数眼动追踪分析的单位:注视计数、持续时间、停留时间和关注区域等都继承了检测算法的结果。检测方法是为在 500 到 2000 Hz 采样的实验室追踪器开发的;网络摄像头每秒提供约 30 个样本,每个样本的噪声却远远更多。那么,哪种注视检测器是网络摄像头数据的最佳选择?
我们将 Labvanced 的基于分散的检测器与 Engbert 和 Kliegl 的基于速度的算法进行了比较,使用了 Titus von der Malsburg 的 saccades R 包的确切 JavaScript 移植版,并且已与原版进行了验证(在 13,790 行输出中没有不匹配)。比较在三个数据集上进行:23 位参与者使用网络摄像头和 EyeLink 1000 同时录制,94 位参与者的注视和追踪任务,以及 225 位 Prolific 参与者的 45 个目标精准度任务。
这些算法在相反的方向上失败。分散检测从不将两个真实的注视合并,而是将一个稳定的注视碎片化为几个部分:在 82 % 的稳定注视中,中位数为 3 而不是 1。Engbert 和 Kliegl 的阈值是从每个参与者自己的速度噪声设置的,几乎不进行碎片化,但在网络摄像头数据上,它合并了短暂的注视和小扫视,并在噪声最大的参与者中错过了大型目标扫视。位置精度几乎不依赖于算法,因为剩余的网络摄像头误差是一个常量偏移,而不是噪声。
因此,适用于网络摄像头数据的最佳检测器既不是这两个,而是一个组合:我们构建了一个新的检测器,保留了分散检测对真实扫视的敏感性,并增加了一个实时合并步骤,当两个连续的注视中心之间的距离小于测量噪声所能解释的距离时,将它们合并。与 EyeLink 的比较将一对一 F1 分数从 0.58 提高到 0.75。在 195 名 Prolific 参与者中,它将报告为一个注视的稳定注视的份额翻倍(从 22.5 % 到 50 %),将覆盖一个注视的注视时间从 847 ms 延长至 1490 ms,并且略微但显著地提高了其精度(屏幕对角线的 7.40 % 到 7.29 %,p = .0003)。代价是延迟:只有在下一个注视开始后,才能报告一个注视,大约在一秒钟后,这对于注视依赖设计而言很重要。合并注视是眼动追踪 2.0 中的默认检测器;实时和滞后检测器仍然可用。