影响网络摄像头眼动追踪精度的设计考虑
基于网络摄像头的 眼动追踪's 精度在很大程度上依赖于其背后的实施。文献中报告的数字范围从早期系统如 WebGazer (Papoutsaki et al., 2015) 的大约 4 个视觉度到 Labvanced 针对 EyeLink 1000 发表的至今唯一经过同行评审的研究级硬件眼动追踪器的比较的 1.2 到 1.4 个视觉度 (Kaduk et al., 2024)。这个数字是本页中使用的参考点,因为它是目前领域中唯一一个由已发表的硬件基准比较支持的网络摄像头眼动追踪精度声明。
即使这个数字也是一个上限,而不是保证。它描述的是在校准协议、刺激布局和适合任务的测试环境下可实现的结果。校准匆忙、关注区域放得太近,或者没有控制照明的研究将无法重现该精度。有六个设计考虑决定是否能实现这一精度:校准长度和点数、重新校准频率、数据质量阈值、头部位置控制、刺激定位,以及环境和参与者条件。
决定精度的研究设计决策
以下六个考虑适用于任何网络摄像头眼动追踪协议。每个考虑都说明了 Labvanced 如何实施它。
I. 校准长度和点数
任何网络摄像头眼动追踪系统都是从校准映射中估计注视位置,而该映射的好坏取决于产生它的校准程序。校准长度与结果的精度之间存在直接的权衡关系:较长的程序和更多的校准点能够提供更准确的注视估计。校准也是网络摄像头眼动追踪研究中参与者唯一需要主动与系统互动的点,因此所选择的长度是对参与者疲劳与研究持续时间之间的真实权衡,而不是默认最大化的设置。
在 Labvanced 的实现中: 校准时间可调,从大约 30 秒到 5 分钟或更长,点数也可配置。正确的选择取决于关注区域的布局:设计中较多小关注区域需要更长的校准时间,大约 5 分钟,以提供所需的精度,而只有少量大关注区域的设计,其目标仅仅是确定参与者是否看过某个关注区域,而不是具体在其内的哪个位置,通常较短的校准时间,大约 2 分钟,会更合适,因为这对参与者来说更快、更方便,从而导致更少的退出。
II. 重新校准频率
校准是一种快照:它在某一时刻将注视映射到特定的头部位置和照明条件。该映射是否在整个会议期间保持有效,对任何远程、非监督设置来说都是一个真实的方法论问题,而不是研究人员可以假设的问题。在 Labvanced 自身的验证中,只要参与者的位置保持稳定,精度在一段时间内保持一致,这意味着风险主要在于位置和照明漂移,而不是方法本身固有的退化。
在 Labvanced 的实现中: 研究中的重新校准可以在定义的点触发,例如在经过一定数量的实验后,而不是依赖单次校准在整个会议中保持有效。对于较长或多块研究,或不太可能保持静止的人群。因此,考虑如何处理重新校准是对漂移的直接控制。
III. 数据质量阈值
如果没有定义的质量标准,差的校准将默默地进入数据集,无法与良好的校准区分开来,这与硬件实验室通过排除校准不收敛的参与者所管理的问题相同。网络摄像头眼动追踪协议需要在数据收集开始之前设定一个明确的标准,以便什么算是充分校准。
在 Labvanced 的实现中: 可以设置最大校准误差,以屏幕对角线的百分比表示,以便超过该值的参与者被提示重新校准,尝试次数可配置。经过这些尝试后仍然超过阈值的参与者将无法完成研究,而不是悄悄包含在数据退化的情况下。
IV. 头部位置控制
由于校准将注视映射到特定的头部位置,参与者在校准完成后漂移出该位置可能是任何远程眼动追踪设置中精度损失的最大实际来源,而研究人员无法像在实验室那样进行物理检查。
在 Labvanced 的实现中: 虚拟下巴托限制了参与者的头部允许漂移的距离,确保在标记之前不会超出校准位置,从而为研究人员提供了一种自动化的替代方案,取代物理检查参与者位置的工作。
V. 刺激定位
精度在屏幕上并不均匀。在同一验证研究中,屏幕中央呈现的刺激(1.3° 精度,0.9° 精密度)相对于整体数字(1.4° 精度,1.1° 精密度)精度有所提高 (Kaduk et al., 2024)。预计周边刺激的误差会比中央刺激稍大,这对研究设计有两个直接影响。首先,在可能的情况下,将关键刺激或最重要的区域放置在中央将获得最可靠的注视数据。其次,且对基于 AOI 的设计更具影响,任何在同一试验中呈现的两个 AOI 需要有足够的空间,以超过该方法的误差范围,否则无法可靠地将靠近两个紧凑 AOI 边界的注视分配给其中任何一个。作为一般规则,所依赖的精度数字越接近,基于 AOI 的设计需要建立的间隔就越大。
VI. 环境和参与者条件
本节涵盖三种环境和参与者方面的条件:照明、眼镜和网络摄像头定位。
照明
背光,即位于参与者背后的明亮光源,如窗户或灯光,会将他们的脸部轮廓呈现为一个剪影,从而降低相机基于人脸追踪所依赖的对比度,影响面部和眼睛关键点的精确检测。低劣的关键点检测表现为更高的校准误差,而不是一个特定的照明标志,因此是否被捕捉到取决于是否正在检查校准误差本身是否超过某个阈值,而不是对照明条件的直接检测。
在Labvanced的实现中: 校准屏幕 instructs 参与者处于稳定、光线良好的房间内,并确保身后没有明亮的光源,如果照明在会话中发生了显著变化则需要重新校准。这依赖于参与者的遵从,而不是自动检测:与Labvanced在配置后自动执行的最小屏幕大小等设置不同,捕捉到光线不足的校准依赖于设置最大校准误差阈值(见上述数据质量阈值),而不是平台本身检测照明。
眼镜
实际上导致追踪降级的是光在到达网络摄像头之前发生失真、导致反射的眼镜或带有染色或蓝光过滤涂层的镜片,而不是眼镜本身。没有这些特性的眼镜对校准没有显著影响,因此眼镜问题比最初看起来的关注范围要窄。
在Labvanced的实现中: 默认的面向参与者的校准说明当前告诉参与者完全不要佩戴眼镜,这是一种保守的默认设置,而不是技术限制。该说明是可编辑的:它存在于眼动追踪系统消息中的Texts & Translate静态字符串下,因此那些其参与者群体通常佩戴眼镜的研究人员可以修改该说明,而不是默认排除这些参与者。
网络摄像头定位
校准将凝视映射到相对于网络摄像头位置的屏幕坐标,因此网络摄像头与屏幕中心之间的偏移会增加超出重新校准所能纠正的误差。这仅适用于未内置于设备中的网络摄像头,因为集成网络摄像头的相对位置是固定的。
在Labvanced的实现中: 对于使用外部网络摄像头的参与者,校准屏幕 instructs 他们将其尽可能靠近屏幕中心放置。
摘要表
| 设计决策 | 一般原则 | Labvanced 的实现 |
|---|---|---|
| I. 校准长度 / 点数 | 较长、较密的校准提高基线准确性,代价为参与者时间 | 可调节30秒至5分钟以上,点数可配置 |
| II. 重新校准频率 | 单次校准在位置或照明发生变化时可能无法维持整个会话 | 可在定义的时间点触发重新校准,例如在块之间 |
| III. 数据质量阈值 | 没有定义标准时,劣质校准悄然进入数据集 | 可配置的最大校准误差阈值,具有自动重新校准或排除功能 |
| IV. 头部位置控制 | 校准后的漂移很可能是远程准确性损失的最大实际来源 | 虚拟下巴托标记相对于校准位置的漂移 |
| V. 刺激位置 | 居中屏幕的准确性比边缘位置更高;紧密排列的AOI风险错误分类 | 经验证的中心屏幕准确性感(1.3°)可用于规划AOI间距 |
| VI. 环境和参与者条件 | 照明影响追踪质量;眼镜可以,但不能导致反射或有染色涂层 | 参与者说明禁止背光,不是自动检测;屏幕大小是可配置的硬件设置;默认“不佩戴眼镜”说明是可编辑的静态字符串,而不是限制 |
这些都不是不寻常的要求。它们是实验室关于硬件眼动追踪器校准程序的同一类别决策,适用于研究人员无法进行物理监督的情况。能够配置并且在多种情况下实现自动化,使得经过验证的准确性数字成为特定研究可以实际复现的,而不是在理想条件下报告的一次性数字。
该准确性水平支持的内容
本页面使用的参考数字,视觉角度范围为1.2至1.4度(1.3°中心屏幕),精度为1.1°,与EyeLink 1000之间的皮尔逊相关性约为0.8至0.9,对于特定任务达到0.9,这是Labvanced的同行评审验证结果 (Kaduk et al., 2024),是迄今为止最严格基准测试的网络摄像头眼动追踪准确性数据。采样率根据参与者的网络摄像头运行在30至60 Hz之间。这不一定代表每个基于网络摄像头的系统;其他实现报告了不同的数字,并且报告准确性的方法可能在研究之间并不总是可以直接比较(例如,某些按像素而非视觉角度报告,这需要关于屏幕大小和观看距离的额外假设)。
这并不是与硬件眼动追踪器的对等。在上述协议下,与研究级追踪器相比,准确性差距约为0.5°。这个差距对于给定研究的意义取决于研究需要测量什么。
在此准确性水平上支持良好:
- 关注区域(AOI)和停留时间分析:参与者注视刺激的哪个区域,以及注视时间
- 注视计数和注视持续时间
- 自由观看和视觉偏好范式,在自由观看和光滑追踪中,与EyeLink的相关性约为80%
- 第一次注视时间和一般视觉注意模式
在此准确性水平上支持不佳:
- 子度精度任务,其中测量本身需要细分到大约一个视觉度
- 眼动动态和微眼动分析,受限于30至60 Hz的采样率,而不仅仅是空间准确性
- 需要在密集文本中达到单词级或字母级注视精度的范式
选择在网络摄像头和硬件眼动追踪之间的研究人员应围绕这一界限设计,而不是单独围绕准确性数字:如果研究问题可以在AOI或注视级别回答,经过验证的网络摄像头眼动追踪实现是足够的;如果需要在小于一个度的范围内解析凝视位置或捕捉眼动动态,则硬件仍然是合适的工具。
常见问题解答
使用此方法的已发布研究
- Cassano-Coleman, R. Y., Izen, S. C., & Piazza, E. A. (2026). 听众系统性地整合层次音调背景,无论音乐训练如何。心理科学。(包括注视控制元素)。
- Zhang, P., & Zhang, S. (2025). L2 多模态的注意力与学习:一项基于网络摄像头的眼动追踪研究。语言学习与技术。 https://doi.org/10.64152/10125/73626
- Serrano-Carot, M., Angele, B., Xu, H., & Vasilev, M. R. (2025). 网络摄像头可以用于研究阅读期间的眼动。PsyArXiv(OSF 预印本)。 https://doi.org/10.31234/osf.io/bzt2h_v1
- Lester, C., et al. (2025). 具有不确定性意识的 AI 模型对药剂师反应时间和决策的影响:一项随机对照试验。JMIR 医疗信息学。 https://doi.org/10.2196/64902
- Wies, S., Bleier, A., & Edeling, A. (2022). 市场营销杂志。营销研究背景下的网络摄像头眼动追踪。
- Banki, A., de Eccher, M., et al. (2022). 心理学前沿。发展和婴儿眼动追踪。