影响网络摄像头眼动追踪准确性的设计考虑
基于网络摄像头的 眼动追踪 的准确性在很大程度上取决于其背后的实现。文献中报告的数字范围从早期系统如 WebGazer (Papoutsaki et al., 2015)约 4 视觉度,到迄今为止唯一与研究级硬件眼动追踪器进行同行评审比较的1.2到1.4视觉度,Labvanced 相对于 EyeLink 1000 的验证 (Kaduk et al., 2024)。该数字是本页面中使用的参考点,因为它目前是该领域中唯一由已发表的硬件基准比较支持的网络摄像头眼动追踪准确性声明。
即便该数字也是一个上限,而非保证。它描述了在适当的校准协议、刺激布局和测试环境下可实现的效果。一个校准匆忙、关注区域(AOI)放置过于接近或未控制照明的研究无法重现这一结果。六个设计考虑因素决定了它是否能够实现:校准长度和点数、重新校准频率、数据质量阈值、头部位置控制、刺激定位,以及环境和参与者条件。
决定准确性的研究设计决策
以下六个考虑因素适用于任何网络摄像头眼动追踪协议。每个因素都通过 Labvanced 的实施方式进行了说明。
I. 校准长度和点数
任何网络摄像头眼动追踪系统根据校准映射估算注视位置,而该映射的质量仅取决于产生它的校准程序。校准长度与结果准确性之间存在直接的权衡:较长的程序与更多的校准点会产生更准确的注视估计。校准也是网络摄像头眼动追踪研究中参与者主动与系统互动的唯一时刻,因此所选择的长度是真正的参与者疲劳与研究持续时间之间的权衡,而不是默认的最大化设置。
在 Labvanced 的实现中: 校准时间可调节,从大约 30 秒到 5 分钟或更长,点数也可以配置。正确的选择取决于 AOI 的布局:有许多小 AOI 的设计需要较长的校准(约 5 分钟)所提供的准确性,而仅有少数大 AOI 的设计,其目标只是确定参与者是否关注某个 AOI,而非在其内的确切位置,通常更适合较短的校准,约 2 分钟,因为这样更快、更方便参与者,从而导致较少的流失。
II. 重新校准频率
校准是一个快照:它将注视映射到某个特定的头部位置和光照条件下的某一时刻。该映射在整个会话期间是否仍然有效是任何远程、无人监督设置的一个真正方法论问题,而不是研究人员可以假设的事情。在 Labvanced 自身的验证中,只要参与者的位置保持稳定,准确性就能够持续保持,这意味着风险在于位置和光照的漂移,而不是该方法本身固有的衰退。
在 Labvanced 的实现中: 研究中的重新校准可以在定义的点上触发,例如,在经过一定数量的试验后,而不是依赖于单一的校准在整个会话中保持有效。在较长或多区块的研究中,或者在不太可能保持静止的人群中。因此,考虑如何处理重新校准是防止漂移的直接控制。
III. 数据质量阈值
在没有定义质量标准的情况下,糟糕的校准会默默地进入数据集中,与良好的校准无法区分,这与硬件实验室通过排除未收敛的参与者来管理的同样问题。网络摄像头眼动追踪协议需要在数据收集开始之前明确规定什么算是合格的校准标准。
在 Labvanced 的实现中: 可以设置最大校准误差,作为屏幕对角线的百分比,因此超出该误差的参与者会被提示重新校准,直到配置的尝试次数。仍然超出阈值的参与者在这些尝试后将无法完成研究,而不是默默地被包含在降级数据中。
IV. 头部位置控制
由于校准将注视映射到特定的头部位置,参与者在校准完成后漂移出该位置很可能是任何远程眼动追踪设置中准确性损失的最大实际来源,研究人员无法像在实验室那样物理捕捉这一点。
在 Labvanced 的实现中: 一个虚拟下巴托限制了参与者的头部可以从校准位置漂移的距离,直到被标记,从而为研究人员提供了自动的替代方案来检查参与者的位置。
V. 刺激定位
准确性在屏幕上并不均匀。在同一验证研究中,位于屏幕中心的刺激的准确性(1.3° 准确性,0.9° 精度)相较于总体数字(1.4° 准确性,1.1° 精度)有所提高 (Kaduk et al., 2024)。应该预期,周边刺激的误差会稍微大于中心刺激,这对研究设计有两个直接影响。首先,若范式允许,将关键刺激或最重要的区域放在中心会产生最可靠的注视数据。其次,更重要的是,对于基于 AOI 的设计,在同一试验中呈现的任意两个 AOI 之间需要有足够的空间,以超过方法的误差范围,否则靠近两个紧密相邻 AOI 边界的注视无法准确归属于其中之一。一般来说,越依赖准确性数字,基于 AOI 的设计需要构建更多的间隔。
VI. 环境与参与者条件
本节涵盖三个环境和参与者相关条件:照明、眼镜和网络摄像头定位。
照明
背光,即一个明亮的光源,例如窗户或灯,位于参与者背后,会使他们的面部在光源前变成轮廓,减少了相机面部追踪依赖于的对比度,从而准确检测面部和眼睛的标志。降低的标志检测表现为更高的校准误差,而不是特定于照明的标志,因此是否被捕捉取决于是否检查校准误差本身是否超过阈值,而不是对照明条件的直接检测。
在 Labvanced 的实现中: 校准屏幕指示参与者处于稳定、光线良好的房间中,并且背后没有明亮的光源,如果在会话过程中照明发生重大变化,则需重新校准。这依赖于参与者的遵守,而不是自动检测:与一旦配置后 Labvanced 自动强制执行的最小屏幕尺寸等设置不同,捕捉光线不足的校准依赖于设置的最大校准误差阈值(见上面的数据质量阈值),而不是平台检测照明条件本身。
眼镜
实际上降低追踪质量的是光在到达网络摄像头之前出现变形、造成反射的眼镜或带有染色或蓝光过滤涂层的镜片,而不是眼镜本身。没有这些特性的眼镜不会对校准产生重大影响,使得眼镜成为一个比最初看起来更窄的问题。
在 Labvanced 的实现中: 默认的参与者面向校准指示目前告知参与者完全不佩戴眼镜,这是一种保守的默认设置,而不是技术限制。该指示是可编辑的:它存活在眼动追踪系统消息的 Texts & Translate 静态字符串下,因此常戴眼镜的参与者群体的研究人员可以修订该指示,而不是默认排除这些参与者。
网络摄像头定位
校准将注视映射到相对于网络摄像头位置的屏幕坐标,因此网络摄像头与屏幕中心之间的偏移会增加超出重新校准单独校正的误差。这仅适用于未内置在设备中的网络摄像头,因为一体化网络摄像头相对于屏幕的位置是固定的。
在 Labvanced 的实现中: 对于使用外部网络摄像头的参与者,校准屏幕指示他们尽可能将其放置在屏幕的中心。
概述表
| 设计决策 | 一般原则 | Labvanced 的实现 |
|---|---|---|
| I. 校准时间 / 点数 | 更长、更密集的校准提高基线准确性,但需牺牲参与者时间 | 可调的 30 秒到 5 分钟以上,点数可配置 |
| II. 重新校准频率 | 单次校准可能无法维持整个会话,如果位置或照明发生变化 | 在定义时间点触发重新校准,例如在区块之间 |
| III. 数据质量阈值 | 如果没有定义标准,低质量校准会悄无声息地进入数据集 | 可配置的最大校准误差阈值,带有自动重新校准或排除 |
| IV. 头部位置控制 | 校准后的漂移可能是远程准确性丧失的最大实际来源 | 虚拟下巴托标记从校准位置的漂移 |
| V. 刺激定位 | 中心屏幕的准确性高于边缘;紧密间隔的 AOI 风险误分类 | 经过验证的中心屏幕准确性数据(1.3°)可用于规划 AOI 间距 |
| VI. 环境与参与者条件 | 照明影响追踪质量;眼镜可以,但须避免反射或染色涂层 | 针对背光的参与者指示,而非自动检测;屏幕尺寸是可配置的硬件设置;默认“无眼镜”指示是可编辑的静态字符串,而不是限制 |
这些要求都不奇怪。它们属于实验室对硬件眼动追踪器校准过程的决策类别,应用于研究人员无法实际监督参与者的环境中。能够配置并在几个案例中实现自动化是验证的准确性数据使得特定研究能够实际再现的原因,而不是在理想条件下报告的一个数字。
该准确性级别支持的内容
本页使用的参考数值为 1.2 至 1.4 视觉度(1.3° 中心屏幕),精度为 1.1°,与 EyeLink 1000 的 Pearson 相关系数约为 0.8 到 0.9,特定任务可达到 0.9,这是 Labvanced 的同行评审验证结果 (Kaduk et al., 2024),是迄今为止经过严格基准测试的网络摄像头眼动追踪准确性数据。采样率为 30 到 60 Hz,具体取决于参与者的网络摄像头。这并不一定代表每一个基于网络摄像头的系统;其他实现报告的数值各不相同,报告准确性的方法在不同研究之间并不总是可以直接比较(某些研究例如以像素而非视觉度进行报告,这需要关于屏幕尺寸和观看距离的额外假设进行转换)。
这与硬件眼动追踪器并不相等。即使在上述协议下,与研究级追踪器相比,精度差距约为 0.5°。该差距对给定研究的意义取决于研究需要测量的内容。
在该准确性级别良好支持:
- 感兴趣区域 (AOI) 和停留时间分析:参与者注视刺激的哪个区域,以及时间长短
- 凝视次数和凝视持续时间
- 自由观看和视觉偏好范式,经过验证与 EyeLink 的自由观看和光滑追踪相关性约为 80%
- 首次凝视时间和一般视觉注意模式
在该准确性级别不太支持:
- 亚度精度任务,其中测量本身需要细化到大约一个视觉度以下
- 眼跳动态和微眼跳分析,由于 30 至 60 Hz 的采样率限制,而不仅仅是空间精度
- 需要密集文本中逐字或逐字母凝视精度的范式
研究人员在选择网络摄像头和硬件眼动追踪时,应围绕这一条线进行设计,而不是孤立地围绕准确性数字:如果研究问题可以在 AOI 或凝视水平上获得答案,则经过验证的网络摄像头眼动追踪实现是足够的;如果需要在小于一个视觉度的分数内解析注视位置或捕捉眼跳动态,则硬件仍然是合适的工具。
常见问题解答
使用此方法的已发布研究
- Cassano-Coleman, R. Y., Izen, S. C., & Piazza, E. A. (2026). 听众系统性整合层次音调上下文,无论音乐训练如何。心理科学。 (包括注视聚焦元素)。
- Zhang, P., & Zhang, S. (2025). L2多模态下的注意力与学习:基于网络摄像头的眼动追踪研究。语言学习与技术。 https://doi.org/10.64152/10125/73626
- Serrano-Carot, M., Angele, B., Xu, H., & Vasilev, M. R. (2025). 网络摄像头可用于研究阅读中的眼动。PsyArXiv(OSF预印本)。 https://doi.org/10.31234/osf.io/bzt2h_v1
- Lester, C., et al. (2025). 不确定性感知的人工智能模型对药剂师反应时间和决策的影响:随机对照试验。JMIR医学信息学。 https://doi.org/10.2196/64902
- Wies, S., Bleier, A., & Edeling, A. (2022). 市场营销杂志。用于市场研究的基于网络摄像头的眼动追踪。
- Banki, A., de Eccher, M., et al. (2022). 心理学前沿。发展和婴儿眼动追踪。