影响网络摄像头眼动追踪准确性的设计考量
基于网络摄像头的 眼动追踪'的准确性在很大程度上依赖于其背后的实现。文献中报告的 figures 从早期系统如 WebGazer (Papoutsaki et al., 2015) 的大约 4 个视觉度到截至目前唯一经同行评审并与研究级硬件眼动追踪仪相比的 Labvanced 在 EyeLink 1000 (Kaduk et al., 2024) 的 1.2 到 1.4 个视觉度。这个数字是本页面中使用的参考点,因为它目前是该领域唯一拥有已发布、硬件基准比较支持的网络摄像头眼动追踪准确性声明。
即使这个数字也是上限,而非保证。它描述了在一个足够的校准协议、刺激布局和测试环境下可实现的水平。一个快速校准、关注区域(AOI)放置得过于接近,或在光照上没有控制的研究将无法重现这一结果。六个设计考虑因素决定了是否可以实现这一点:校准时长和点数、重新校准频率、数据质量阈值、头部位置控制、刺激定位,以及环境和参与者条件。
决定准确性的研究设计决策
以下六个考虑因素适用于任何网络摄像头眼动追踪协议。每个都通过 Labvanced 的实现来说明。
I. 校准时长和点数
任何网络摄像头眼动追踪系统根据校准映射来估计注视位置,而该映射的质量仅取决于生成它的校准程序。校准时长与结果准确性之间存在直接的权衡:较长的程序和更多的校准点会产生更准确的注视估计。校准也是在网络摄像头眼动追踪研究中,参与者必须主动与系统互动的唯一时刻,因此选择的长度是参与者疲劳和研究持续时间之间的真正权衡,而不是默认最大化的设置。
在 Labvanced 的实现中: 校准时长可调整,从大约 30 秒到 5 分钟或更长,点数也可配置。合适的选择取决于 AOI 布局:许多小 AOI 的设计需要更长的校准以提供较高的准确性,而仅有少数大型 AOI 的设计(其目标仅是确定参与者是否查看过 AOI,而不是精确到其中的具体位置)通常更适合较短的校准,大约 2 分钟,因为这对参与者来说更快更方便,能够减少失访率。
II. 重新校准频率
校准是一张快照:它在某一时刻将注视映射到特定的头部位置和光照条件。在整个会议期间该映射是否仍然有效,是任何远程、无监督设置中的一个真实方法论问题,研究者不能想当然的假设。在 Labvanced 自己的验证中,只要参与者的位置保持稳定,准确性在一段时间内保持一致,这意味着风险主要是关于位置和光照的漂移,而不是方法本身的内在衰退。
在 Labvanced 的实现中: 在研究中可在定义的点触发重新校准,例如在经过一定数量的试验后,而不是依赖单次校准维持整个会议的有效性。对于较长或多区块的研究,或对于不太可能保持静止的人群,考虑如何处理重新校准是防止漂移的直接控制手段。
III. 数据质量阈值
没有定义的质量标准,糟糕的校准会悄然进入数据集中,难以与良好的校准区分,这与硬件实验室通过排除无法收敛的参与者所采取的问题相同。网络摄像头眼动追踪协议需要在数据收集开始之前明确规定什么算是足够的校准标准。
在 Labvanced 的实现中: 可以设置最大校准误差,作为屏幕对角线的百分比,因此超过该值的参与者会被提示重新校准,最多可配置尝试次数。如果在这些尝试后仍然超过阈值,参与者将失败该研究,而不是在未加说明的情况下被包含在质量下降的数据中。
IV. 头部位置控制
由于校准将注视映射到特定的头部位置,参与者在校准完成后出现位置漂移可能是任何远程眼动追踪设置中准确性损失的最大实际来源,研究者无法像在实验室那样亲自捕捉到这一点。
在 Labvanced 的实现中: 虚拟下巴托限制参与者的头部可以从校准位置漂移的距离,达到警示效果,为研究人员提供了一种自动化的替代方案,无需亲自检查参与者的位置。
V. 刺激定位
准确性在屏幕上并不均匀。在同一验证研究中,相对于整体数据(1.4°准确性,1.1°精确度),在屏幕中心呈现的刺激的准确性有所提高(1.3°准确性,0.9°精确度) (Kaduk et al., 2024)。外周刺激应当可以预期会比中央刺激承受更大的误差,这对研究设计有两个直接的影响。首先,在允许的范式中,将关键刺激或最重要区域放置在中心将产生最可靠的注视数据。第二,更影响与 AOI 相关的设计,任何在同一个试验中呈现的两个 AOI 需要有足够的空间超出该方法的误差范围,否则靠近两个紧密 AOI 边界的注视无法可靠地分配给任意一个。作为一条一般规则,依赖的准确性数字越接近,基于 AOI 的设计所需的间距就越多。
VI. 环境和参与者条件
本节涵盖三个环境和参与者方面的条件:照明、眼镜和网络摄像头定位。
照明
背光,即亮光源(如窗户或位于参与者后面的灯)会使其面部轮廓与背景形成剪影,从而降低基于摄像头的人脸跟踪依赖于的对比度,影响面部和眼睛特征点的精确检测。特征点检测的下降表现为较高的校准误差,而不是特定照明的标记,因此是否被捕捉取决于校准误差本身是否被检查是否超过某个阈值,而不是直接检测照明条件。
在Labvanced的实现中: 校准屏幕指示参与者处于一个稳定、光线良好的房间,背后没有亮光源,如果照明条件在会话进行中发生显著变化,则需要重新校准。这依赖于参与者的遵守,而不是自动检测:与Labvanced一旦配置后自动执行的最小屏幕大小设置不同,捕捉光线不足的校准依赖于设置最大校准误差阈值(见上面的数据质量阈值),而不是平台检测照明本身。
眼镜
实际导致跟踪下降的原因是光在到达网络摄像头之前被扭曲,眼镜造成反射,或带有有色或蓝光过滤涂层的镜片,而不是眼镜本身。没有这些特性的眼镜对校准没有实质性影响,使得眼镜的关注点比起初看起来更狭窄。
在Labvanced的实现中: 默认的参与者校准指示当前告知参与者不佩戴眼镜,这是一个保守的默认设置,而不是技术限制。该指示是可编辑的:它位于眼动追踪系统消息下的Texts & Translate静态字符串中,因此,常常佩戴眼镜的参与者群体的研究人员可以修改该指示,而不是默认排除这些参与者。
网络摄像头定位
校准将视线映射到相对于网络摄像头位置的屏幕坐标,因此网络摄像头与屏幕中心之间的偏移会增加超出仅由重新校准所能纠正的误差。这仅适用于未集成到设备中的网络摄像头,因为集成网络摄像头的位置相对于屏幕是固定的。
在Labvanced的实现中: 对于使用外部网络摄像头的参与者,校准屏幕指示他们将其尽可能靠近屏幕中心放置。
摘要表
| 设计决策 | 一般原则 | Labvanced的实现 |
|---|---|---|
| I. 校准时长 / 点数 | 较长、密集的校准提高基线准确性,但会耗费参与者时间 | 可调的30秒到5分钟,点数可配置 |
| II. 重新校准频率 | 单次校准如果位置或照明变化可能无法维持整个会话的准确性 | 可以在定义的点触发重新校准,例如在块之间 |
| III. 数据质量阈值 | 如果没有定义的标准,差的校准会默默地进入数据集 | 可配置的最大校准误差阈值,并带有自动重新校准或排除 |
| IV. 头部位置控制 | 校准后的漂移可能是准确性损失的最大实际来源 | 虚拟下巴托标记从校准位置漂移 |
| V. 刺激定位 | 中心屏幕的准确性高于周边;紧密排列的AOI存在误分类的风险 | 可用于计划AOI空间的经过验证的中心屏幕准确性数字 (1.3°) |
| VI. 环境和参与者条件 | 照明影响跟踪质量;眼镜是可以的,除非引起反射或有色涂层 | 参与者指示不应有背光,并非自动检测;屏幕大小是可配置的硬件设置;默认“不佩戴眼镜”的指示是一个可编辑的静态字符串,而不是限制 |
这些要求都不稀奇。它们属于实验室对硬件眼动追踪器的校准程序做出的决策类型,应用于研究人员无法物理监督参与者的情境。能够配置并在多种情况下实现自动化是使得验证准确性数字成为特定研究真正可以重现的内容,而不是在理想条件下报告过一次的数字。
该准确性水平支持的内容
本页所用的参考数字为1.2至1.4视觉度(1.3°中心屏幕),1.1°精确度,以及与EyeLink 1000的皮尔逊相关性约为0.8到0.9,对于特定任务达到0.9,属于Labvanced经过同行评审的验证结果 (Kaduk et al., 2024),这是迄今为止发布的最严格基准的网络摄像头眼动追踪准确性数字。采样率为30至60 Hz,具体取决于参与者的网络摄像头。这不一定代表每个基于摄像头的系统;其他实现报告不同的数字,且报告准确性的方式在各研究之间未必完全可比(例如,一些报告以像素而不是视觉度为单位,这需要额外假设屏幕大小和观看距离进行转换)。
这并不是与硬件眼动追踪器的平等。在上述协议下,研究级追踪器之间的准确性差距约为0.5°。这一差距对特定研究的意义取决于研究需要测量的内容。
在该准确性水平下得到良好支持的内容:
- 兴趣区(AOI)和停留时间分析:参与者关注了刺激的哪个区域,以及多长时间
- 注视次数和注视持续时间
- 自由观看和视觉偏好范式,经过验证的自由观看和平滑追踪与EyeLink的相关性约为80%
- 首次注视时间和一般视觉注意模式
在该准确性水平下支持不足的内容:
- 子度精确任务,其中测量本身需要解析细于大约一个视觉度
- 眼球运动动态和微眼球运动分析,受30至60 Hz采样率的限制,而不仅是空间准确性
- 需要在密集文本中达到单词级或字母级注视精度的范式
研究人员在选择网络摄像头和硬件眼动追踪时,应围绕这一线进行设计,而不是仅仅关注准确性数字:如果研究问题可以在兴趣区或注视级别上得到回答,经过验证的网络摄像头眼动追踪实现是足够的;如果需要解析视线位置在一个小于一度的分数内或捕捉眼动动态,硬件仍然是合适的工具。
常见问题解答
使用此方法的已发布研究
- Cassano-Coleman, R. Y., Izen, S. C., & Piazza, E. A. (2026). 听众系统性地整合层次性的音调背景,无论音乐训练如何。心理科学。(包括基于注视的元素)。
- Zhang, P., & Zhang, S. (2025). L2 多模态下的注意力与学习:一项基于网络摄像头的眼动追踪研究。语言学习与技术。 https://doi.org/10.64152/10125/73626
- Serrano-Carot, M., Angele, B., Xu, H., & Vasilev, M. R. (2025). 网络摄像头可用于研究阅读过程中的眼动。PsyArXiv (OSF 预印本)。 https://doi.org/10.31234/osf.io/bzt2h_v1
- Lester, C., 等. (2025). 不确定性感知 AI 模型对药剂师反应时间和决策的影响: 一项基于网络的模拟药物验证任务的随机对照试验。JMIR 医学信息学。 https://doi.org/10.2196/64902
- Wies, S., Bleier, A., & Edeling, A. (2022). 市场营销杂志。营销研究背景下的基于网络摄像头的眼动追踪。
- Banki, A., de Eccher, M., 等. (2022). 心理学前沿。发展与婴儿眼动追踪。