Labvanced Eye Tracking 2.0: 精确的网络摄像头眼动追踪用于所有在线研究
Labvanced Eye Tracking 2.0在无人监督的在线参与者中,通过标准网络摄像头的中位准确率为1.8度视觉角(5.2%的屏幕对角线)。这一结果来源于494名Prolific参与者在其自己的计算机上的数据,该匿名数据随本说明发布。
在经历了一年的开发后,Eye Tracking 2.0将网络摄像头眼动追踪在实验室中达到的准确性带入了真实的在线研究中。
主要发现
- 中位准确率为1.8°(5.2%的屏幕对角线),经过两分钟的校准和均衡筛选。
- 通过长时间校准和严格筛选,中位准确率达到了1.4°(4%)。
- 注视比第一代系统更加稳定:样本间噪声约比实验室中记录的Eye Tracking 1.x低40%。
- 99.3%的支付参与者提供了完整的数据集,而均衡筛选使招聘成本提高了约10%。
大纲
- 1摘要与介绍
- 2我们的测量方法:任务、指标和参与者
- 3具有双眼融合的改进注视引擎,适用于笔记本电脑、平板电脑和手机
- 4用于个体神经网络微调的更短更好的校准
- 5更好的筛选方法、技术预检查和简化设置
- 6头部移动和光照变化的实时修正
- 71.4到1.8视觉度的准确性,基于约500名真实参与者验证
- 8无需校准即开箱即用的被动层,非常适用于婴儿研究
- 9讨论:哪种设置适合哪种研究?
- 10亲自试试
- 11数据与可重复性
摘要
网络摄像头眼动追踪已经成为在线行为研究的强大工具,而Labvanced系统的第一代版本在实验室中与EyeLink 1000的验证结果显示其准确率约为1.4°视角(Kaduk et al., 2023)。但是,仍有几个问题待解。这样的准确性在真实的在线研究中能否保留?为什么某些参与者提供的数据远差于其他人,能否在研究者为其支付之前识别出来?校准能否缩短以便在普通的在线研究中更加实用?而那些没有通过校准或不符合要求的参与者应该如何处理?在这里,我们展示了如何提高眼动追踪的准确性,同时缩短校准时间、简化设置,并为与我们的合作伙伴Prolific的实时在线数据收集优化整个流程。随后,我们在七个录制批次中针对约500名完成的参与者进行验证,使用的任务是45个目标的准确性任务,并发布其匿名数据以便每个结果都可以得到验证。使用我们的新标准校准(约2分钟)和均衡筛选,中位参与者的误差为屏幕对角线的5.2%,在60厘米的笔记本上视角为1.8°。而通过5分钟的校准和严格的筛选,在线参与者的中位准确率达到了屏幕对角线的4%,相当于标准距离下的1.4°视角。总之,随着Eye Tracking 2.0的发布,我们展示了在我们经过同行评审的实验室比较中报告的准确性可以在线复制。
1. 介绍
眼动揭示了注意力的持续变化,无需询问。几十年来,测量眼动需要实验室设备。通过我们现有的第一代网络摄像头系统(这里称为Eye Tracking 1.x),我们展示了网络摄像头在准确预测眼动方面可以接近实验室水平:在五项标准化任务中,我们的系统与EyeLink 1000同时记录,达到了1.4°的准确性和1.1°的精确度,距离实验室的"黄金标准"只有半度(Kaduk, Goeke, Finger & König, 2023)。自此以来,独立研究小组确认了这一结果,并在众多领域中使用该系统:
- 阅读。 与EyeLink同时记录时,Labvanced网络摄像头的注视与实验室跟踪器的中位相关为0.81,并重现了词频效应(Serrano-Carot, Angele, Xu & Vasilev, 2025)。
- 婴儿发展。 在音视频同步任务中,将在家录制的婴儿网络摄像头注视与实验室眼动追踪进行了比较(Bánki, de Eccher, Falschlehner, Hoehl & Markova, 2022)。
- 决策和人机交互。 远程注视揭示了早期决策处理(Bertrand, Ouellette Zuk & Chapman, 2023),记录了在数字对象任务中眼睛和光标的协调(Bertrand & Chapman, 2023)和用户的挫折(Stone & Chapman, 2023),这些研究汇集在一篇有关网络摄像头眼动追踪实用性的博士论文中(Bertrand, 2023)。
- 语言、注意力和知觉。 研究追踪了学习者在习得第二语言词汇时如何注意文本、音频和图片(Zhang & Zhang, 2025),单词如何影响视觉注意力(Calignano, Lorenzoni, Semeraro & Navarrete, 2024),部分信息如何影响动态面孔的知觉(Alp, Lale, Saglam & Sayim, 2024)以及电子游戏玩家如何检测变化(Haverly, 2022)。
- 教育和科学传播。 学生观看讲座视频之间的注视同步预测了他们的考试表现(Sauter, Hirzle, Wagner, Hummel, Rukzio & Huckauf, 2022),而注视显示了在线广告如何分散观众对科学解释的注意(Tsutsuse, 2025)。
- 市场营销、社会与环境心理学。 Instagram用户的注视显示他们寻求影响者的关注者数量(Wies, Bleier & Edeling, 2023);对简历的注意解释了1,159名参与者如何判断歧视性招聘(Zhang & Powdthavee, 2026);对城市场景的注视与情感体验相关(Sander, Mazumder, Fingerhut, Parada, Koselevs & Gramann, 2024)。
- 健康与人机AI交互。 一项随机对照试验测量了在AI协助下药剂师在验证药物时的注视位置(Tsai et al., 2025; Kim et al., 2026),一项临床研究记录了在多动症儿童中同时进行的网络摄像头注视和脑电图(Zhao et al., 2025)。
方法论评论和入门现在将Labvanced列为已建立的网络摄像头眼动追踪系统之一(Niehorster 等,2025; Jenke & Sullivan,2025; Patterson, Nicklin & Vitta,2025; Tsuji, Amso, Cusack, Kirkham & Oakes,2022)。这些结果确立了网络摄像头眼动追踪,尤其是Labvanced,作为学术研究的一个重要工具。
重要的是,为了将我们的基于网络摄像头的数据与EyeLink进行比较,我们之前的比较项目必须在实验室内进行,这导致了我们的同行评审出版物。因此,我们可以控制整个环境,包括计算机、屏幕、网络摄像头、房间和照明。我们还能当面指导参与者,并且在这样的实验室环境中,大多数参与者可以说在进行实验时表现得最佳或至少尽了全力。在真正的在线参与者的无监督环境中几乎无法确保这些条件。在线参与者坐在他们所坐的位置上,使用他们拥有的设备,在他们的光线下,有些人根本没有注意。考虑到这些已知的缺点,我们既高兴又自豪,许多项目使用我们现有的眼动追踪技术都取得了显著的成功,并发表在领先的期刊上。然而,一些研究者没有获得他们预期的准确性,或者面临其他困难,例如参与者因长时间校准而感到沮丧,或因技术和各种其他原因而失败的参与者数量较多。例如,尽管我们已经构建了针对婴儿友好的校准方案,但两项婴儿研究发现我们的第一代眼动追踪对他们最年轻的参与者还不够可靠(Grosse Wiesmann 等,2025; Golan, Abo Shkara & Havron,2023)。
在2025年,我们开始系统评估这些缺点,并逐一解决它们。在这段旅程的尽头,尽管远未结束网络摄像头眼动追踪的开发,有了Eye Tracking 2.0。此实验室说明描述了发生了哪些变化以及原因,如何进行验证,以及实际在线参与者现在可以期待什么样的准确性。这一切背后的数据是开放获取的,任何人都可以独立复制和验证(第11节)。我们还计划进行一项新的同行评审研究,但由于这需要时间,我们希望现在分享这些结果。
2. 我们如何测量
本说明中的所有参与者数据是在大约一个月内收集的,基本上是在相同的研究范式下。然而,几乎每个录音批次之间的眼动追踪版本都有所更改,以测试或验证我们的最新开发(例如,测试姿态校正)。由于各种原因,一些批次较小而一些批次较大。本说明不是同行评审出版物,但我们相信此处报告的所有分析和结果在科学上都是严谨的,真正具有洞察力,任何人都可以下载数据并进行复制或验证。一篇关于Eye Tracking 2.0的同行评审文章,以及潜在的其他几篇主题,将随后发布。
任务。 参与者通过技术可行性检查(见第5节)并完成研究的校准;被录取的参与者接着进行了一段简短的培训,然后进行了一项包含45个目标的准确性任务:在整个屏幕上覆盖的一个9乘5的位置网格,每次以随机顺序呈现。参与者的任务是注视目标(一个普通的圆圈),并在其颜色变化时尽快点击。如果参与者点击得太早或太晚,则试验将重新进行。您可以自己运行此任务(第10节)。
指标。 我们感兴趣的主要指标是目标误差或准确性。这被定义为目标位置与目标变化前最后1000毫秒的注视位置的中位数之间的距离。我们还实现了一种新的注视检测算法,并使用了变化时的注视质心;这两种度量(注视中位数和注视)产生了几乎相同的准确性结果。有关此新注视检测机制的更多信息将在下一个实验室说明中提供。参与者的准确性被定义为他们45个错误的中位数,群体的准确性则是参与者的中位数。我们在整个报告中都报告这一中位数,并且不筛选试验或参与者。在1920 x 1080的屏幕(全高清)上,1%的对角线为22像素,5%为110像素。由于远程录音设置,我们无法可靠地记录真实的物理屏幕尺寸或参与者的确切观看距离。因此,视觉角度的误差是根据假定的参考屏幕计算的:一台14.2英寸的笔记本电脑(例如,一台14英寸的MacBook Pro),在典型的60厘米的距离下观看,这是典型在线参与者使用的13至16英寸范围的中间位置。
样本。 从2026年8月25日至9月28日期间的十个录音批次产生了约700个完成的会议。本说明中的结果基于最近七个批次的494个完成的会议:48个来自2.0.9批次,296个来自未筛选的高层次,50个来自平衡筛选和实时校正运行的高层次,以及100个来自最高层次。大约200个最早批次的会议在早期开发中塑造了系统,因此不属于报告的结果。
数据。 这494个会议的匿名数据,以及计算本说明中每个数字和图形的脚本,可以下载(见第11节)。
3. 双眼注视引擎
3.1 双眼引擎如何工作
Labvanced眼动追踪2.0是如何预测注视和注视点的?
图 1. 处理链。一切均在参与者的设备上运行(边缘推理);没有图像或视频离开设备。
双眼融合模型指的是什么?2.0 眼动引擎将双眼视为两个独立的测量值并将其结合,因此半闭的眼睛、在阴影中或被反射捕捉的眼睛的权重较小。还使用了相邻帧的信息,而不会消除真实的眼动。结果是比之前更准确、更稳健的原始注视估计,以及更具指示性的置信值,表明实际的精度和准确性。
速度和设备。 眼动引擎已重写以提高速度,并利用最新的网页技术,如 WebGPU 和 WebAssembly。综合来看,这大大加快了实时预测和微调步骤(校准)。因此,眼动追踪 2.0 在大多数笔记本电脑(除了较旧的 Chromebook 和类似设备)、台式电脑和现代平板电脑(如 iPad)上运行顺畅。手机使用缩短的校准,大约 15 秒,在我们自己的手机测量中,注视相当准确。平板和手机的现场验证将单独进行。
3.2 结果:样本噪声比 1.x 少 40 %
精度。 通过双眼融合,注视显著更稳定、更精确。在在线过程中,2.0 眼动样本的散布中位数为屏幕对角线的 2.2 %(约 0.75°),其样本间噪声约比我们 2023 年实验室研究中的眼动追踪 1.x 记录低 40 %(第 7.2 节)。
4. 更短和更好的校准
4.1 校准如何工作
在 2.0 中,校准显著缩短,并以根本新颖的方式工作。记录每个校准点的质量会在录制时进行检查,因此在参与者眨眼或移开视线时采集的点会立即重复。参与者的网络随后在他们自己的设备上进行微调,在大多数情况下比之前明显更快,微调的时间也有限制,因此没有参与者会卡住。
注视控制。 注视控制是一个简短的对接任务,在第一次眼动追踪任务之前、任何头部重新定位后,以及由准确性层级设定的定期间隔中进行:高层每三分钟一次,最高层每分钟一次。它从不打断实验。参与者将他们的头部位置看到为一个圆形,并移动头部直到其与目标圆形重叠,该步骤在一个直观的步骤中纠正了头部位置和与相机的距离。真实在线参与者从开始到结束的中位数为 6.7 秒。每次运行还可以作为当前注视质量的检查,实时修正将使用此信息(第 6 节)。
探测。 会话的第一次注视控制运行稍长,总共大约 17 秒,并作为探测:它预测参与者注视在剩余会话中的准确程度。这是筛选水平的基础(第 5 节):在更高的水平上,只有那些预测准确性更高的参与者才会被允许参加研究。
4.2 结果:高层需 4 分钟,最高层需 7 分钟
指示 + 校准在高层需 4 分钟,在最高层需 7 分钟。 从看到第一条指示文本到探测结束,真实在线参与者在高层级中位数大约需要 4 分钟(大约 2 分钟的校准点),最高层级大约需要 7 分钟(大约 5 分钟的校准点)。微调本身在两分钟的校准后需要中位数约 37 秒,在最高校准后需要约 67 秒。请注意,受试者在微调步骤中大多数情况下可以放松。
两分钟的校准对于大多数研究已经足够,但五分钟会改善结果。 在平衡筛选(第 3 层)下,两分钟的校准(高层)提供的中位数为 5.2 % 的对角线(约 1.8 视觉度)。对于大多数在线范式,这已经足够准确。最高校准在非常严格的筛选(第 5 层)下提供了大约 4 %(图 2),即约 1.4 视觉度。
| median error, % of the screen diagonal | |
|---|---|
| High tier, 2 min calibration, level 3 (n = 50) 5.2 % ≈ 1.8° at 14.2" and 60 cm | 5.24 |
| Highest tier, 4 to 5 min calibration, level 5 (n = 10) 4.1 % ≈ 1.4° at 14.2" and 60 cm | 4.06 |
5. 更好的筛选、技术预检查和更简单的设置
5.1 预检查和筛选如何工作
筛选分为两个阶段,由我们的合作伙伴和参与者招募提供商 Prolific 的新功能支持。首先,技术检查拒绝不合适的设备且不付费;然后是校准、探测和筛选,参与者费用可以由研究者选择减少。
技术拒绝。 检查设备的能力和其摄像头,眼动采样率必须达到 10 Hz。在这里失败将导致技术拒绝:参与者只需几秒(在真的慢设备上可能需要最多一分钟),并会被告知拒绝的原因。与来自 Prolific 的参与者沟通的最佳方式是创建拒绝链接,选择“不兼容设备”作为原因,并勾选“要求参与者退出研究”的复选框。大多数参与者会高兴地退回,至于那些仍全部完成的参与者,您会看到他们的状态为“不兼容设备”,因此拒绝的原因很明确。总之,只有技术合格的参与者进入实际研究并被允许进行校准。
校准后的筛选。 在校准和探测之后,系统决定参与者是否被允许参与眼动追踪任务,基于研究的筛选水平。第 0 层不拒绝任何人,允许所有人开始任务。第 1 层仅筛选失败的校准,而第 2 至第 5 层根据探测预测的准确性进行筛选,分别接受约 65、50、30 或 15 的参与者。未通过的参与者会立即被筛选掉。如果您使用 Prolific,建议使用专门的筛选链接,并支付参与者 0.50 英镑用于两分钟校准,0.80 英镑用于五分钟校准(筛选链接在 Prolific 上部分付费)。当眼动校准几乎是参与者进行的第一件事时,这些金额适用。如果眼动部分在研究中更晚才开始,请考虑启用校准重试(默认关闭),对于重试失败的参与者,提供更高的筛选费用。
综合来看,技术拒绝和筛选使我们的 2.0 系统在类似 Prolific 的众包平台上进行眼动追踪成为一种顺畅的体验,参与者的准确性和完成率都很高。
5.2 结果:99.3 % 完整数据集,约 10 % 额外成本
预检查捕捉到后期可能失败的情况。 在我们的在线数据收集中,251 名参与者中有 37 名(约 15 %)在开始之前被拒绝,主要是由于摄像头分辨率低于要求或计算机太慢无法追踪面部(图 3)。否则,其中每个人都将产生失败或无法使用的会话。我们现在也强制要求测量眼动率至少为 10 Hz,这是我们新的注视算法所需的(有关更多信息,请参见下一个实验室说明)。
| entrants turned away | |
|---|---|
| camera below required resolution | 11 |
| computer too slow to track the face | 9 |
| unsupported graphics processor | 5 |
| camera permission denied | 4 |
| no camera | 3 |
| no WebGL | 2 |
| no WebAssembly SIMD | 1 |
| gaze rate below 10 Hz | 1 |
| camera delivered no frames | 1 |
| median error, % of the screen diagonal | |
|---|---|
| 10 Hz or lower (n = 7) | 7.58 |
| 11 to 14 Hz (n = 20) | 6.33 |
| 15 Hz and above (n = 318) | 6.02 |
每个筛选层级获得可预测的收益。 应用于没有筛选的高层 295 名参与者中,每个层级在 0.2 到 0.7 分的准确性上进行入选交易(图 5)。在第 3 层、平衡下,大约一半的所有参与者被接受,入选参与者的中位数下降约 1 分,而入选参与者中低于 10 % 的比例从 17 % 降至 3 %。稍后的实时批次准确验证了这一点:在平衡筛选下,一半的参与者被接纳,他们提供了 5.24 %(第 7.1 节)。
| median error of admitted participants | |
|---|---|
| 0: No screening | 6.21 |
| 1: Failed only | 5.99 |
| 2: Light | 5.48 |
| 3: Balanced | 5.28 |
| 4: Strict | 4.88 |
| 5: Very strict | 4.17 |
筛选成本低,因为被筛选者仅部分支付。 被筛选出的参与者会收到全额费用的小部分,在我们的案例中约为十分之一,因此级别3将估计的招募成本提高约10%,级别5大约提高60%(图6)。
| participants screened out (% of those who calibrate) | |
|---|---|
| 0: No screening | 0 |
| 1: Failed only | 10.8 |
| 2: Light | 37.6 |
| 3: Balanced | 51.5 |
| 4: Strict | 71.2 |
| 5: Very strict | 86.1 |
几乎每位付费参与者都提供完整的数据集。 在最近五个批次(9月24日至28日)中,Prolific上批准和支付的450名参与者中,有447名(99.3%)提供了完整的数据集(图7)。同样重要的是,参与者在被录取后会继续参与:通过检测的参与者中,有96%到97%最终完成了研究。在技术预检查中被拒绝的参与者不再获得报酬,而被筛选出的参与者仅收到小部分费用,因此全额费用几乎完全用于可用的记录。
| participants | |
|---|---|
| passed the probe (admitted) | 468 |
| fully paid on Prolific | 450 |
| complete dataset (all 45 trials) | 447 |
6. 头部运动和光照变化的实时校正
6.1 实时校正的功能
筛选决定谁能进入研究。对于被录取的参与者,两个实时校正可以减少在会话过程中由于头部运动和光照变化所产生的误差。这两个校正在每个校准级别中默认开启,但可以在研究设置中关闭。
- 头部姿态校正。 当头部在校准过程中偏离位置时,视线估计也会随之移动。这个校正会持续补偿这种偏移。
- 视线检查校正。 定期的视线控制检查(高层级每三分钟一次,最高层级每分钟一次)用于去除校准后的漂移,包括光照变化造成的漂移。当脸部的光线明显变化时,光线变化检测器会触发额外的检查。
原始视线数据可重构:校正默认应用,但可以关闭,并且对每个视线样本应用的校正也可以在Labvanced中进行记录(作为视线触发事件的参数),因此更喜欢未校正信号的研究者可以准确恢复该信号。
6.2 结果:错误减少六分之一,尾部大部分去除
校正去除了一六分之一的错误和大部分尾部。 在进行平衡筛选的高层级(级别3,143名参与者)上,中位数从6.37%原始数据降低至5.72%(经过头部姿态校正)和5.28%(同时校正),并且恶化超过10%的参与者比例从15%降至3%(图8)。在没有任何筛选的情况下,增益相同,也是六分之一:从7.42%降至6.21%(295名参与者)。大约每四名参与者中就有三名有所改善(图9)。
| High tier (n = 295) | Highest tier (n = 99) | |
|---|---|---|
| -3 to -2 | 0 | 0 |
| -2 to -1 | 4 | 5 |
| -1 to 0 | 17 | 16 |
| 0 to 1 | 28 | 33 |
| 1 to 2 | 18 | 24 |
| 2 to 3 | 13 | 8 |
| 3 to 4 | 5 | 3 |
| 4 to 5 | 6 | 5 |
| 5 to 6 | 1 | 2 |
它们在参与者未曾开发的基础上保持有效。 校正设置一次后,无需更改,便适用于后续五个批次,其中三个为离线,两个在研究中实时运行校正(图10)。
| raw model output | with corrections | |
|---|---|---|
| 2.0.9 batch, Sep 15 (n=48) | 7.82 | 6.65 |
| Batch C, Sep 24 (n=49) | 7.13 | 6.08 |
| Batch D, Sep 24-25 (n=51) | 7.8 | 6.25 |
| High tier, level 3, Sep 26 (n=50) | 6.51 | 5.24 |
| Highest tier, Sep 27-28 (n=99) | 5.66 | 5.08 |
稳定光线保持高准确度,视线控制检查捕捉变化。 在最高层级中,99名参与者中有70名保持面部亮度在校准的5%范围内,其原始中位误差为5.49%。对于13名光线变化超过10%的参与者,面部变暗时的误差为10.94%(5名参与者),变亮时的误差为7.78%(8名参与者)(图11)。定期的视线控制检查可以捕获这种变化并进行校正。
| median error, raw | |
|---|---|
| light within 5 % of calibration (n = 70) | 5.49 |
| darker by more than 10 % (n = 5) | 10.94 |
| brighter by more than 10 % (n = 8) | 7.75 |
7. Prolific参与者的验证准确度为1.4到1.8°
7.1 准确度:高层级1.8°,最高层级1.4°
| 配置 | 筛选 | n | 原始模型输出 | 交付(经过校正) | 在14.2"和60厘米处的视觉角 |
|---|---|---|---|---|---|
| 高层级,无筛选 | 无 | 295 | 7.42 % | 6.21 % | 2.1° |
| 高层级,平衡筛选 | 级别3 | 50 | 6.51 % | 5.24 % | 1.8° |
| 最高层级 | 级别1和2 | 89 | 5.77 % | 5.20 % | 1.8° |
| 最高层级 | 级别5 | 10 | 4.65 % | 4.06 % | 1.4° |
通过两分钟的校准和平衡筛选,参与者的中位误差为对角线的5.2%,约为1.8°,十六名被录取参与者中有十五名保持在10%以下。严格筛选的最高层级达到了4%,约为1.4°。
| High tier (2 min calibration) | Highest tier (4 to 5 min calibration) | participants admitted per 100 entrants | |
|---|---|---|---|
| 0: No screening | 6.21 | 5.6 | 100 |
| 1: Failed only | 5.99 | 5.2 | 85 |
| 2: Light | 5.48 | 4.9 | 65 |
| 3: Balanced | 5.28 | 4.6 | 50 |
| 4: Strict | 4.88 | 4.3 | 30 |
| 5: Very strict | 4.17 | 3.8 | 15 |
误差在屏幕上几乎均匀分布,外部目标并不比中央目标差(图13)。下面的计算器将预期的准确度转换为任何屏幕和观看距离。
Medians over participants of each participant's median trial error, with both live corrections on. The Highest-tier ladder is a projection from 100 participants and will be refined as its screening reference is frozen.
7.2 精确度:0.75°散布,0.6°样本间距
精确度在第一代产品中显著提高。为了对比相同条件,我们在2023年的实验室研究中重新计算了Eye Tracking 1.x的精确度,该研究中每位参与者的记录同样使用了网络摄像头和EyeLink 1000。对于每个网格试验,我们选择EyeLink所测得的最稳定的1秒窗口,以确保两个追踪器在真实的凝视期间都在测量,同样应用与2.0相同的两个标准测量:样本围绕其均值的散布(SD)和样本间距的均方根(RMS-S2S)。
| 精确度(参与者中位数) | Eye Tracking 1.x,实验室 (n = 19) | Eye Tracking 2.0,在线 (n = 295) | EyeLink 1000,实验室 (n = 19) |
|---|---|---|---|
| 1秒内散布(SD) | 2.4 % (0.87°) | 2.2 % (0.75°) | 0.3 % (0.10°) |
| 样本间距(RMS-S2S) | 2.8 % (1.02°) | 1.75 % (0.60°) | 0.3 % (0.10°) |
数值为屏幕对角线的百分比,视角基于每个研究自己的屏幕(实验室中的15英寸显示器在60厘米处,在线的14.2英寸笔记本在60厘米处)。两个网络摄像头系统的采样率约为30 Hz。
在线的2.0信号的散布比实验室的1.x信号少约10%,样本间距噪声降低约40%,从约1.0°降至0.6°。值得注意的是,比较中1.x在两个方面占优势:其记录是在实验室控制下进行的,而且其窗口是EyeLink选出的最稳定的一秒,这在在线环境中无法实现。因此,如果有任何低估,改进的程度可能会被低估。EyeLink当然仍然是最精确的系统,但2.0缩小了与之的差距。
8. 无需校准的被动层
8.1 被动层的工作原理
使用Eye Tracking 2.0,可以在不进行校准的情况下运行被动模型,这在某些实验场景中非常有用。它仅要求参与者授权相机访问;然后视线跟踪预测会立即开始。该功能为无法或不应该进行校准的参与者设计,婴儿尤其如此:校准一直是婴儿眼动追踪中最困难的部分,许多婴儿研究使用所谓的优选观看范例,即询问孩子是看左边还是右边。能够可靠地实时分类这一点,并完全在参与者自己的机器上完成,对于婴儿注意力研究来说可能是一场变革,但对于其他需要在后台静默进行眼动追踪的领域也是如此。在第10节中,您可以亲自进行婴儿研究。
8.2 预期精度:约 4°(估计)
被动层不是 Prolific 批次的一部分,其实地验证仍待进行。婴儿实验室理应希望在实际婴儿中进行验证,这超出了 Prolific 提供的内容。如果您在婴儿实验室工作或代表婴儿实验室,并希望帮助验证被动层,请与我们联系:我们非常希望进行合作。
也就是说,根据我们 extensive 的内部测试,我们的工作估计是屏幕对角线约 11-12 % 的误差,在 60 cm 的笔记本电脑上约 4°。图 14 显示了这对典型实验设计的意义:在被动层的中位误差下,注视屏幕左半部分中间目标的视线远离右半部分。甚至有很大的机会可以以足够的信心区分 4 到 6 个屏幕区域。关于这方面的更多数据将在时间推移中提供。
图 14. 每层的中位误差以圆圈的形式按比例绘制在 16:9 屏幕的左半部分目标周围。虚线将屏幕分为左右两部分。被动图形是一个估计值;其他两个是测量值。
9. 讨论
我们经过同行评审的 2023 年比较显示,实验室中的网络摄像头可以跟踪注视到约 1.4°。本说明表明,利用我们 Webcam Eye Tracking 2.0 引擎,在参与者的家中、自己的笔记本电脑和自己的光线下,网络摄像头可以在经过两分钟校准和平衡筛选后,将注视跟踪到约 1.8°,而经过长时间校准和非常严格筛选后,可以将注视跟踪到约 1.4°。实际上,前一代在实验室控制下达到的精度现在在网上达到了。三个机制解释了大部分变化:改进的双眼注视引擎,更好地捕捉个体差异和漂移的校准,以及消除头部姿势和光照系统误差的实时校正。
对研究人员而言,这些结果非常实用。心理学、语言学、社会学、经济学、市场营销等领域的大多数研究可以运行高层,并预期约 1.8° 的精度,这很可能足够捕捉预期效应。研究较小区域的研究,例如单词数量多且间隔小的阅读任务(尝试阅读研究),可以利用最高层,获得大约 1.5° 的精度(经过严格筛选)或 1.4° 的精度(经过非常严格筛选)。另一方面,研究婴儿和幼儿注意力的研究人员现在可以在不进行任何校准的情况下进行跟踪,因此也消除了校准给数据收集带来的困难(第 8 节)。当然在这两个极端之间还有几个步骤。在 Labvanced 界面中的设置大大简化,并且它为每个选择显示的预期精度基于实际测量。简而言之,您的下一个眼动追踪项目可以在今天开始。
哪种设置适合哪项研究?
下表是一个粗略的指南,而不是严格的规则集。对于每个任务和研究,请查看兴趣区域的数量、它们的大小,以及最重要的,它们之间的距离,并相应选择设置:两个相距较远的大区域比许多并排的小区域容忍更多的误差。如果您不确定哪些设置适合您的设计,与我们联系,我们会与您一起查看。
| 您的研究设计 | 推荐层 | 推荐筛选 | 指令和校准 | 预期精度 | 额外招募成本 |
|---|---|---|---|---|---|
| 婴儿注意,左与右(偏好注视) | 被动(婴儿) | 无 | 无 | 12 % (≈ 4°) | 无 |
| 婴儿在四到六个屏幕区域中的注视时间,与容忍 40 秒动物校准的幼儿 | 中等(婴儿) | 无 | 1 分钟内 | 10 % (≈ 3.4°) | 无 |
| 在另一项任务(视频、广告、仪表板)的背景中记录的注意力和参与度,校准不可选 | 被动 | 无 | 无 | 12 % (≈ 4°) | 无 |
| 短任务,需要最少设置时间,最多有 6 个屏幕区域或 4 个较大的 AOI | 中等 | 无 | 约 30 秒 | 9 % (≈ 3°) | 无 |
| 短任务需要较短设置时间,具有 4 到 8 个较大的 AOI 并且它们之间距离良好 | 良好 | 仅失败校准(等级 1) | 约 3 分钟 | 6.9 % (≈ 2.4°) | 约 +2 % |
| 对于大多数中等或较长任务,具有标准大小的 AOI(例如,屏幕上有一个面孔,眼睛和嘴巴的 AOI 分开)。最多 12 个区域的网格(3x4)。 | 高 | 轻度(等级 2) | 约 4 分钟 | 5.6 % (≈ 1.9°) | 约 +6 % |
| 具有较小 AOI 在一帧中的研究,或大约 15 个区域的网格(3 x 5) | 高 | 平衡(等级 3) | 约 4 分钟 | 5.2 % (≈ 1.8°) | 约 +10 % |
| 最小的兴趣区域,或者非常接近的区域,例如短单词的词级阅读。可靠的网格,最多 24 个区域(4x6)。 | 最高 | 严格(等级 4) | 约 7 分钟 | 4.3 % (≈ 1.5°) | 约 +25 % |
预期的精度是 admitted 参与者在开启校正情况下的中位数,测量于高层和最高行,并估算 于其他层;额外招募成本按筛选出参与者计算为完成参与者的十分之一。筛选不适用于被动层和中层:每个人都被允许参与。
Labvanced 的研究设置中的设置向导问同样的两个问题,即精度层和筛选级别,并在研究开始前显示您选择的预期精度。
常见问题
网络摄像头注视跟踪有多准确?
使用 Labvanced Eye Tracking 2.0,在线参与者的中位数经过两分钟的平衡筛选后准确到 1.8° 的视觉角度,经过长时间校准和非常严格筛选后约为 1.4°。在实验室中,第一代在与 EyeLink 1000 的直接比较中达到了 1.4°(Kaduk et al., 2023)。
网络摄像头注视跟踪对阅读研究是否足够准确?
对于词级阅读,我们推荐在严格筛选下使用最高层,能提供约 1.5° 的精度。较大的兴趣区域,如面孔、场景或页面区域,可以在高层 1.8 至 1.9° 下工作。上表列出了哪个设置适合哪个研究设计。
校准需要多长时间?
在高层,指令和校准大约需要 4 分钟,在最高层大约需要 7 分钟。较短的层需要 30 秒到 3 分钟,而被动层根本不需要校准。
网络摄像头注视跟踪对婴儿有效吗?
被动层在相机开启后即可开始跟踪,无需任何校准。其估计误差约为 4°,这足以在偏好注视研究中区分向左和向右的注视。与婴儿的实地验证仍待进行。
网络摄像头注视跟踪与实验室眼动追踪器相比如何?
实验室追踪器如 EyeLink 1000 的精确度更高,散布约 0.1°,而网络摄像头为 0.75°。网络摄像头注视跟踪在参与者自己的计算机上达到约 1.4 到 1.8° 的精度,这对大多数基于兴趣区域的设计是足够的。
我可以将现有研究切换到 2.0 吗?
可以,任何时候都可以:在研究设置中选择 Eye Tracking 2.0。现有研究将保持在 1.x,直到您切换它们,而新研究将从 2.0 开始。
这包含在我的许可证中吗?
Eye Tracking 2.0 是所有 Premium 和 Ultimate 许可证的一部分,就像之前的 Eye Tracking 1.x。
2.0 研究记录什么?
与之前相同的注视输出,x 和 y 位置,现在更精确、更准确,每个样本都有置信值。默认情况下,使用新的合并检测器检测注视。如果您想要未修正的信号,应用于每个样本的修正可以作为注视触发器的参数记录。被筛选出或技术上拒绝的参与者在研究的组统计中列出它们的状态。
我的数据有什么变化吗?
结构保持不变。置信值现在采用不同的尺度:它是通过与1.x完全不同的量计算得出的,因此其数值通常较低。这仅是尺度的变化,而不是数据质量的变化,但这意味着1.x研究中的置信阈值不能延续到2.0。置信度也是特定于参与者的:用于比较同一参与者内的样本或试验,而不是跨参与者比较。一个参与者的置信度为0.3,不能代表另一个参与者的0.3。我们的数据清楚地表明:参与者的典型信心范围从0.09到0.73,但这并没有说明他们的准确性。那些典型置信度在0.3左右的参与者所交付的错误范围从3.7%到20.8%。在同一参与者内,相比之下,低置信度的试验往往不那么准确。
接下来会发生什么?
Labvanced Webcam Eye Tracking 2.0是一个持续了数月的项目,几乎涉及我们眼动追踪代码的每一部分。这绝不是我们最后的改进。以下是我们当前正在研究的五个主题。
1. 眨眼检测
眨眼会短暂干扰凝视估计。我们将可靠地检测到它们,并在其间保持凝视稳定,使得眨眼不再看起来像眼睛运动。一个清晰的眨眼信号本身也很有趣:眨眼率和时机是疲劳、兴奋和认知负荷的公认测量指标,可能成为每个眼动追踪研究的新输出。
2. 屏幕上的均匀准确性
准确性在屏幕上已经几乎均匀分布(图13)。我们正在努力消除屏幕区域之间剩余的小系统性差异,而不添加任何校准点。
3. 自适应校准
如今,研究者提前选择校准的时间长度,每个参与者都使用相同的校准。我们正在开发一种适应参与者的校准:对于简单的情况使用较短的校准,只有在效果明显的情况下才使用较长校准。
4. 注视检测
我们下一个实验笔记,注视检测分析,比较了基于网络摄像头的数据上的注视检测算法,这些数据是在与EyeLink 1000同时录制的,并在一项快速注视任务中完成。它展示了眼动追踪2.0的新默认检测器如何将被报告为准确一个注视的稳定凝视比例翻倍。
5. 数据中的会话质量
每个会话在运行时已经测量了许多自身质量。我们将为每个会话添加一个紧凑的质量输出,给予总体质量分数,以便研究人员在数据收集后对会话或参与者进行排名、加权或排除。
10. 亲自试试
评估网络摄像头眼动追踪的最佳方法是亲身体验。下面的研究在您的浏览器中运行眼动追踪2.0,使用您自己的网络摄像头:允许相机访问,跟随校准,并亲自查看。与眼动追踪2.0中的所有内容一样,处理在您的设备上运行,且没有任何图像或视频离开。准确性任务是本笔记结果背后的研究;其他研究则是典型研究设计的演示,并不属于验证的一部分。
11. 数据与可重复性
本笔记中的每个结果都可以独立检查。我们发布了494个已完成会话的匿名化数据,这些结果基于这些数据,并随附计算每个数字和每个图表的脚本。
它包含的内容。 每个参与者一行(等级、筛选、校准结果和时机),每个45目标准确性任务的试验一行及其错误,原始和通过校正后的,以及每个目标变化前的最后一秒,准确性指标所使用的窗口:带模型置信度的凝视样本、注视以及在最高等级下的面孔亮度。它还包括每个凝视控制运行的时机和不按参与者共享的值的汇总表(开始前的技术拒绝、探测后的保留以及2023年的实验室精确度值)。一个README文档描述了每一列。
如何复制。 脚本仅需要Python 3及其标准库。运行scripts/accuracy.py然后scripts/article_numbers.py:它们将根据本笔记中描述的方式准确应用指标,并写入文本中引用的每个图表和每个数字的数据。唯一未从数据中计算的值是汇总表、图12中设置在产品中的最高等级预期准确性以及被动级别的估计准确性。
隐私。 数据不包含任何类型的标识符:没有Prolific或Labvanced ID,没有姓名,没有人口统计信息,没有设备或浏览器信息,以及没有绝对日期或时间。每个参与者都有一个随机ID,与任何其他记录无关,也不存在关键。没有摄像头图像或视频被记录。所有参与者都已同意匿名使用他们的数据。
许可证。 版权© 2026 Scicovery GmbH(Labvanced)。数据和脚本根据CC BY-NC 4.0许可:您可以在非商业目的下使用、重新分析和共享它们,并公开您的结果,同时注明Labvanced并引用本笔记。商业用途需要我们的书面许可。
如何引用。 APA格式,准备好复制:
Labvanced(2026)。Labvanced Eye Tracking 2.0:准确的网络摄像头眼动追踪用于所有在线研究。 Labvanced实验室笔记。 https://www.labvanced.com/content/research/zh/lab-notes/2026-10-webcam-eyetracking-2-0/
在您的方法部分描述它。 欢迎您调整此段落(用您的设置替换方括号中的值):凝视是通过Labvanced Eye Tracking 2.0(Labvanced,2026)在线使用参与者的网络摄像头录制的,使用[高]校准等级和[均衡]参与者筛选。应用了实时头部姿态和凝视控制校正。在此配置的验证中,中位准确率为[5.2 %]屏幕对角线的约[1.8°]视觉角度(在60厘米处)。
参考文献
- Alp, N., Lale, G., Saglam, C., & Sayim, B. (2024). 处理动态面孔感知中的部分信息的影响。Scientific Reports, 14, 9794. https://doi.org/10.1038/s41598-024-58605-7
- Bertrand, J. K. (2023). 网络摄像头眼动追踪的实用性:在决策和数字人机交互中的经验教训和实际应用 [阿尔伯塔大学博士论文]。 https://doi.org/10.7939/r3-83ge-t169
- Bertrand, J. K., & Chapman, C. S. (2023). 眼手协调的动态在在线数字物体交互任务中的眼-光标协调中灵活保持。Proceedings of the 2023 CHI Conference on Human Factors in Computing Systems. ACM. https://doi.org/10.1145/3544548.3580866
- Bertrand, J. K., Ouellette Zuk, A. A., & Chapman, C. S. (2023). 远程捕获的决策难度的连续测量:II. 网络摄像头眼动追踪揭示早期决策处理。bioRxiv. https://doi.org/10.1101/2023.06.06.543799
- Bánki, A., de Eccher, M., Falschlehner, L., Hoehl, S., & Markova, G. (2022). 比较在线网络摄像头和实验室基础眼动追踪评估婴儿的视听同步知觉。Frontiers in Psychology, 12, 733933. https://doi.org/10.3389/fpsyg.2021.733933
- Calignano, G., Lorenzoni, A., Semeraro, G., & Navarrete, E. (2024). 图像前的文字:语言在偏向视觉注意力中的作用。Frontiers in Psychology, 15, 1439397. https://doi.org/10.3389/fpsyg.2024.1439397
- Golan, M., Abo Shkara, M., & Havron, N. (2023). 孩子通过形态学引导推断新动词的意义。PsyArXiv. https://doi.org/10.31234/osf.io/xk8eu
- Grosse Wiesmann, C., Rothmaler, K., Hasan, E., Habdank, K., Yang, C., Yeung, E., & Southgate, V. (2025). 自我参考记忆偏差在婴儿期之前被他人参考偏差所预先影响。Nature Communications, 16, 6311. https://doi.org/10.1038/s41467-025-61642-z
- Haverly, C. (2022). 视频游戏对变化检测的影响:一项眼动追踪研究。Horizons, 7, 68–73. 夏威夷大学马诺阿分校。 ScholarSpace
- Jenke, L., & Sullivan, N. (2025). 注意力与政治选择:政治学中眼动追踪的基础。Political Analysis, 33(4), 298–314. https://doi.org/10.1017/pan.2025.8
- Kaduk, T., Goeke, C., Finger, H., & König, P. (2023). 网络摄像头眼动追踪接近实验室标准:比较一种新的基于网络摄像头的系统与EyeLink 1000。Behavior Research Methods, 56(5), 5002–5022.
- Kim, J. Y., Rowell, B., Whitaker, M., Chen, Q., Al Kontar, R., Lester, C., & Yang, X. J. (2026). AI辅助时机对药剂师对自动药丸识别技术信任的影响。JMIR Human Factors, 13, e92822. https://doi.org/10.2196/92822
- Niehorster, D. C., Nyström, M., Hessels, R. S., Andersson, R., Benjamins, J. S., Hansen, D. W., & Hooge, I. T. C. (2025). 眼动追踪的基础第4部分:进行眼动追踪研究的工具。Behavior Research Methods, 57, 46. https://doi.org/10.3758/s13428-024-02529-7
- Patterson, A. S., Nicklin, C., & Vitta, J. P. (2025). 基于网络摄像头眼动追踪的研究方法建议:范围审查。Research Methods in Applied Linguistics, 4(3), 100244. https://doi.org/10.1016/j.rmal.2025.100244
- Sander, I., Mazumder, R., Fingerhut, J., Parada, F. J., Koselevs, A., & Gramann, K. (2024). 超越建筑密度:从粗略到细致的城市环境情感体验分析。Journal of Environmental Psychology, 96, 102337. https://doi.org/10.1016/j.jenvp.2024.102337
- Sauter, M., Hirzle, T., Wagner, T., Hummel, S., Rukzio, E., & Huckauf, A. (2022). 眼动同步性是否能预测在线学习环境中的测试表现?ETRA '22: Symposium on Eye Tracking Research and Applications. ACM. https://doi.org/10.1145/3517031.3529239
- Saxena, S., Fink, L. K., & Lange, E. B. (2023). 用于在线实验的网络摄像头眼动追踪的深度学习模型。Behavior Research Methods. https://doi.org/10.3758/s13428-023-02190-6
- Serrano-Carot, M., Angele, B., Xu, H., & Vasilev, M. R. (2025). 网络摄像头可以用来研究阅读过程中的眼动。PsyArXiv. https://doi.org/10.31234/osf.io/bzt2h_v1
- Stone, S. A., & Chapman, C. S. (2023). 无意识挫败感:使用眼动和鼠标追踪动态评估用户体验。Proceedings of the ACM on Human-Computer Interaction, 7(ETRA), 168. https://doi.org/10.1145/3591137
- Tsai, C. C., Kim, J. Y., Chen, Q., Rowell, B., Yang, X. J., Kontar, R., Whitaker, M., & Lester, C. (2025). 人工智能的有用性和不确定性感对药剂师认知交互的影响:随机对照试验。Journal of Medical Internet Research, 27, e59946. https://doi.org/10.2196/59946
- Tsuji, S., Amso, D., Cusack, R., Kirkham, N., & Oakes, L. M. (2022). 编辑:远程实证研究:发展科学的新方法。Frontiers in Psychology, 13, 938995. https://doi.org/10.3389/fpsyg.2022.938995
- Tsutsuse, K. S. (2025). 在线广告对处理和评估科学解释的影响 [夏威夷大学马诺阿分校硕士论文]。 ScholarSpace
- Wies, S., Bleier, A., & Edeling, A. (2023). 寻找合适的影响者:关注者数量如何推动社交媒体参与。Journal of Marketing, 87(3), 383–405. https://doi.org/10.1177/00222429221125131
- Zhang, P., & Zhang, S. (2025). L2多模态中的注意力与学习:一项基于网络摄像头的眼动追踪研究。Language Learning & Technology, 29(1), 1–27. https://doi.org/10.64152/10125/73626
- Zhang, X., & Powdthavee, N. (2026). 注意力作为道德判断的瓶颈:比较上下文如何扭曲辨别识别。PsyArXiv. https://doi.org/10.31234/osf.io/pnurb_v1
- Zhao, Y., Li, Y., Zhang, K., Li, Z., Hu, Y., Tan, L., Jia, H., Wang, S., Gao, Z., Song, Y., Li, X., Zhao, C., & Cao, A. (2025). 颅外光刺激改善注意力缺陷多动症儿童的选择性注意。medRxiv. https://doi.org/10.1101/2025.09.18.25335086
- Labvanced Eye Tracking文档:研究设置,数据输出。
<style>
.lab-byline { color: #666; font-size: 0.9rem; }
.lab-caption { font-size: 0.9rem; color: #555; margin-top: 0.5rem; line-height: 1.4; }
.lab-pipeline { width: 100%; height: auto; margin-top: 1rem; }
.lab-anchor { display: block; scroll-margin-top: 8rem; }
/* A block wider than the text column, centred on it: for tables with many columns. The
content column is 740px wide; the block may grow to 1100px as long as it stays inside the
main area (viewport minus the 20rem sidebar and the content padding). */
.lab-wide { width: min(1100px, calc(100vw - 25rem)); margin-left: 50%; transform: translateX(-50%); }
.lab-wide table { font-size: 0.92rem; }
.lab-cite { border: 1px solid #ddd; border-radius: 6px; padding: 0.9rem 1rem; margin: 0.75rem 0 1.25rem; }
.lab-cite p { margin: 0 0 0.75rem; }
.lab-cite button { background: none; color: inherit; font: inherit; font-weight: 600; cursor: pointer; }
@media (max-width: 719px) { .lab-wide { width: calc(100vw - 3rem); } }
.lab-lead { font-size: 1.15rem; line-height: 1.55; text-align: left; margin: 0.75rem 0 1.25rem; }
.lab-keys { display: grid; grid-template-columns: repeat(auto-fit, minmax(180px, 1fr)); gap: 0.75rem; margin: 0 0 1.5rem; }
.lab-key { border: 1px solid rgba(127, 127, 127, 0.35); border-radius: 8px; padding: 0.9rem 1rem; display: flex; flex-direction: column; gap: 0.25rem; }
.lab-key-num { font-size: 1.9rem; font-weight: 700; line-height: 1.1; }
.lab-key-txt { font-size: 0.9rem; line-height: 1.35; opacity: 0.85; }
.lab-toc { list-style: none; padding-left: 0; text-align: left; position: relative; z-index: 1; }
.lab-toc li { margin: 0.35rem 0; }
.lab-toc a { display: flex; gap: 0.6em; }
.lab-toc-num { flex: 0 0 1.4em; font-weight: 600; }
.lab-cards { display: grid; grid-template-columns: repeat(auto-fit, minmax(280px, 1fr)); gap: 1rem; margin: 1.25rem 0 1.5rem; }
.lab-card { border: 1px solid rgba(127, 127, 127, 0.35); border-radius: 8px; padding: 1rem 1.1rem; display: flex; flex-direction: column; }
.lab-card p { margin: 0 0 0.75rem; font-size: 0.95rem; line-height: 1.45; text-align: left; }
.lab-card .lab-card-title { font-weight: 700; font-size: 1.05rem; margin-bottom: 0.4rem; }
.lab-card-btn { margin-top: auto; align-self: flex-start; padding: 0.4rem 0.9rem; border: 1px solid currentColor; border-radius: 6px; font-weight: 600; text-decoration: none; }
.lab-cta { border: 1px solid rgba(127, 127, 127, 0.35); border-radius: 10px; padding: 1.25rem 1.4rem; margin: 2rem 0; }
.lab-cta p { margin: 0 0 0.75rem; text-align: left; }
.lab-cta .lab-cta-title { font-size: 1.25rem; font-weight: 700; margin-bottom: 0.35rem; }
.lab-cta-links { display: flex; flex-wrap: wrap; gap: 0.6rem; }
.lab-card-soon { margin-top: auto; align-self: flex-start; padding: 0.4rem 0.9rem; border-radius: 6px; font-weight: 600; opacity: 0.6; border: 1px dashed currentColor; }
.lab-download { margin: 1rem 0 1.25rem; }
.lab-download a { display: inline-block; padding: 0.55rem 1rem; border: 1px solid currentColor; border-radius: 6px; font-weight: 600; text-decoration: none; }
</style>