labvanced logoLabVanced
  • Research
    • Publications
    • Researcher Interviews
    • Use Cases
      • Developmental Psychology
      • Linguistics
      • Clinical & Digital Health
      • Educational Psychology
      • Cognitive & Neuro
      • Social & Personality
      • Arts Research
      • Sports & Movement
      • Marketing & Consumer Behavior
      • Economics
      • HCI / UX
      • Commercial / Industry Use
    • Labvanced Blog
    • Services
  • Technology
    • Feature Overview
    • Code-Free Study Building
    • Eye Tracking
    • Mouse Tracking
    • Generative AI Integration
    • Multi User Studies
    • More ...
      • Reaction Time/Precise Timing
      • Text Transcription
      • Heart Rate Detection (rPPG)
      • Emotion Detection
      • Questionnaires/Surveys
      • Experimental Control
      • Data Privacy & Security
      • Desktop App
      • Mobile App
  • Learn
    • Guide
    • Videos
    • Walkthroughs
    • FAQ
    • Release Notes
    • Documents
    • Classroom
  • Experiments
    • Cognitive Tests
    • Sample Studies
    • Public Experiment Library
  • Pricing
    • Licenses
    • Top-Up Recordings
    • Subject Recruitment
    • Study Building
    • Dedicated Support
    • Checkout
  • About
    • About Us
    • Contact
    • Downloads
    • Careers
    • Impressum
    • Disclaimer
    • Privacy & Security
    • Terms & Conditions
    • Third-Party Licenses
  • Appgo to app icon
  • Logingo to app icon
Research
出版物
任务
问卷与量表
方法论
研究者访谈
使用案例
Labvanced 博客
比较
服务
  • 中國人
  • Deutsch
  • Français
  • Español
  • English
  • 日本語
出版物
任务
问卷与量表
方法论
研究者访谈
使用案例
Labvanced 博客
比较
服务
  • 中國人
  • Deutsch
  • Français
  • Español
  • English
  • 日本語
  • 出版物
  • 任务
  • 问卷与量表
  • 方法论
  • 研究者访谈
    • 比较在线网络摄像头与实验室眼动跟踪在婴儿音视频同步感知评估中的应用
    • 寻找黄金锁的影响者 - 追随者数量如何推动社交媒体互动
    • 9到36个月大婴儿的语义干扰:一项关于婴儿词汇能力的家庭眼动跟踪研究
    • 歌曲比言语韵律更易记 - 离散音高有助于听觉工作记忆
    • 语法决策任务中的正字法相关性和转置词效应
    • 悲伤诱导后的音乐情绪调节
    • 儿童学习非相邻依赖关系
    • 个性在噪音中听到
    • 所有的眼睛都一样吗?
    • 婴儿中的口头启动
  • 使用案例
    • 研究领域

      • 发展心理学
      • 语言学
      • 临床与数字健康
      • 教育心理学
      • 认知与神经
      • 社会与人格心理学
      • 艺术、音乐与数字媒体
      • 运动与运动心理学
      • 市场营销与消费者行为
      • 经济学
      • 人机交互 / 用户体验
      • 商业 / 行业应用
    • 研究者

      • 学生
      • 研究者
      • 团队
  • 博客
    • 教育心理学研究中的生成性人工智能
    • 婴儿与幼儿的网络摄像头眼动追踪研究最佳实践
    • 延迟折扣任务中的刺激类型
    • 延迟折扣任务
    • 基于正念的自我效能量表 - 修订版 (MSES-R)
    • 团队动态与研究
    • 斯特鲁普任务 | 历史、任务描述、数据与心理学
    • BKB句子测试 | 程序与研究
    • 心理学中的双重效应 | 概述与研究
    • 纳冯任务:任务设置、研究及更多
    • 经过同行评审的网络摄像头眼动追踪
    • 克尔西方块敲打测试:从立方体到在线设计
    • 点探测任务 | 全面指南
    • 记忆的类型:研究的概念
    • 最后通牒游戏
    • 视觉搜索任务
    • 心理学研究中的注意力任务
    • 广泛性焦虑障碍量表-7 (GAD-7)
    • 心理学中的决策任务
    • 强迫症量表修订版 (OCI-R)
    • 评估执行功能技能 | 任务与电池
    • 繁荣量表 (FS) 问卷
    • Labvanced与开放科学精神
    • 温床效应的心理学
    • Bouba-Kiki效应及任务
    • 词汇决策任务:访问心理词典
    • 带聊天框的图像描述任务和游戏
    • 顺畅的数据收集过程 | 研究的6个技巧
    • 使用Labvanced进行音乐研究
    • 7个经典认知任务及示例
    • 心理旋转测试 | 一项空间处理任务
    • Labvanced中的XY坐标
    • 5个著名的社会心理学实验
    • 远程与婴儿友好型眼动追踪的力量
    • 威斯康星卡片分类测试
    • 13个头部追踪研究的应用案例
    • 改善你感知能力的5个技巧
    • 优先注视范式简介
    • 对偏头痛和头痛患者进行认知研究
    • 着陆页 - 信息比你想的要多!
    • 耳机检查 - 过去与现在
    • 样本研究 - 有用的模板和演示!
    • 什么是神经可塑性?
    • 15个著名发展理论
    • 视觉注意力与眼动追踪
    • 什么是眼动追踪技术?
    • 应用语言学研究中的眼动追踪
    • 10个流行语言实验
    • 安慰剂效应
    • 实验设计的6个关键概念
    • 条件游戏听力测验
    • 艾宾浩斯错觉
  • 比较
  • 服务
    • 概述
    • 联合拨款申请
    • 受试者招募
    • 研究构建
    • 专注支持
    • 许可证比较

AI 同伴:方法论和有效性

AI 同伴是一个脚本或模型驱动的代理,代表人类同伴在欺骗、社会压力和谈判范式中的角色。与训练有素的人类同伴不同,它的行为可以在每个参与者之间精确指定、记录和再现,这也是使用它的核心方法论论据,同时也是它需要作为设计决策进行评估而非默认采用的原因。

本页面将 AI 视为在其他经典范式中代替人类角色的工具:AI 是工具,而不是被测量的对象。这与 AI 本身为研究对象的研究是不同的,后者在下面的 FAQ 中有介绍。


目录

  • 什么算作 AI 同伴
  • 支持 AI 同伴的理由
  • 使用 AI 同伴时的方法论考虑
  • 常见问题

什么算作 AI 同伴

在经典意义上,同伴是指在参与者看来是其他参与者或普通交互伙伴的人,但实际上是在实验者控制下按照脚本行动的,最常见于欺骗范式(例如:顺应性研究中的假参与者)、社会压力范式(例如:在信任游戏中表现不合作的伙伴)和谈判或讨价还价任务(例如:其报价遵循预定模式的对手)。AI 同伴以模型驱动的代理代替该人类同伴:参与者仍然相信,或者被引导相信,他们正在与研究中的另一方进行互动,但该方的反应是通过一个 AI 系统 生成或编写的,而不是由受过训练的人类演员执行的。

这并不是一种新的实验设计。它是现有设计中的另一种可行方法,且该领域已经有了同一理念的低技术版本:Labvanced 自己的 多用户研究 文档描述了一种“虚拟对手”策略,参与者被告知他们是在与其他参与者对战,但对方实际上是一个随机选择的算法。该方法是 AI 同伴理念的真正前身,但是有限的:随机选择算法无法进行脚本化的社会压力交流、谈判或维持可信的欺骗对话。生成性 AI 增加的能力是能够产生自然的、具有上下文响应的语言,并在某些设计中产生音频或图像,取代人类同伴的现场即兴表演,这正是使这种方法适用于随机选择算法永远无法支持的范式的原因。


支持 AI 同伴的理由

AI 同伴并不是人类同伴的完全替代; 它是另一种可行且在某些设计中更强大的选择。有四个考虑因素支持它:控制、可重复性、伦理和规模。

控制

受过训练的人类同伴被要求在每个参与者中再现固定的行为协议:相同的语气、相同的反击、相同的让步时机。在实践中,同伴会出现偏差。疲劳、情绪和多次实验的累积经验都会引入研究者未设计的变异,而这种变异是一个干扰因素,因为它与时间和实验顺序相关,而不是与实验操作相关。通过固定的提示和固定的配置生成的 AI 代理不会像人类一样感到疲劳或积累会话经验,这消除了这种特定来源的会话之间的漂移,尽管它引入了自己的一致性要求(见下文)。

在 Labvanced 的实现中: 相同的 Send to OpenAI 配置在每个任务会话中保持不变,因为它是一个固定设置,而不是一个人每次都需从记忆中再现的协议。

可重复性

人类同伴的确切行为在方法部分很少能完全具体化。即使是详细的脚本也会留下人类演员用判断填补的空白,因此不同实验室试图复制该研究时实际上是在再现原始同伴表现的近似,而不是表现本身。记录的提示、模型版本和生成参数是完整且可移植的规范:另一个实验室可以运行相同的配置,而不是训练一个新演员来近似原来的表现。

在 Labvanced 的实现中: 模型版本、温度和提示本身直接保存在任务配置中,因此本节所要求的完整规范并不是额外的文档工作,而是已经存储的内容。

伦理

用现场人类同伴欺骗参与者承担着伦理责任,这就是大多数机构审查程序通常要求研究人员进行说明和解密的原因:在某种意义上,实际的人参与了欺骗。AI 生成的同伴改变了这种安排的伦理性质,尽管它并没有消除实验设计本身中的潜在欺骗,这仍然需要与任何欺骗范式相同的解密和同意处理。这减轻了同伴使用的某一特定伦理维度; 但并不使得欺骗范式在伦理上更简单。

规模

在线和远程研究能招募比单个实验室会话更多的参与者,这带来了一个特定于人类同伴的扩展问题:每增加一个参与者就需要另一个同伴会话,因此更大的样本意味着要招募、培训和安排更多的同伴,还要确保他们之间在行为上的一致性,此外还要处理已在控制上述会话间漂移的同伴。在这方面,AI 同伴不存在这个问题。相同的配置对第千个参与者的运行方式与第一个参与者完全相同,无需额外的人员、培训或同伴之间的一致性检查。这使得 AI 同伴特别适用于大样本的在线研究。

在 Labvanced 的实现中: 相同的 AI 同盟配置无论研究收集 20 名参与者还是 2,000 名参与者,均保持不变,因为这是一种任务设置,而不是需要根据样本大小进行扩展的人员配置。


使用 AI 同盟时的方法论考虑

采用 AI 同盟并不是一种简单的选择。它引入了自身的设计要求,跳过这些要求只会将人类同盟的混淆和模型同盟的混淆进行交换。

将 AI 行为控制为独立变量

如果 AI 同盟的反应在参与者之间不可预测地变化,包括语调、表现得多么合作或不合作、响应长度,那么研究就重新引入了 AI 同盟旨在消除的那种不受控制的变化。Labvanced 的 AI 和心理学研究集成,基于原生 OpenAI 文本、图像和音频生成,暴露出研究人员需要将同盟的行为视为可控变量而非假设的具体参数:

  • 持续时间内固定的 Model Version,因此在会话之间提供方的模型更新无法在研究中间更改同盟的行为。
  • 通过 Insert Message 设置的详细 system 角色信息,以书面形式列出同盟的个性和行为边界,而不是让模型的默认判断来决定:适合参与者群体的语言注册和俚语、其对当前事件的意识应延伸多远,以及如果参与者直接询问是否为 AI 时应如何回应。
  • Temperature 设定在其范围的确定性端,以实现脚本化感觉的同盟,因为温度决定生成响应的随机性与可预测性。
  • Max Tokens 限制以保持参与者之间的响应长度一致,因为无上限的同盟在不同会话中可能会有很大的差异。
  • 对于基于音频的同盟,固定的 Voice 和书面 Instructions(例如,指定中性的、冷静的语调)以在参与者之间保持语音语调的一致性,而不是让其在每次尝试中变化。
  • 关联的 Chat History Dataframe,以便与每位参与者的完整交流记录下来,并可用于事后验证同盟的一致行为,这是人类同盟剧本遵循的操控检查所提供的审计踪迹。

这些设置共同帮助确保生成 AI 性能在不同会话之间更具一致性。研究人员必须刻意调整这些杠杆,就像人类同盟研究需要培训协议和会话间的保真检查,而不是假设演员会在没有帮助的情况下再现剧本一样。

基于 OpenAI 的文本聊天

此模板设置了 Labvanced 和 OpenAI 之间的实时通信通道,任何基于该集成构建的同盟研究都依赖于此。将其作为起点,修改提示、模型和参数以适应你的范式。

注意: 对于这个特定的演示,令牌长度(即响应的长度)设置为 100,温度(即创造力)设置为 1。这可以在 研究设置 中调整。


提示设计作为有效性变量

system 角色信息是研究人员手动撰写同盟的整个行为政策的地方:其语言注册和俚语、对当前事件的意识范围,以及如果参与者直接询问是否为 AI 时的回应。两个实验室在相同的替代方案中运行不同的俚语校准、不同的当前事件截止日期或对 AI 问题的不同脚本答案可能会导致同盟行为上有实质性差异,这是语言模型研究中已捕捉到的一种提示敏感性 (Zhuo et al., 2024)。一项研究发现参与者对 AI 同盟与人类同盟的反应不同,可能会捕捉到真正的替代效应,或者可能捕捉到在其中一个维度上不明确或设计不良的提示。将提示设计视为需要报告和审查的变量,而不是实现细节,这是区分这两种解释的关键。

在 Labvanced 的实现中: 这是通过 Insert Message 设置的 system 角色信息,一次性作为任务的一部分保存,而不是在每次会话中重新输入,这使得准确报告和审计成为可能,如书面所示。

相同的作者身份也打开了一个刻意使用的方式:研究人员可以将系统提示在条件间变化作为操控本身,例如,在谈判任务中合作型同盟与竞争型同盟。这里提示本身就是独立变量,在条件间故意变化而不是保持不变,方法论的标准随之变化:提示变体只需在所需维度(合作与竞争)上有差异,而不是在其他维度上(长度、正式性、词汇)有偶然差异,否则操控在研究开始之前就被混淆。在这里,操控检查参与者在所需维度上如何实际感知同盟变得至关重要,正如试点测试确认人类同盟的剧本个性是否如预期那样传达的方式。

范式适合度

AI 同盟适用于可以预先指定的交互或从有限的响应类型、欺骗场景、结构化的社会压力交流、具有定义提供空间的谈判和讨价还价任务的范式。AI 谈判研究是这里最清晰的适合之一,因为报价和反报价落在一个定义空间内,而不需要开放式即兴创作。它对那些依赖同盟在有限空间外可信即兴表演的交互的范式适合度较差,或者那些欺骗依赖于参与者相信他们在处理同一水平的人类同伴的场合,而一旦怀疑 AI 的存在,操控将完全崩溃。

在 Labvanced 的实现中: Send to OpenAI 动作在单一参与者研究中生成同盟的欺骗、社会压力或谈判交换的一方。同盟不是一个真实的连接用户,因此构建这些范式并不需要 Labvanced 的多用户基础设施,参与者的会话是唯一的实时会话。

范式类型AI 合作者适配原因
策划的欺骗(假合作者,确认操控)适合行为可以提前完全指定;不需要现场即兴发挥
结构化的社会压力交换(信任或困境游戏中的合作/背叛)适合响应空间是有限的(合作、背叛、特定消息类型),适合控制提示
有定义的报价空间的谈判和讨价还价任务适合报报价和反报价可以在文档化的参数范围内生成
开放式即兴社会互动不适合依赖于令人信服的、不受脚本限制的人类即兴发挥,超出有限响应集
操控中同等级人类同伴信念是其承重元素的设计需要先进行操控检查如果怀疑 AI 存在,欺骗就会崩溃;它是否成立是一个开放的经验问题,而不是一个给定的设计假设

开放的有效性问题

尚未直接测试被 AI 驱动的合作者欺骗的参与者在信任游戏、从众范式或特定谈判任务中的行为是否与被人类合作者欺骗的参与者相同:这种替代足够新颖,以至于这种逐对比较尚未进行。怀疑或发现 AI 存在可能会改变互动的社会风险,而人类合作者不会,这意味着 AI 合作者用一个不同的、特定于 AI 的混淆变量来替代人类一致性的混淆,而不是简单地消除一个混淆。严格使用 AI 合作者将这视为一个需要检查的开放经验问题,例如,通过操控检查参与者是否正确相信他们在与人类互动,而不是通过设计解决的假设。


常见问题解答

AI 能否在心理学实验中替代人类合作者?
在方法论上,可以,在合作者的行为可以提前指定或在有限响应空间内生成的范式中,欺骗场景、结构化社会压力交换和谈判任务是最清晰的适配。支持这一点的理由在于控制、可复制性、规模和相对于用一个活的人类同伙欺骗参与者的减少(而不是消除)伦理权重。参与者是否以相同方式行为与人类合作者相同是一个单独的、目前开放的经验问题。
AI 合作者与人机交互研究有什么区别?
在 AI 合作者设计中,AI 代表经典范式内部的人类角色,欺骗、社会压力、谈判,而它是工具,而不是被测量的内容。在人机交互研究中,AI 本身是主体:研究问题是关于人们如何响应 AI(信任校准、说服、聊天机器人用户体验),参与者通常知道他们在与 AI 互动,而不是被引导认为是其他情况。
使用 AI 合作者是否引入人类合作者没有的问题?
有可能。AI 合作者消除了人类演员通过疲劳和累积经验引入的会话间漂移,但如果其行为没有被故意控制(模型版本、温度,以及对于基于音频的合作者,声音和传递指令),它可能会引入自己的不一致。还有一个开放的问题是,参与者在怀疑或确认 AI 存在后是否会以不同方式响应,而人类合作者研究不必以相同方式考虑这一点。
AI 合作者适用于哪些范式?
适用于有限响应空间的范式:策划的欺骗、结构化的社会压力交换(合作/背叛风格互动)和有定义报价空间的谈判或讨价还价任务。对于开放式即兴社会互动和操控特意依赖参与者相信他们在与同等级人类同伴互动的设计则不太适合,因为一旦怀疑 AI 的存在,就可能会崩溃这种信念。
使用 AI 合作者是否等同于 AI 欺骗研究?
AI 合作者是进行 AI 欺骗研究的一种方式,而不是其同义词。AI 欺骗研究是更广泛的类别:任何人工智能代理的介入被隐瞒或误陈述给参与者的研究。AI 合作者是这一隐蔽 AI 在经典范式内部,替代人类同伙的具体情况,而不是例如,一个 AI 默默生成参与者被告知来自人类来源的刺激。

深入阅读

AI 与心理学研究

平台能力:原生 OpenAI 文本、图像和音频生成直接嵌入实验流程中。

发送到 OpenAI 动作

实施指南:用于配置控制 AI 合作者的动作和参数(模型版本、温度、声音、指令)。


正在进行二人组或小组互动设计,并希望更广泛的背景? 心理学研究中的二人效应涵盖了另一方的存在如何改变配对设计中的个体行为,这正是人类或 AI 合作者活动的领域。相关模式在涉及多个参与者时出现,在 团队动力研究中涵盖。

如果谈判或讨价还价范式是目标设计,最后通牒游戏任务页面是 AI 合作者在生成中适合定义报价空间结构的具体示例。