labvanced logoLabVanced
  • Research
    • Publications
    • Researcher Interviews
    • Use Cases
      • Developmental Psychology
      • Linguistics
      • Clinical & Digital Health
      • Educational Psychology
      • Cognitive & Neuro
      • Social & Personality
      • Arts Research
      • Sports & Movement
      • Marketing & Consumer Behavior
      • Economics
      • HCI / UX
      • Commercial / Industry Use
    • Labvanced Blog
    • Services
  • Technology
    • Feature Overview
    • Code-Free Study Building
    • Eye Tracking
    • Mouse Tracking
    • Generative AI Integration
    • Multi User Studies
    • More ...
      • Reaction Time/Precise Timing
      • Text Transcription
      • Heart Rate Detection (rPPG)
      • Emotion Detection
      • Questionnaires/Surveys
      • Experimental Control
      • Data Privacy & Security
      • Desktop App
      • Mobile App
  • Learn
    • Guide
    • Videos
    • Walkthroughs
    • FAQ
    • Release Notes
    • Documents
    • Classroom
  • Experiments
    • Cognitive Tests
    • Sample Studies
    • Public Experiment Library
  • Pricing
    • Licenses
    • Top-Up Recordings
    • Subject Recruitment
    • Study Building
    • Dedicated Support
    • Checkout
  • About
    • About Us
    • Contact
    • Downloads
    • Careers
    • Impressum
    • Disclaimer
    • Privacy & Security
    • Terms & Conditions
    • Third-Party Licenses
  • Appgo to app icon
  • Logingo to app icon
Research
出版物
任务
问卷与量表
方法论
研究者访谈
使用案例
Labvanced 博客
比较
服务
  • 中國人
  • Deutsch
  • Français
  • Español
  • English
  • 日本語
出版物
任务
问卷与量表
方法论
研究者访谈
使用案例
Labvanced 博客
比较
服务
  • 中國人
  • Deutsch
  • Français
  • Español
  • English
  • 日本語
  • 出版物
  • 任务
  • 问卷与量表
  • 方法论
  • 研究者访谈
    • 比较在线网络摄像头与实验室眼动跟踪在婴儿音视频同步感知评估中的应用
    • 寻找黄金锁的影响者 - 追随者数量如何推动社交媒体互动
    • 9到36个月大婴儿的语义干扰:一项关于婴儿词汇能力的家庭眼动跟踪研究
    • 歌曲比言语韵律更易记 - 离散音高有助于听觉工作记忆
    • 语法决策任务中的正字法相关性和转置词效应
    • 悲伤诱导后的音乐情绪调节
    • 儿童学习非相邻依赖关系
    • 个性在噪音中听到
    • 所有的眼睛都一样吗?
    • 婴儿中的口头启动
  • 使用案例
    • 研究领域

      • 发展心理学
      • 语言学
      • 临床与数字健康
      • 教育心理学
      • 认知与神经
      • 社会与人格心理学
      • 艺术、音乐与数字媒体
      • 运动与运动心理学
      • 市场营销与消费者行为
      • 经济学
      • 人机交互 / 用户体验
      • 商业 / 行业应用
    • 研究者

      • 学生
      • 研究者
      • 团队
  • 博客
    • 教育心理学研究中的生成性人工智能
    • 婴儿与幼儿的网络摄像头眼动追踪研究最佳实践
    • 延迟折扣任务中的刺激类型
    • 延迟折扣任务
    • 基于正念的自我效能量表 - 修订版 (MSES-R)
    • 团队动态与研究
    • 斯特鲁普任务 | 历史、任务描述、数据与心理学
    • BKB句子测试 | 程序与研究
    • 心理学中的双重效应 | 概述与研究
    • 纳冯任务:任务设置、研究及更多
    • 经过同行评审的网络摄像头眼动追踪
    • 克尔西方块敲打测试:从立方体到在线设计
    • 点探测任务 | 全面指南
    • 记忆的类型:研究的概念
    • 最后通牒游戏
    • 视觉搜索任务
    • 心理学研究中的注意力任务
    • 广泛性焦虑障碍量表-7 (GAD-7)
    • 心理学中的决策任务
    • 强迫症量表修订版 (OCI-R)
    • 评估执行功能技能 | 任务与电池
    • 繁荣量表 (FS) 问卷
    • Labvanced与开放科学精神
    • 温床效应的心理学
    • Bouba-Kiki效应及任务
    • 词汇决策任务:访问心理词典
    • 带聊天框的图像描述任务和游戏
    • 顺畅的数据收集过程 | 研究的6个技巧
    • 使用Labvanced进行音乐研究
    • 7个经典认知任务及示例
    • 心理旋转测试 | 一项空间处理任务
    • Labvanced中的XY坐标
    • 5个著名的社会心理学实验
    • 远程与婴儿友好型眼动追踪的力量
    • 威斯康星卡片分类测试
    • 13个头部追踪研究的应用案例
    • 改善你感知能力的5个技巧
    • 优先注视范式简介
    • 对偏头痛和头痛患者进行认知研究
    • 着陆页 - 信息比你想的要多!
    • 耳机检查 - 过去与现在
    • 样本研究 - 有用的模板和演示!
    • 什么是神经可塑性?
    • 15个著名发展理论
    • 视觉注意力与眼动追踪
    • 什么是眼动追踪技术?
    • 应用语言学研究中的眼动追踪
    • 10个流行语言实验
    • 安慰剂效应
    • 实验设计的6个关键概念
    • 条件游戏听力测验
    • 艾宾浩斯错觉
  • 比较
  • 服务
    • 概述
    • 联合拨款申请
    • 受试者招募
    • 研究构建
    • 专注支持
    • 许可证比较
Diagram showing an AI agent and a human confederate both feeding into the same deception, social-pressure, or negotiation paradigm

AI 同盟者: 方法论与有效性

AI 同盟者是一个基于脚本或模型驱动的代理,代表人类同伴在欺骗、社会压力和谈判范式中发挥作用。与训练过的人类同盟者不同,它的行为可以被定义、记录,并在每个参与者之间精确再现,这正是使用 AI 同盟者的中心方法论论点,同时也是它需要被评估为设计决策而不是默认采纳的原因。

本页面将 AI 视为在经典范式中替代人类角色的工具:AI 是工具,而不是被测量的对象。这与 AI 本身是研究对象的研究是一个不同的问题,后者将在下面的 FAQ 中讨论。


目录

  • 什么算作 AI 同盟者
  • 为什么选择 AI 同盟者
  • 使用 AI 同盟者的研究方法考虑
  • 常见问题

什么算作 AI 同盟者

在经典意义上,同盟者是指看似参与者或普通互动伙伴的人,但实际上是遵循实验者控制的脚本行事,最常见于欺骗范式(在一致性研究中的假参与者)、社会压力范式(在信任游戏中不合作的伙伴)和谈判或讨价还价任务(其报价遵循预定模式的对手)。AI 同盟者通过一个模型驱动的代理代替了人类同伴:参与者仍然相信,或者被引导相信,他们正在与研究中的另一方进行互动,但该方的反应是通过一个 AI 系统 生成或脚本化的,而不是由训练过的人类演员表演的。

这不是一种新的实验设计。这是现有设计中的一种替代方法,领域内已经有了同一概念的低技术版本:Labvanced 自己的 多用户研究 文档描述了一种“虚拟对手”策略,其中参与者被告知他们是在与另一参与者对抗,但另一边实际上是一个做出随机选择的算法。这种方法确实是 AI 同盟者理念的祖先,但是有限的:一个随机选择算法无法进行有脚本的社会压力交流、谈判或维持一个可信的欺骗对话。生成性 AI 增添的能力是生成自然的、上下文响应的语言,以及在某些设计中生成音频或图像,取代人类同盟者的现场即兴表演,这使得这种方法适用于随机选择算法永远无法支持的范式。


为什么选择 AI 同盟者

AI 同盟者并不是对人类同盟者的完全替代;它是另一种可行的选择,在某些设计中更具力量。有四个考虑因素支持这一点:控制、可重复性、伦理和规模。

控制

训练过的人类同盟者被要求在每个参与者之间重现固定的行为协议:相同的语气、相同的反应、相同的谈判任务中的让步时机。在实践中,同盟者可能会偏离。疲劳、情绪以及进行多次实验的累积经验都会引入研究者没有设计的变异,而这种变异与时间和会议顺序相关,而不是与实验操控相关。AI 代理基于固定提示和配置生成,其疲劳和累计会话经验并不像人一样,这消除了这种特定的会话间偏差来源,尽管它引入了自己的一致性要求(见下文)。

在 Labvanced 的实现中: 相同的 Send to OpenAI 配置在任务的每个会话中均不变,因为它是固定设置,而不是一个人每次都必须从记忆中重现的协议。

可重复性

人类同盟者的确切行为在方法部分很少得到完全说明。即使是详细的脚本也留有空白,由人类演员用判断填补,因此试图复制研究的不同实验室是在再现原同盟者表现的近似,而不是表现本身。一个记录的提示、模型版本和生成参数是一个完整的、可移植的规格:另一个实验室可以运行相同的配置,而不是训练新的演员来接近原演员。

在 Labvanced 的实现中: 模型版本、温度和提示本身被直接保存在任务配置中,因此本节所要求的完整规格不是额外的文档工作,而是已经存储的内容。

伦理

用活的人类同伴欺骗参与者带有伦理负担,大多数机构审查程序通常要求研究人员进行辩护和事后说明:在某种意义上,一个实际的人是参与了这个欺骗。AI 生成的同盟者改变了这种安排的伦理性质,尽管它并没有消除研究设计中固有的欺骗,这仍然需要处理与任何欺骗范式相同的事后说明和同意。这减少了同盟者使用的一个特定伦理维度;但并没有使欺骗范式在伦理上变得更简单。

规模

在线和远程研究能够招募的参与者远远超过单个实验室会议所能招募的数量,这造成了一个特定于人类同盟者的规模问题:每增加一个参与者,就需要另一个同盟者会话,因此更大的样本意味着需要招募、培训和安排更多的同盟者,还需要保持他们之间的行为一致,这还涉及了前面提到的同盟者间偏差的控制。AI 同盟者没有这个问题。相同的配置对第千名参与者的作用与对第一名参与者的作用完全相同,无需额外的人手、培训或管理同盟者间一致性的检查。这就是 AI 同盟者特别适合于大样本在线研究的原因。

在Labvanced的实现中: 同样的AI同盟配置无修改地运行,无论研究收集20名参与者还是2,000名参与者,因为这是一个任务设置,而不是必须随样本大小扩展的人员配置。


使用AI同盟的 методологические соображения

采用AI同盟并不是一个即插即用的选择。它引入了自己的设计要求,跳过它们只会将人与同盟之间的混淆替换为模型与同盟之间的混淆。

控制AI行为作为独立变量

如果AI同盟的响应在参与者之间不可预测地变化,例如语调、合作或不合作的表现、响应长度,那么研究就重新引入了AI同盟旨在消除的那种不受控制的变异。Labvanced的AI与心理学研究集成,基于原生的OpenAI文本、图像和音频生成,揭示了研究人员需要处理同盟行为的具体参数,以将其视为一个受控变量,而不是一种假设:

  • 在研究持续期间固定的Model Version,因此提供者端的模型更新在会话之间无法改变同盟在研究进行中的行为。
  • 通过Insert Message设置的详细system角色消息,将同盟的人格和行为界限以书面形式记录,而不是留给模型的默认判断:哪些语言注册和俚语适合参与者池,如何扩展其对当前事件的意识,以及如果参与者直接询问它是否是AI,它应该如何回应。
  • Temperature设置为范围的确定性一端,以获得一种脚本感的同盟,因为温度控制生成响应的随机性与可预测性。
  • Max Tokens上限以保持参与者之间回应长度的一致性,因为没有上限的同盟在一场会话到另一场会话中可以在说多少上有很大差异。
  • 对于基于音频的同盟,固定的Voice和书面的Instructions(例如,指定中性、冷静的传达方式),以在参与者之间保持声音语调的一致性,而不是让其在每次试验中变化。
  • 一个链接的Chat History Dataframe,以便与每位参与者的完整交流被记录,并可供事后验证,以确保同盟的一致表现,这与人为同盟的剧本遵循所提供的审计轨迹相同。

这些设置共同帮助确保genAI在不同会话之间的表现更为一致。它们是研究人员需要故意操作的杠杆,正如人类同盟研究需要培训协议和会话间的保真度检查,而不是假设演员会在没有帮助的情况下重现剧本。

基于OpenAI文本的聊天

此模板建立了Labvanced与OpenAI之间的实时通信通道,这是任何基于此集成的同盟研究所依赖的基础。将其用作起始点,修改提示、模型和参数以适应您的范式。

注意: 对于这个特定的演示,令牌长度(即响应的长度)设置为100,温度(即创造力)设置为1。这可以在研究设置下进行调整。


作为有效性变量的提示设计

system角色消息是研究人员手动编写同盟所有行为政策的地方:其语言注册和俚语,意识到当前事件的范围,以及如果参与者直接询问它是否是AI时如何回应。两个实验室在不同的俚语校准、不同的当前事件截止点或针对AI问题的不同脚本回答下运行相同的替代,可能会获得有意义的不同同盟行为,这是一种在语言模型研究中广泛记录的提示敏感性(Zhuo et al., 2024)。一项发现参与者对AI同盟的反应与对人类同盟的反应不同的研究,可能会捕捉到真正的替代效应,或者可能会捕捉到在这些维度上未被充分规范或设计不佳的提示。将提示设计视为一个需要报告和审查的变量,而不是一个实施细节,使这两种解释可区分。

在Labvanced的实现中: 这是通过Insert Message设置的system角色消息,作为任务的一部分保存一次,而不是每次会话都重新输入,这使得能够按原样报告和审计。

相同的著作权也开启了一种有意的使用:研究人员可以在不同条件下变化系统提示作为操控本身,例如,在谈判任务中,一个合作人格的同盟与一个竞争人格的同盟。在这里,提示本身就是独立变量,故意在条件之间变化而不是保持不变,方法论标准也相应变化:提示变体需要在预期维度上(合作与竞争)有所不同,而不是在其他维度上(长度、正式性、词汇)偶然不同,否则操控在研究开始之前就被混淆。在这里,如何通过意图的维度实际感知同盟的操控检查变得必不可少,就像先导测试确认人类同盟的剧本人格按预期呈现一样。

范式适配

AI同盟适合那些互动可以事先指定或从有限的响应类型集生成的范式,如欺骗场景、结构化的社会压力交流、具有定义报价空间的谈判与议价任务。AI谈判研究是最清晰的适配之一,因为报价和反报价落在一个定义的空间内,而不需要开放式即兴创作。它对那些互动依赖于同盟在该有限空间外自信地即兴生成的范式适配较差,或者在参与者必须相信自己正在与同一地位人类同行打交道的上下文中,欺骗特别依赖于此,而一旦怀疑AI的存在就会完全崩溃操控。

在Labvanced的实现中: Send to OpenAI操作在单参与者研究中生成欺骗、社会压力或谈判交流的同盟部分。同盟并不是第二个真实的连接用户,因此构建这些范式不需要Labvanced的多用户基础设施,参与者的会话是唯一的实时会话。

范式类型AI 共同参与者适合度原因
编写的欺骗(虚假共同参与者,确认操控)非常适合行为可以提前完全指定;不需要现场即兴发挥
结构化的社会压力交换(在信任或困境游戏中的合作/背叛)非常适合响应空间有限(合作、背叛、特定消息类型),适合受控提示
定义报价空间的谈判与讨价还价任务非常适合报价和还价可以在记录的参数内生成
开放式即兴社会互动不太适合依赖于令人信服的、未编写的类人即兴发挥,超出有限的响应集合
设计中同等地位的人类同行信念为操控的承载元素首先需要操控检查如果怀疑 AI 的存在,欺骗就会崩溃;它是否成立是一个开放的经验性问题,而不是理所当然的

开放的有效性问题

一个被 AI 驱动的共同参与者欺骗的参与者在信任游戏、从众范式或谈判任务中表现是否与被人类共同参与者欺骗的参与者相同,尚未直接测试:这种替代足够新颖,以至于尚未进行这种面对面的比较。怀疑或发现 AI 存在可能改变互动的社会赌注,而人类共同参与者则不会,这意味着 AI 共同参与者用一个不同的、特定于 AI 的混杂变量替代了人类一致性混杂变量,而不是简单地消除混杂变量。严格使用 AI 共同参与者将此视为一个开放的经验性问题需要检查,例如通过操控检查参与者是否正确相信他们正在与一个人类互动,而不是通过设计解决的假设。


常见问题解答

AI 能否替代心理实验中的人类共同参与者?
在方法论上是的,在共同参与者的行为可以提前指定或在有限的响应空间内生成的范式中,欺骗场景、结构化的社会压力交换和谈判任务是最清晰的匹配。这样的主张基于控制性、可重复性、规模以及相对于用现场人类同伴欺骗参与者所减少(而不是消除)的伦理负担。参与者是否表现与人类共同参与者相同是一个单独的、当前开放的经验性问题。
AI 共同参与者与人类- AI 交互研究有什么区别?
在 AI 共同参与者设计中,AI 代表人类角色参与经典范式、欺骗、社会压力、谈判,它是工具,而不是被测量的内容。在人类- AI 交互研究中,AI 本身是主题:研究问题在于人们如何回应 AI(信任校准、劝说、聊天机器人用户体验),参与者通常知道他们正在与 AI 互动,而不是被引导相信相反的事情。
使用 AI 共同参与者是否引入人类共同参与者没有的有效性问题?
可能会。AI 共同参与者消除了人类演员通过疲劳和积累经验引入的会话之间漂移,但如果其行为没有被故意控制(模型版本、温度,以及对于基于音频的共同参与者,声音和传递指令),它可能引入自身的不一致性。还有一个开放的问题是,当怀疑或确认 AI 的存在时,参与者的反应是否会不同,而人类共同参与者研究不必以相同方式考虑这一点。
AI 共同参与者适合哪些范式?
适合具有可界定的响应空间的范式:编写的欺骗、结构化的社会压力交换(合作/背叛风格互动)和具有定义报价空间的谈判或讨价还价任务。它不太适合开放式即兴社会互动以及依赖于参与者相信他们正在与同等地位的人类同行互动的设计,因为一旦怀疑 AI 的存在,可能会崩溃这种信念。
使用 AI 共同参与者是否与 AI 欺骗研究相同?
AI 共同参与者是一种实施 AI 欺骗研究的方法,而不是其同义词。AI 欺骗研究是更广泛的类别:任何人造智能代理的参与被隐瞒或错误表示给参与者的研究。AI 共同参与者是具体的案例,其中被隐瞒的 AI 在经典范式中代表人类同伴,欺骗、社会压力或谈判,而不是例如,一个 AI 静默生成参与者被告知来自人类来源的刺激。

进一步阅读

AI 与心理学研究

平台能力:本地 OpenAI 文本、图像和音频生成直接嵌入实验流程中。

发送到 OpenAI 操作

实施指南:用于配置受控 AI 共同参与者的操作和参数(模型版本、温度、声音、指令)。


正在进行二人或小组互动设计并想要更广泛的背景吗? 心理学研究中的二人效应 涵盖了另一个方的存在如何改变配对设计中个体行为的内容,这是人类或 AI 共同参与者所涉及的相同领域。相关模式在涉及多个而不仅仅是简单对的设计中出现,涵盖在 团队动态研究 中。

在谈判或讨价还价范式是目标设计的情况下, 最后通牒游戏 任务页面是一个具体示例,展示了 AI 共同参与者非常适合生成的有限报价空间结构。