构建智慧的机器:AI元认知的核心地位
尽管AI越来越聪明,其智慧却未同步跟进。一篇观点文章将人类智慧界定为解决分析技术无法处理的棘手问题的策略,包括启发式等“客体层面”策略,以及智力谦逊、换位思考、情境适应等“元认知”策略,并指出AI系统在元认知方面尤为薄弱。文章讨论了智慧型AI的基准测试、训练与实现方式。
尽管AI越来越聪明,其智慧却未同步跟进。一篇观点文章将人类智慧界定为解决分析技术无法处理的棘手问题的策略,包括启发式等“客体层面”策略,以及智力谦逊、换位思考、情境适应等“元认知”策略,并指出AI系统在元认知方面尤为薄弱。文章讨论了智慧型AI的基准测试、训练与实现方式。
针对全球多国党派敌意上升,一篇发表于 Personality and Social Psychology Review 的理论文章提出将党派敌意概念化为“责备”的统一框架,以厘清其内涵并助力干预。文章旨在为理解和减少政治领域的情感极化提供更具生成力的概念基础。
研究构建并验证了美国组织堕胎支持行动的分类体系,共识别出10种行动,归为直接福利、辅助支持和公开声明三类。直接福利(为员工堕胎提供时间和金钱)带来的享乐价值最高、员工反应最积极,对堕胎持正面态度者尤为明显。该分类体系揭示了员工如何感知雇主此类行动,以及个体差异对组织支持感的影响。
三项研究(情景实验N=163、虚构互动实验N=465、预注册实地调查N=155)发现,员工普遍认为AI队友能力高于人类队友但温暖感更低,能力优势促进合作、温暖感不足阻碍合作。女性化特征的AI队友可弥补温暖感不足(研究1),但同时削弱其能力优势(研究2、3);男性化特征的AI队友则放大能力优势(研究2、3)却加剧温暖感缺失(研究1)。
针对 Oprea 对“复杂性”批评的回应,本文指出其数据并不支持中位数“不稳定”和“不具代表性”两点主张。在 150 次自助抽样中,多数镜像前景的中位数标准误为 0,取值完全一致;而被质疑的聚合中位数 CDF 排除了 G50 和 L50 两个前景,且聚合中位数并非作者实际分析的对象。按均值与中位数附近观测占比比较,中位数代表性明显更高,且中位数准确复现了彩票与镜像的差异及前景理论预测模式。
Data Colada 博主 Uri Simonsohn 与 Daniel Banki、Robert Walatka、George Wu 合作,对一篇发表在 American Economic Review、质疑前景理论的论文提出评论。
一项发表于 Psychology, Crime & Law 的研究考察了诈骗受害者是否向警方报案的影响因素。研究聚焦受害者报案决策,分析哪些因素与报警行为有关。
一项系统综述整合了实验研究,考察被告的情绪表现如何影响司法判断,即“情绪化被告效应”。该综述发表于 Psychology, Crime & Law 第32卷第9期,页码1395-1426。
Data Colada 发布四篇系列文章的第一篇,披露哈佛商学院教授 Francesca Gino 合著的四篇论文存在数据造假证据。作者称 2021 年与匿名研究团队审查了 Gino 的多项研究,并向哈佛商学院提交了证据最强的四篇论文报告。
推荐理由:作者公开对四篇论文的数据造假证据,并说明哈佛已要求撤稿三篇,可了解学术不端调查与撤稿流程。
Data Colada 在系列文章第二篇中指出,元分析平均值常常没有意义,因为其中包含对元分析研究问题的无效检验,并把不可比的结果合并在一起。
Data Colada 指出,PNAS 一篇元分析将 447 个“助推”效应合并得出平均效应量 Cohen's d = 0.43,但这类均值往往没有意义,因为合并了本质上不可通约的结果。
Data Colada 与一组匿名研究者分析 Kristal 等人 2020 年公开的原始数据后指出,2012 年发表于 PNAS 的一项现场实验(N = 13,488,由美国东南部一家汽车保险公司实施)存在数据伪造证据。
推荐理由:通过字体、取整和分布异常还原数据造假手法,并说明公开数据为何是发现问题的关键。
Data Colada 对《Journal of Consumer Research》论文“Goal Conflict Encourages Work and Discourages Leisure”中的研究 1a(N = 210)进行了两次重复,样本量约为原研究的 5 倍(重复 1 为 1,008 人,重复 2 为 1,127 人)。
Data Replicada 第9期复制了 Journal of Marketing Research 一篇关于减重产品广告的研究,原研究(N = 213)发现渐进式广告比"前后对比"广告更可信。
Data Replicada 对一篇 JMR 左位数偏差论文的研究1(N = 145)开展两项预注册重复验证,重复1(N = 1,099)与重复2(N = 1,555)均仅发现边缘显著的交互,即价格同屏呈现时左位数偏差方向性更大,但证据远弱于原研究。原研究仅有9.3%和7.8%的检验力检出两次重复结果,需3,000至4,500名被试才有80%把握检出。
Data Colada的重复验证未能复现Journal of Consumer Research一项研究的结果:展示五瓶滴露(vs.一瓶)并未显著提高被试对产品效果的评分。三次预注册重复验证样本量至少为原研究(N=87)的6.5倍,最支持原假设的第三次重复中效应量仅为d=.10,远小于原研究的d=.43。
Data Colada 的 Data Replicada 项目尝试重复验证 Journal of Consumer Research 一篇关于资源稀缺与价格质量判断的研究,重复实验中稀缺组的价格质量相关低于对照组,但效应量 d = .15,远小于原研究的 d = .42。