基于Transformer的MBTI分类研究:AI人格测评在招聘筛选中的可能与风险
摘要
基于Transformer的MBTI自动分类研究,将人格测评从"自陈问卷"推向"文本推断"。本文从技术可行性与招聘应用两个层面分析其可能与风险:分类器效能受标签泄漏制约,而MBTI本身在录用决策中的效度争议尚未解决。技术精度不等于选人效度,这是招聘场景必须直面的边界。
一、从问卷到文本:MBTI分类的技术跃迁
MBTI诞生于20世纪40年代,由美国作家迈尔斯与其母亲布里格斯编制,是一种自我报告式的人格测评工具,用以描述人们在获取信息、做出决策、对待生活等方面的心理活动规律与人格类型表现[3]。其理论基础可追溯至荣格在20世纪20至30年代出版的《心理类型》,内向与外向等概念即出自此书[3]。自20世纪60年代以来,估计已有5000万人参加过MBTI测评,使其成为迄今为止最流行的人格评估工具;截至2024年7月,提供免费十分钟测试的16personalities.com已在全球施测12.31亿次,其中新加坡一地约有65.3万名受访者完成了400万次测试[2]。
这种规模的数据积累,为深度学习模型提供了训练土壤。近年来,随着自然语言处理与深度学习技术的发展,利用社群贴文进行人格类型预测逐渐受到关注[8]。传统MBTI依赖个体主动作答,而基于Transformer的分类器试图从用户已公开的文本中"反向推断"人格类型——这是一次方法论上的跃迁:测评对象从"被试的自我陈述"变成了"被试的数字痕迹"。
从人才测评的专业视角看,这一转变触及了一个长期痛点:自陈问卷可能受到印象管理与社会赞许性影响。华东师范大学心理咨询中心在分析MBTI科学性质疑时明确指出,作为一种自评量表,MBTI测试不可避免地存在社会期望偏差——例如企业往往青睐社交能力强的E人和执行能力强的J人,被试在进行MBTI测试时可能会根据企业对人才的选拔要求而有所倾向[46]。该分析还指出,MBTI面临巴纳姆效应与信效度存疑等争议[46]。文本推断在理论上绕开了被试的主动配合,但"绕开"是否等于"更准",需要看实证结果。
二、分类器到底有多准:一个被标签泄漏困扰的领域
要评估这类研究的真实水平,必须先理解其方法学困境。
辅仁大学统计资讯学系的一项硕士研究,以Kaggle MBTI Personality Type Dataset为例,采用阶层式Transformer模型进行分类:先以BERT编码器取得单篇贴文的语意表示,再透过使用者层级的Transformer编码器整合同一使用者的多篇贴文[8]。该研究明确指出一个关键问题——此类数据集的数据来源多为人格讨论社群,文本中可能直接出现MBTI类型、人格维度缩写或认知功能等相关词汇;若未处理,模型可能依赖显性标签线索进行分类,造成标签泄漏并高估模型效能[8]。
这是一个诚实且重要的自我设限。换言之,当模型在测试集上取得较高准确率时,其中相当一部分可能来自"文本里本来就写着INFJ"这类捷径,而非真正习得了人格的语义特征。该研究采用"使用者为单位"的建模策略,正是为了缓解单一贴文信息不足与标签泄漏的双重问题[8]。
从自然语言处理的工程视角看,标签泄漏是人格计算领域最容易被忽视、也最容易被夸大的陷阱。参考材料8提示,未处理标签泄漏可能导致模型效能被高估,因此对未交代清洗策略的准确率应保持审慎。这不是对研究者的苛责,而是该领域数据特性的客观约束。
三、招聘场景的诱惑:为什么HR会想用它
理解了技术现状,再来看招聘场景的吸引力就更容易看清其逻辑。
新加坡总理公署战略未来中心的文章回顾了MBTI的职场演变史:人格测试最初随企业兴起,是作为有效资源配置的手段——二战后就业繁荣期,雇主寻求更好的管理工具,人格测试因而流行[2]。这一历史逻辑至今未变:招聘方始终在寻找低成本、可规模化、看似客观的筛选工具。
SHRM(美国人力资源管理协会)2018年人才大会与博览会上,评估策略咨询公司ProActive Consulting总裁Whitney Martin提出了招聘测评的"四个V"原则,并指出心理能力测验是"工作绩效的单一最佳预测指标"[12]。根据Talent Board 2016年北美候选人体验研究报告,82%的企业正在使用某种形式的入职前测评[12]。
这组数据说明:测评在招聘中的渗透率已经很高,问题不在于"要不要用",而在于"用什么、怎么用"。MBTI文本分类器若被包装成"AI读心术",对追求效率的招聘方而言可能具有吸引力——它不需要候选人填答,不增加候选人负担,还能从简历、社交文本中自动生成"人格画像"。
这种吸引力并非空想。界面新闻的深度报道揭示了MBTI与职场挂钩的现实图景:推广者将测试与职场绑定,求职者深受其扰[31]。该报道引用MBTI性格测试问卷中的描述——"指挥官人格类型的人是天生的领导者……好在只有3%的人口具有这种人格类型,否则就会无情碾压那些剩下的大多数胆小又敏感的人格类型"——并追问:当求职者在A选项"坚守原则"和B选项"富有同情心"之间勾选时,这道题将如何影响应聘公司的判断[31]。韩国Ewha Voice的报道也记录了类似趋势:随着MBTI在全国范围内知名度与流行度的提升,韩国多家企业开始要求求职者提供MBTI测试结果[23]。
但这恰恰是最危险的地方。
四、效度争议:MBTI用于录用的科学性与合规红线
从人才测评的专业角度看,招聘场景的核心问题从来不是"测得多准",而是"测的东西是否与工作绩效相关"。
《心理科学进展》刊载的综述《人员选拔中人格问卷可用性之争》系统梳理了这一学术脉络。该文指出,个性调查问卷旨在通过一系列专门设计问题的施测结果预测候选人的工作绩效;但以往研究由于对工作绩效内涵及对应参照效标的界定、问题设计的逻辑基础等方面存在各自局限,对问卷有效性一直存在分歧[22]。作者李永瑞(北京师范大学管理学院)提出的改进方向是:从平衡计分卡四个维度定义工作绩效参照效标,并采用内嵌且纵贯模式跟踪候选人的工作绩效效标[22]。
这段学术史对当下的AI人格分类研究有直接警示:如果连传统人格问卷的预测效度都尚未在学理上达成共识,那么一个建立在MBTI标签之上的文本分类器,其"预测工作绩效"的能力就更缺乏效度证据。技术上的分类准确率,与人事决策上的预测效度,是两个完全不同的概念。
更关键的是合规问题。MBTI官方测评发行机构The Myers-Briggs Company在回应常见批评时明确表态:MBTI是"描述而非预测"偏好的工具,并非设计用于预测职业成功[1]。这是一条常被忽略的边界——工具的发行方自己划定了使用范围,而AI分类器的出现,恰恰可能绕过这一边界:既然候选人没有"参加测评",是否就不构成"使用MBTI筛选"?这种规避在伦理与法律上都值得审慎考量。
国内监管与舆论层面已出现明确回应。江苏常州文明网发出倡议,明确提出三条要求:企业慎用MBTI等性格测试作为硬性筛选指标——MBTI二分法分类无法呈现性格复杂性,如将测试结果与录用挂钩可能构成就业歧视;政府部门加强监管——劳动监察部门应受理求职者反映的类似遭遇,加强行政执法与司法救济联动,切实保障劳动者平等就业权;求职者增强自我保护意识[17]。澎湃新闻/法治日报的调查报道进一步印证了这一问题的现实性:有"95后"北京市民在每次投简历前都强迫自己做一次MBTI测试,只有测出"完美人格"才放心投递简历;记者在互联网招聘平台上看到不少求职者反映因性格测试被刷的经历[18]。该报道还指出,除了性别歧视、地域歧视、第一学历歧视等,性格测试结果也被列入考量范围[17]。
中国科学院心理研究所教授陈祉妍在接受科技日报采访时给出了专业判断:"任何测试都是有局限性的。MBTI测试可以帮我们更好地了解人的性格特征,但不能仅以单一的测试结果,就推断一个人的心理特征。要想真正考察一个人,必须用多种方法、从多个角度来考察,再用心理测试结果进行辅助分析,这样才可能得出一个比较可靠、客观的结果。"[3]这一来自国家科研机构研究者的表态,为招聘场景中的MBTI使用划出了清晰的专业边界。
五、本土化与信度:被低估的基础问题
即便撇开合规争议,纯从测量学角度看,人格测验的跨文化应用本身就存在信度挑战。
北京师范大学研究者对1994至2013年间国内大五人格测验研究文献进行的信度概化分析显示:检索到的文献中约68.15%存在"信度引入"现象;未加权估计中,A(宜人性)和O(开放性)的均值最低,N(神经质)和C(尽责性)的均值最高,国内所得结果均略低于国外(O除外)[6]。回归分析还显示,分数均值、量表来源和南北地域差异是N维度信度的预测变量,量表来源、文章专业类型、测验版本和测验记分对E(外向性)维度信度具有预测作用[6]。
这项研究虽然针对大五人格,但其结论为MBTI等同类人格测验的中国化应用提供了重要参照[6]。它揭示了一个常被技术叙事掩盖的事实:人格测验的测量稳定性受量表来源、地域、样本特征等多重因素影响。一个在英文Kaggle数据集上训练的Transformer分类器,迁移到中文招聘场景时,其测量等值性(measurement invariance)可能面临挑战——语言中的自我描述方式、人格词汇的文化内涵,都不是简单的机器翻译能解决的。
事实上,中国心理学界早已意识到直接移植西方人格量表的局限,并进行了系统的本土化努力。香港中文大学心理学系张妙清教授等开发的跨文化(中国人)个性测量表(CPAI),正是兼顾文化共通性与特殊性的人格测量工具的代表[5][14]。张妙清、范为桥等人在《心理学报》发表的CPAI青少年版香港标准化研究,系统呈现了这一本土化路径的学术成果[14]。范为桥、张妙清、张建新、张树辉在《心理学报》2011年发表的论文进一步阐述了CPAI及其跨文化应用的理论框架——兼顾文化共通性与特殊性的人格研究路径[43]。与此同时,北京大学心理学系王登峰、崔红编制的中国人人格量表(QZPS),也从另一条路径探索了中国人人格结构的本土化测量[37]。这些本土化研究的共同前提是:人格的测量不能脱离文化语境,直接翻译的量表在中国样本上可能呈现不同的因子结构。这一学术共识,恰恰是当前基于英文数据集训练的MBTI文本分类器在中文场景应用中面临的最深层挑战。
六、另一面:MBTI与工作绩效的实证关联
需要公允地指出,MBTI与工作表现之间并非全无关联。台湾一项以中部地区教保服务人员为对象的硕士研究,采用问卷调查法收集225位教保服务人员的资料,运用描述性统计与多元回归分析验证变量间关系[29]。结果发现,受试者以内向型(I)、实感型(S)、情感型(F)、判断型(J)人格特质为主;进一步分析显示,MBTI人格类型对班级经营效能五大构面均具显著预测力,实感型(S)、判断型(J)、外向型(E)教师在教学管理、班级常规、气氛营造等方面表现突出[29]。
这项研究说明,在特定职业群体与特定绩效维度上,MBTI类型确实可能呈现统计关联。但要注意其边界:研究对象是已入职的教保服务人员,绩效测量的是班级经营效能,而非招聘场景中的录用决策;225人的样本量与单一职业群体,也不足以支撑将其推广为通用筛选工具[29]。相关性研究的设计,本质上无法回答"录用前测MBTI能否预测入职后绩效"这一招聘核心问题。
从更广的学术脉络看,人格测验与工作绩效的关系已有大量元分析证据。Hurtz与Donovan(2000)发表在《应用心理学杂志》的元分析研究《人格与工作绩效:大五人格再审视》,系统检验了大五人格维度对工作绩效的预测效度[21]。McCrae与Costa(1989)则从大五人格模型视角重新解释了MBTI,指出MBTI的四个维度可以在五因素模型框架下得到理解[27]。这些研究共同指向一个结论:人格特质与工作绩效之间确实存在可测量的关联,但关联的强度因特质维度、绩效类型与职业群体而异。MBTI作为人格测量工具,其与工作绩效的关联需要放在这一更广阔的证据体系中审视,而非孤立地宣称"有效"或"无效"。
七、专业判断:技术精度与选人效度的三重错位
综合以上资料,以人才测评与组织发展的视角看,基于Transformer的MBTI分类在招聘中的应用存在三重错位。
第一重:测量对象的错位。 文本分类器推断的是"用户在社交媒体上呈现的人格表达",而非"工作中的人格行为"。一个人在讨论社群中的语言风格,与其在高压工作场景下的行为模式,中间隔着巨大的情境落差。MBTI官方强调其工具是"描述而非预测"[1],而文本推断的描述效度在参考材料中未见充分验证(此为作者判断)。社会期望偏差的存在[46]使得即便是自评量表也难以完全规避印象管理,文本推断虽然形式上绕开了填答环节,但社交媒体上的自我呈现同样受到印象管理的影响——只是从"面对量表"变成了"面对社群"。
第二重:效标逻辑的错位。 招聘决策需要的是对工作绩效的预测效度,而当前MBTI文本分类研究的主流评价指标是分类准确率[8]。SHRM专家引述称心理能力测验是工作绩效的单一最佳预测指标[12],《心理科学进展》的综述也强调工作绩效参照效标的界定是效度争议的根源[22]。用分类准确率替代预测效度,是典型的技术指标僭越。
第三重:合规与伦理的错位。 MBTI官方明确其工具并非设计用于预测职业成功[1];而AI分类器以"非测评"形式绕开这一使用边界,反而可能放大风险。新加坡战略未来中心的文章也指出,人格测试结果的滥用可能带来负面社会影响[2]。国内倡议已明确将MBTI硬性筛选与就业歧视挂钩[17],法治日报的调查则揭示了求职者因性格测试被刷的现实困境[18]。
值得注意的是,SHRM在2024年发表的高管网络专题《用真正的人类智慧而非AI做人才选拔》中,Scott Mondore与Craig Wallace明确指出:要改进人才的招聘与发展,人类智慧——而非AI——仍然是最佳资源[44]。这一来自全球最大人力资源管理专业协会的判断,为当前AI人格测评的招聘应用提供了冷静的行业参照。
结语
基于Transformer的MBTI分类研究,在方法论上是有价值的探索——它推动了人格计算与自然语言处理的交叉,也迫使研究者正视标签泄漏、使用者级建模等工程问题[8]。但技术可行不等于应用正当。在招聘这个高利害场景中,工具的选择必须以效度证据、合规边界与伦理审慎为前提。
对HR与组织发展从业者而言,更务实的路径或许是:把AI人格分类视为辅助性的"文本洞察"工具,用于团队沟通风格分析、发展性反馈等低风险场景,而非录用决策的筛选闸门。人格测评的边界,最终不由模型参数量决定,而由我们是否尊重测量科学和人的复杂性决定。