FIND YOUR TYPE

读完之后,测一测自己是哪一型

3 分钟完成免费测试,获取专属人格解读

立即免费MBTI测试 →
🧩

简历之外的信号:从人格分类的技术路线,看AI招聘工具能预测什么、不能预测什么

摘要:人格分类正从问卷走向文本挖掘。本文梳理MBTI、九型人格到Transformer模型的技术演进,结合信度概化与效度争议研究,分析AI招聘测评的能力边界与使用前提。 一、当招聘开始读你的"言外之意" 过去十年,招聘筛选的逻辑发生了一个不太被公开讨论的转向:企业不再只读简历上写了什么,而开始试图从简历之外——社交媒体

✍ 辛靳(心理学硕士) ⏱ 约10分钟阅读 🗓 2026-10-08 10:07

简历之外的信号:从人格分类的技术路线,看AI招聘工具能预测什么、不能预测什么

摘要:人格分类正从问卷走向文本挖掘。本文梳理MBTI、九型人格到Transformer模型的技术演进,结合信度概化与效度争议研究,分析AI招聘测评的能力边界与使用前提。

一、当招聘开始读你的"言外之意"

过去十年,招聘筛选的逻辑发生了一个不太被公开讨论的转向:企业不再只读简历上写了什么,而开始试图从简历之外——社交媒体文本、测评作答、语言习惯——推断"你是什么样的人"。

这一转向有现实需求支撑。据SHRM刊文引用的Talent Board 2016年北美候选人体验报告,82%的企业已在使用某种形式的职前测评[3]。在中国,MBTI、卡特尔16PF、PDP、九型人格等性格测试在职场招聘中频频出现,越来越多公司将相关内容加入面试环节,甚至在岗位调整和晋升时使用,有企业还提出性格测试不通过一年内不能再投简历的要求[1]。

问题随之而来:这些工具究竟在测量什么?它们的预测能力边界在哪里?以人才测评的专业视角看,这不是一个"信或不信"的问题,而是一个需要拆解技术路线、逐一审视效度证据的问题。

二、从问卷到文本:人格分类的两条技术路线

2.1 自陈问卷路线:成熟但受限于"自我报告"

MBTI是这条路线最广为人知的代表。它由美国作家迈尔斯和她的母亲布里格斯在20世纪40年代编制,是一种自我报告式的人格测评工具,用以描述人们在获取信息、做出决策、对待生活等方面的心理活动规律和人格类型表现[7]。其理论基础源自荣格在20世纪20至30年代出版的《心理类型》,内向与外向等概念即出自此书[7]。按天津职业技术师范大学赵龙飞老师在"MBTI与我们"讲座中的梳理,该理论经迈尔斯母女细化为四个维度、八种偏好,最终组合为16种人格类型[6]。

自陈问卷的核心约束在于:它测量的是"你如何描述自己"。中国科学院心理研究所教授陈祉妍在接受科技日报采访时指出,任何测试都有局限性,MBTI测试可以帮我们更好地了解人的性格特征,但不能仅以单一的测试结果推断一个人的心理特征;要想真正考察一个人,必须用多种方法、从多个角度来考察,再用心理测试结果进行辅助分析[7]。

从测评机制上看,自陈问卷的局限并非偶然,而是其测量方式的结构性产物。它依赖被试对自身行为的回忆、归纳与如实报告,这一过程至少受三重因素干扰:一是自我认知的准确性,个体未必能准确概括自己的行为倾向;二是社会赞许性,被试倾向于按岗位期待或社会规范作答;三是参照框架的差异,同一道题在不同人心中的比较基准并不相同。因此,自陈问卷测得的更接近"自我概念"而非"行为本身",这也解释了为何它在预测具体工作绩效时,效度往往低于能力类测验。

2.2 文本挖掘路线:从"你说你是谁"到"你的文字像谁"

随着自然语言处理与深度学习技术发展,利用社群贴文进行人格类型预测逐渐受到关注。辅仁大学统计资讯学系的一项硕士研究以使用者为单位,采用阶层式Transformer模型进行分类:先以BERT编码器取得单篇贴文的语意表示,再透过使用者层级的Transformer编码器整合同一使用者的多篇贴文[2]。

这条路线试图绕开自陈问卷的"自我报告"瓶颈——不再问你是什么类型,而是从你自然产生的文本中推断。其技术逻辑在于:BERT这类预训练语言模型通过大规模语料学习,能够将一段文本编码为包含上下文信息的向量表示,从而捕捉词语在具体语境中的语义;而使用者层级的Transformer则在此基础上,对同一人多篇文本的向量进行再整合,试图从跨文本的稳定模式中提取人格倾向。相比传统词袋模型只统计词频、忽略语序与语境,这一路线在理论上更贴近"语言习惯反映心理特征"的假设。

但该研究同时揭示了一个关键方法学陷阱:常见资料集(如Kaggle MBTI Personality Type Dataset)的资料来源多源自人格讨论社群,文本中可能直接出现MBTI类型、人格维度缩写或认知功能等相关词汇;若未处理,模型可能依赖显性标签线索进行分类,造成标签泄漏并高估模型效能[2]。换言之,模型看似"学会了识别人格",实则可能只是"学会了识别人们谈论人格时用的词"——这正是标签泄漏的典型表现:模型捕捉到的是与标签直接相关的表面线索,而非可泛化到真实场景的行为信号。

另一项来自国立清华大学资讯系统与应用研究所的研究,则尝试用语言特征与表情符号提升九型人格的分类效率。研究指出,九型人格特征可以提供更深入且更易懂的个人资讯,更适合用在心理学和精神病学等领域;就结果而言,与词袋功能相比,表情符号和语言特征(如语言查询与单词计数LIWC、词性标签POS)在跨源性格侦测中显得更稳定和更泛化,逻辑回归在所有特征和所有性格类型上都能正常工作[5]。

这里值得进一步说明的是,LIWC与POS之所以在跨源场景中表现更稳定,原因在于它们提取的是相对抽象、与具体话题无关的语言特征。LIWC统计的是功能词、情绪词、认知词等类别的使用比例,POS标注的是词语的语法角色,二者都不依赖文本讨论的具体内容。正因如此,当模型从一种文本来源迁移到另一种来源时,这类特征受话题差异的干扰较小,泛化能力相对更强。这也提示了一个更普遍的原则:在人格文本挖掘中,特征越贴近"怎么表达"而非"表达了什么",跨场景稳定性往往越好。

三、效度之争:人格问卷在选拔中到底站得住脚吗

3.1 预测效度的层级差异

SHRM专家Whitney Martin在2018年人才大会上提出的"四个V"原则中,明确区分了不同测评工具的预测力:心理能力测验是"工作绩效的单一最佳预测指标"[3]。这一判断在测评行业内具有相当共识度——能力测验与人格测验的效度不在同一量级。

需要说明的是,这一结论在测评学界有更系统的证据基础。自Schmidt与Hunter对近百年选拔效度研究进行元分析以来,认知能力测验在多数职业绩效预测中始终位居前列,其效度系数通常显著高于自陈式人格测验。人格测验中相对表现较好的是尽责性维度,但其增量效度——即在认知能力之外额外贡献的预测力——通常有限。因此,"能力测验优于人格测验"并非某一次会议的个别观点,而是多项独立研究反复验证的层级差异。这也意味着,将人格测评作为招聘的"硬杠杠",在效度逻辑上缺乏足够支撑。

3.2 学术界的长期分歧

北京师范大学管理学院李永瑞对人员选拔中人格问卷可用性之争的系统综述指出,个性调查问卷旨在通过一系列专门设计问题的施测结果来预测候选人的工作绩效;但以往研究由于对工作绩效内涵及对应参照效标的界定、问题设计的逻辑基础等方面存在各自局限,一直以来对个性调查问卷的有效性存在分歧[4]。该文提出的改进方向是:从平衡计分卡四个维度定义工作绩效参照效标,采用内嵌并纵贯模式跟踪候选人工作绩效参照效标[4]。

这意味着,人格问卷预测效度争议的根源,很大程度上不在问卷本身,而在于"工作绩效"这个被预测对象从未被清晰、统一地定义过。当不同研究用销售额、上级评分、任务完成度等不同指标作为效标时,得到的效度系数自然难以比较,争议也就难以收敛。

3.3 信度:一个容易被忽视的前置问题

效度之前是信度。一项对1994至2013年间国内大五人格测验研究文献的信度概化分析显示:检索到的文献中约68.15%存在"信度引入"现象;未加权估计中,A(宜人性)和O(开放性)的均值最低,N(神经质)和C(尽责性)的均值最高,国内所得结果均略低于国外(O除外)[14]。回归分析还显示,分数均值、量表来源和南北地域差异是N维度信度的预测变量;量表来源、文章专业类型、测验版本和测验记分对E(外向性)维度信度具有预测作用[14]。

换言之,同一份人格测验,换个量表来源、换个施测地区,信度就可能波动。这对将人格测评直接用作招聘"硬杠杠"的做法,构成了不容忽视的技术质疑。信度是效度的前提:若测量结果本身不稳定,那么无论效标如何界定,基于该结果的预测都难以可靠。因此,讨论人格测评能否用于选拔,信度问题应当先于效度问题被审视。

四、AI招聘工具的能力边界

综合上述技术路线与效度证据,以人才测评的专业视角,可以给出一个相对清晰的能力边界判断:

能预测的:心理能力测验被认为是工作绩效的单一最佳预测指标[3];在跨源性格侦测中,表情符号和语言特征显得更稳定和更泛化[5]。

不能可靠预测的:将单一心理测试结果作为推断个体心理特征的充分依据[7];以及——在存在标签泄漏的资料集上训练的模型,其报告效能很可能被高估[2]。

尚待解决的:人格问卷对工作绩效的预测效度,取决于绩效参照效标能否被合理界定,以及能否通过内嵌并纵贯模式进行长期跟踪[4]。

五、使用AI招聘工具的三个前提

从数字化组织与人才发展的实践视角看,AI招聘工具并非不可用,而是需要三个前提:

第一,明确工具在决策链中的位置。 心理能力测验被认为是工作绩效的单一最佳预测指标[3]。工具没有绝对好坏,关键在于是否被放在了与自身效度匹配的决策位置上。

第二,警惕技术路线自带的方法学风险。 文本挖掘路线看似比问卷"客观",但标签泄漏会系统性地高估模型效能[2];问卷路线看似成熟,但信度概化分析显示其在国内应用中的稳定性存在结构性波动[14]。两条路线各有各的坑。

第三,把测评结果放回多方法、多角度的考察框架中。 陈祉妍教授的建议值得重复:要想真正考察一个人,必须用多种方法、从多个角度来考察,再用心理测试结果进行辅助分析,这样才可能得出一个比较可靠、客观的结果[7]。

人格分类的技术路线在进步,例如有研究采用Transformer整合同一使用者的多篇贴文进行16类MBTI预测[2],模型确实在变得更精细。但技术精细度的提升,并不自动等同于预测效度的提升。简历之外的信号值得读,但读它的人需要清楚:自己读到的,究竟是信号,还是噪声。

六、结语

MBTI在社交网络上的走红,与其在招聘中的慎用,并不矛盾[7]。前者是自我探索与社交互动的工具,后者是需要效度证据支撑的决策工具。赵龙飞老师在讲座中特别指出,MBTI并非用于评价人格优劣,而是帮助我们理解人与人之间的差异性、促进沟通与协作的有效工具[6]。这一判断同样适用于AI招聘工具:理解差异、辅助沟通,与替代决策,是两件需要被严格区分的事。

从人才测评的专业角度看,真正值得投入的,或许不是寻找一个能"看透人"的算法,而是采用内嵌并纵贯模式持续跟踪工作绩效参照效标[4]。工具会迭代,但对"预测什么、不能预测什么"的清醒认知,才是招聘决策中更稀缺的能力。

延伸阅读

你的人格类型是什么?

3 分钟完成专业测试,获得真正属于你的人格解读,而不是靠猜测对号入座

免费开始完整测试 →