FIND YOUR TYPE

读完之后,测一测自己是哪一型

3 分钟完成免费测试,获取专属人格解读

立即免费MBTI测试 →
🧩

从九型人格到MBTI:用语言特征和表情符号做性格分类,准到什么程度

摘要 社交媒体上的文字与表情符号,能否被算法用来推断性格类型?本文梳理九型人格与MBTI的算法分类研究,分析其准确度边界、标签泄漏风险与落地价值,并给出审慎的应用判断。 一、性格分类的算法化:一个正在发生的转向 性格测试在职场中的渗透速度,比多数人感知到的更快。MBTI、卡特尔16PF、PDP、九型人格等工具不仅出现在

✍ 辛靳(心理学硕士) ⏱ 约12分钟阅读 🗓 2026-09-21 09:18

从九型人格到MBTI:用语言特征和表情符号做性格分类,准到什么程度

摘要

社交媒体上的文字与表情符号,能否被算法用来推断性格类型?本文梳理九型人格与MBTI的算法分类研究,分析其准确度边界、标签泄漏风险与落地价值,并给出审慎的应用判断。

一、性格分类的算法化:一个正在发生的转向

性格测试在职场中的渗透速度,比多数人感知到的更快。MBTI、卡特尔16PF、PDP、九型人格等工具不仅出现在面试环节,甚至被部分企业用于岗位调整和晋升决策,有企业还提出性格测试不通过一年内不能再投简历的要求[3]。当这类测试被当作招聘“硬杠杠”时,一个技术问题随之浮现:能否绕过冗长的自评问卷,直接从一个人日常写下的文字和表情符号中推断其性格类型?

这不是空想。近年文献中已出现以九型人格和MBTI为目标标签、以语言特征和表情符号为输入特征的分类研究。它们的结论并不一致,但恰好勾勒出“算法识人”的真实能力边界。

二、九型人格的算法分类:表情符号为何比词袋更稳

2.1 一项关键研究的结论

国立清华大学資訊系統與應用研究所的一篇硕士论文,专门探讨了利用语言特征和表情符号提升九型人格分类效率的问题。研究者鳳淑芬(Phongthipphithak, Nareekarn)在陈宜欣指导下,对比了词袋特征与表情符号、语言特征(如LIWC语言查询与单词计数、POS词性标签)在跨来源性格检测中的表现[1]

该研究的核心发现是:与词袋功能相比,表情符号和语言特征在跨源性格检测中显得更稳定、更泛化,且逻辑回归在所有特征和所有性格类型上都能正常工作[1]

这个结论需要放在“跨源检测”的语境中理解。所谓“跨源”,指模型在一个数据来源上训练、在另一个来源上测试——这比同源测试更接近真实应用场景。词袋特征在跨源时容易失效,原因在于其高度依赖特定语料中的词汇分布:训练集中高频出现的词汇,在测试集中未必以相同频率或相同语义出现,模型学到的更多是“这批语料的用词习惯”而非“这类人的表达风格”。相比之下,表情符号和词性标签携带的是一种更抽象的表达风格信号,对具体词汇分布的依赖较低,因而迁移性更强。这一机制也解释了为何逻辑回归这类相对简单的分类器在该任务上表现稳定:当特征本身已具备较好的跨源泛化能力时,复杂模型带来的边际收益有限。

2.2 为什么九型人格适合算法切入

该研究给出的理由颇具专业分量:五大性格特质模型和迈尔斯-布里格斯性格分类指标是常见选择,但它们仅适用于教育、商业等某些行业;九型人格特征可以提供更深入以及更易懂的个人信息,更适合用在心理学和精神病学等领域[1]

从人才测评的专业视角看,这一判断有其道理。九型人格的核心不在于行为描述,而在于行为背后的欲望与核心恐惧。国立台湾师范大学的一篇硕士论文对九型人格的定位做了更完整的阐述:九型人格可以上溯至史前一萬年前遠古文明的智慧,在60年代加入現代心理學後成為現代九型人格學;它不僅只是一門性格分類學,重要的是透過自我本型的了解,能夠深入探索自己行為背後的欲望及核心的恐懼[2]。该研究还提到,美国哈佛、斯坦福及北京清华开设了相关九型人格商学应用课程,同时应用于各大企业与团队培训[2]

从分类任务的设计逻辑看,九型人格以核心恐惧和欲望为组织原则,这一理论定位意味着同一类型的个体在深层动机上具有一致性,理论上比一时一地的行为表达更适合被语言特征捕捉。但这也恰恰是算法分类的难点:核心恐惧和欲望是深层心理结构,个体不会在社交媒体上直接书写“我的核心恐惧是被抛弃”,算法只能从用词偏好、句式结构和表情符号使用习惯中间接推断。换言之,理论上的“可捕捉性”与工程上的“可操作性”之间存在显著落差——动机越深层,其语言表征越间接、越容易被情境因素掩盖。

三、MBTI的算法分类:标签泄漏与真实准确度

3.1 一个被忽视的方法论陷阱

辅仁大学统计資訊學系的一篇硕士论文,直接指向了MBTI算法分类研究中的一个系统性偏差。研究者許益峻指出,MBTI經由社群媒體與網路平台廣泛傳播,成為大眾自我探索與社交互動時常見的人格分類工具;然而在人格類型分類研究中,常見的資料集(如Kaggle MBTI Personality Type Dataset)資料來源多源自人格討論社群,文本中可能直接出現MBTI類型、人格維度的縮寫,或認知功能等相關詞彙,若未處理,模型可能依賴顯性標籤線索進行分類,造成標籤洩漏並高估模型效能[19]

这段话值得反复咀嚼。如果一个用户在帖子中写了“作为INFP,我……”,那么模型学会的是识别“INFP”这个字符串,而不是理解这个人的表达风格。这种情况下报告的高准确率,本质上是一种数据泄漏,而非真正的性格推断能力。从方法论角度看,标签泄漏的隐蔽性在于:它不会表现为明显的错误,反而会呈现为“令人满意”的高指标,使研究者误以为模型已捕捉到深层规律。

3.2 剥离标签后的真实表现

该研究以使用者為單位,採用階層式Transformer模型進行分類:先以BERT編碼器取得單篇貼文之語意表示,再透過使用者層級Transformer編碼器整合同一使用者多篇貼文[19]。这种“先编码单篇、再整合用户”的架构,比简单拼接所有文本更符合“一个人有多条发言”的真实数据结构——它允许模型在用户层级上学习跨帖子的表达一致性,而非将多条帖子视为一个无结构的词序列。

该研究摘要给出了剥离标签线索前后的具体数字:在不遮蔽设定下,Accuracy、Macro F1-score、Weighted F1-score分别为0.6537、0.5414、0.6493;在全遮蔽设定下,三项指标分别下降至0.2900、0.1443、0.2698[19]

这组对比数据本身就说明问题。Macro F1-score从不遮蔽的0.5414降至全遮蔽的0.1443,降幅尤为显著——Macro F1对各类别的召回率给予同等权重,其大幅下降意味着模型在多数类别上已接近随机水平,而非仅在个别类别上失效。当研究者认真处理标签泄漏后,模型性能显著下降,而下降后的数字才更接近“用语言特征推断性格”的真实水平。遮蔽前后准确率的大幅落差,也提示此前同源测试中报告的高准确率存在高估风险。

四、从分类到干预:MBTI在真实场景中的有效性证据

算法分类的准确度是一回事,性格分类本身在真实场景中能否产生可测量的效果是另一回事。后者反而有更扎实的一手证据。

广西壮族自治区生殖中心的一项研究,选取2020年1月至2023年6月在该中心就诊的首次接受试管婴儿的不孕不育夫妻共247对,通过随机数字表法分为对照组和实验组;对照组接受常规心理护理干预,实验组则基于MBTI性格分析结果进行个性化心理护理。结果显示,实验组在干预后抑郁自评量表(SDS)和焦虑自评量表(SAS)得分显著低于对照组,生活质量评估(SF-36)得分高于对照组[11]。需要说明的是,该研究摘要中“共247对”与“每组92对”之间存在数字不一致,具体分组人数以原文为准。

这项研究的价值在于:它没有停留在“分类是否准确”的争论上,而是直接检验了“基于分类的差异化干预是否有效”。结论是积极的,且采用了随机分组设计。当然,其局限也很明显——研究场景高度特定(试管婴儿治疗前),干预效果可能部分来自“被个性化关注”本身而非分类的精确性。换言之,随机分组控制了“是否接受干预”的差异,但无法完全分离“个性化护理方案”与“额外关注与沟通”各自的贡献。这一局限并不否定研究结论,但提示在向其他场景推广时需保持审慎。

另一项来自长庚大学的研究,则从组织行为学角度切入。该研究针对国军通资电单位人员,采用纸本问卷与电子问卷共回收351份有效问卷,分析MBTI人格类型对部门、组织认同度与离职倾向的影响。结果显示,通资电单位人员人格类型比例最高者为ISFJ型占31.63%,次之为ISTJ型占20.51%[23]。该研究的问题意识很明确:在少子化与大缺工的环境下,如何降低流动率、提升人员对组织的认同度,使人才能适才适所地摆在正确的位置上[23]

值得注意的是,该研究并未声称MBTI能“预测”离职,而是将人格类型作为分析组织认同与离职倾向的一个知觉变量。这种审慎的定位,与部分企业将MBTI当作招聘“硬杠杠”的做法形成了鲜明对比。

五、从人才测评视角看:算法分类的能与不能

5.1 能做什么

综合上述研究,用语言特征和表情符号做性格分类,目前能够做到的是:

第一,在受控条件下,对特定人格框架(如九型人格)进行预筛选。 清华大学的硕士论文明确将研究定位为“Enneagram Personality Pre-screening”,即预筛选而非精确诊断[1]。这意味着算法输出的价值在于缩小范围、提示方向,而非给出确定结论。预筛选的定位也意味着,其评估指标应关注召回率而非精确率——漏掉一个潜在匹配的代价,通常低于错误排除的代价。

第二,发现表达风格与人格类型之间的统计关联。 表情符号和词性标签在跨源检测中比词袋更稳定[1],说明不同性格类型确实在表达风格上存在可检测的差异。这种差异是概率性的,不是决定性的。其实际意义在于:当样本量足够大、场景相对一致时,表达风格可作为人格类型的一个弱信号;但个体层面的推断仍面临较高的不确定性。

第三,为个性化干预提供参考维度。 试管婴儿研究显示,基于MBTI的个性化心理护理在焦虑、抑郁和生活质量指标上均优于常规护理[11]。这说明即使分类本身存在误差,将分类结果作为“多一个理解患者的视角”仍有临床价值。从机制上看,个性化干预的有效性可能来自两方面:一是分类结果帮助护理人员选择了更匹配的沟通方式,二是分类过程本身促使护理人员更系统地思考患者的个体差异。

5.2 不能做什么

从人才测评的专业角度看,以下边界必须明确:

其一,不能替代多方法、多角度的综合评估。 中国科学院心理研究所教授陈祉妍在接受采访时指出,任何测试都是有局限性的,MBTI测试可以帮我们更好地了解人的性格特征,但不能仅以单一的测试结果就推断一个人的心理特征;要想真正考察一个人,必须用多种方法、从多个角度来考察,再用心理测试结果进行辅助分析,这样才可能得出一个比较可靠、客观的结果[4]

其二,不能忽视标签泄漏带来的虚假高准确率。 辅仁大学的研究已经证明,如果数据集中的文本直接包含MBTI类型缩写,模型可能依赖显性标签线索进行分类,造成标签泄漏并高估模型效能[19]。任何声称高准确率的研究,都需要先检查其数据预处理是否排除了这种泄漏。判断方法并不复杂:检查数据集中是否包含人格类型名称、维度缩写或相关术语,以及这些特征在训练集和测试集中的分布是否一致。

其三,不能将短时状态误认为稳定特质。 专业人士认为,心理测试结果可能仅反映测试者短时状态,企业招聘时不宜将其作为决定因素[3]。语言特征同样受情绪、场景、话题的强烈影响——一个人在工作群和深夜朋友圈里的用词风格可能判若两人。这意味着,即使模型在某一时间窗口内准确捕捉了某人的表达风格,该风格本身也可能随情境和时间发生显著变化。

六、结论:分类是起点,不是终点

回到标题的问题:用语言特征和表情符号做性格分类,准到什么程度?

从现有研究看,剥离标签泄漏后准确率显著下降至0.2900,说明此前报告的高准确率存在高估风险[19]。九型人格的算法预筛选研究显示表情符号和语言特征比词袋更泛化[1],但“更泛化”不等于“足够准”。MBTI的Transformer分类研究则揭示了该领域普遍存在的高估风险[19]

然而,这并不意味着这条路径没有价值。试管婴儿研究中基于MBTI的个性化心理护理取得了可测量的积极效果[11],国军通资电单位人员的研究将MBTI用于分析组织认同与离职倾向的知觉差异[23]。这些应用的共同点是:分类结果被用作辅助视角,而非决定因素。

从人力资源与组织发展的视角看,性格分类工具——无论是九型人格、MBTI还是基于语言特征的算法推断——最有价值的用途,是帮助人们获得一个理解自己和他人的新角度,而不是给人贴上不可更改的标签。当企业将性格测试当作招聘“硬杠杠”时[3],它可能正在用一个短时状态的快照,否定一个本可以成长的候选人。当算法研究者忽视标签泄漏时[19],它可能正在用一个虚假的高准确率,误导整个领域对技术成熟度的判断。

语言和表情符号里确实藏着性格的线索,但这些线索是模糊的、概率性的、高度依赖语境的。把它们当作一面镜子,而不是一把尺子,或许是更负责任的态度。

延伸阅读

你的人格类型是什么?

3 分钟完成专业测试,获得真正属于你的人格解读,而不是靠猜测对号入座

免费开始完整测试 →