Research on Transformer-Based Approaches for MBTI Classification Using Social Network Service Data

트랜스포머 기반 MBTI 성격 유형 분류 연구 : 소셜 네트워크 서비스 데이터를 중심으로

  • Jae-Joon Jung (Dept. of Applied Artificial Intelligence, Graduate School of Computer & Information Technology, Korea University) ;
  • Heui-Seok Lim (Graduate School of Computer & Information Technology, Korea University)
  • 정재준 (고려대학교 컴퓨터정보통신대학원 인공지능융합학과) ;
  • 임희석 (고려대학교 컴퓨터정보통신대학원)
  • Published : 2023.07.12

Abstract

본 논문은 소셜 네트워크 이용자의 텍스트 데이터를 대상으로, 트랜스포머 계열의 언어모델을 전이학습해 이용자의 MBTI 성격 유형을 분류한 국내 첫 연구이다. Kaggle MBTI Dataset을 대상으로 RoBERTa Distill, DeBERTa-V3 등의 사전 학습모델로 전이학습을 해, MBTI E/I, N/S, T/F, J/P 네 유형에 대한 분류의 평균 정확도는 87.9181, 평균 F-1 Score는 87.58를 도출했다. 해외 연구의 State-of-the-art보다 네 유형에 대한 F1-Score 표준편차를 50.1% 낮춰, 유형별 더 고른 분류 성과를 보였다. 또, Twitter, Reddit과 같은 글로벌 소셜 네트워크 서비스의 텍스트 데이터를 추가로 분류, 트랜스포머 기반의 MBTI 분류 방법론을 확장했다.

Keywords