1. Abstract
2. Intro
-
SPP의 정의와 중요성
- SPP는 학생이 시험이나 평가, 과정을 치를 때의 결과(성적)를 예측하는 작업
- 학생 개개인에게 개인화된 교육 제공, 성장 마인드셋(학습 동기 부여) 및 위험 학생 조기 식별하는 중요한 역할 수행
- 기존에는 전통적인 머신러닝 알고리즘과 추천 시스템 기반 접근 방식을 진행함
- 전통적인 머신러닝 알고리즘(결정트리, K-nearnest, 신경망), 추천 시스템 기반 접근 방식(MF 매트릭스 분해) 등을 사용하여 예측 수행
-
문제점
- 콜드 스타트 문제 : 새로운 학생이나 학습 항목에 대한 데이터가 부족할 때 예측 성능 저하
- 제한된 보조 정보 활용 : 기존 연구들은 주로 단일 형태의 보조 정보(예: 학생의 성격 정보)만을 사용하며, 다양한 형태의 정보를 통합하지 못함
3. 연구 목표
- 다중 모드 보조 정보를 효과적으로 통합하여 SPP의 성능을 향상시키는 새로운 방법 제안
- 이를 위해 대형 언어 모델을 사용하여 다양한 형태의 보조 정보를 통합하고, 이를 매트릭스 분해 방법 적용
4. 방법론

- 언어화(Verbalization) : 다양한 형태의 보조 정보를 텍스트 문장으로 변환
- 예를 들어 학생의 메타데이터와 학습 과제의 설명을 텍스트 형식으로 변환
- 프롬프트(Prompting): 변환된 텍스트 문장을 대형 언어모델(GPT-J, Llama2)에 입력하여 의미있는 임베딩(벡터 표현)을 생성함
- 이는 이 임베딩은 언어 모델이 입력데이터(학생, 문제)의 복잡한 의미와 관계를 학습한 결과임
- 모델의 텍스트의 의미(정보)를 이해할 수 있도록 도움
- 지식 전이(Knowledge Transfer) :
- 생성된 임베딩은 학생 성적 예측 모델의 입력으로 사용
- 매트릭스 분해(MF) 방법에 통합하여 학생 성적 예측 모델을 학습
- MF 하려면 item feature / user feature가 필요 item feature는 예시로, 문제에 대한 정보 (난이도, 등등) (table data, text data)를 embedding해서 feature로 활용한다
- 지식 전이 : 하나의 모델에서 학습된 지식을 다른 모델이나 작업에 적용하는 것을 의미함
- item feature 뽑을 때, 다양한 feature를 보니 (table에 있는 numerical value, text 등) 멀티모달임
- 이 과정에서 언어 모델의 임베딩은 예측 성능을 향상시키는 중요한 역할 수행