대규모 언어모델을 활용한 데이터셋 생성을 위한 프롬프트 디자인 및 생성 방법론 분석

Prompt Designing and Analysis on Generation Method for Dataset Generation by Large Language models

초록

최근 데이터셋 생성을 위해 대규모 언어모델을 활용하여 양질의 데이터를 얻는 여러 방법들이 연구되어왔다. 본 논문에서는 기존의 여러 방법들 중, 언어모델의 능력을 가장 잘 이끌어 낼 수 있는 프롬프트를설계하는 방법과 그 유형을 정리한다. 또한, 토큰 생성 확률을 self-debiasing 방법론을 통해 조정하여각기 다른 과제(task)에 적합한 데이터셋을 만드는 방법론을 적용한다. 이 두가지 방법론들을 활용해 대규모 언어모델을 활용한 한국어 데이터셋 제작 시 고려해야 할 사항들을 탐구한다

제목
대규모 언어모델을 활용한 데이터셋 생성을 위한 프롬프트 디자인 및 생성 방법론 분석
제목 (타언어)
Prompt Designing and Analysis on Generation Method for Dataset Generation by Large Language models
저자
김강민채동규
발행일
2023-06
유형
Proceeding
저널명
2023 한국컴퓨터종합학술대회 (KCC 2023)
페이지
337 ~ 339