상세 보기
대규모 언어모델을 활용한 데이터셋 생성을 위한 프롬프트 디자인 및 생성 방법론 분석
Prompt Designing and Analysis on Generation Method for Dataset Generation by Large Language models
- 김강민;
- 채동규
초록
최근 데이터셋 생성을 위해 대규모 언어모델을 활용하여 양질의 데이터를 얻는 여러 방법들이 연구되어왔다. 본 논문에서는 기존의 여러 방법들 중, 언어모델의 능력을 가장 잘 이끌어 낼 수 있는 프롬프트를설계하는 방법과 그 유형을 정리한다. 또한, 토큰 생성 확률을 self-debiasing 방법론을 통해 조정하여각기 다른 과제(task)에 적합한 데이터셋을 만드는 방법론을 적용한다. 이 두가지 방법론들을 활용해 대규모 언어모델을 활용한 한국어 데이터셋 제작 시 고려해야 할 사항들을 탐구한다
- 제목
- 대규모 언어모델을 활용한 데이터셋 생성을 위한 프롬프트 디자인 및 생성 방법론 분석
- 제목 (타언어)
- Prompt Designing and Analysis on Generation Method for Dataset Generation by Large Language models
- 저자
- 김강민; 채동규
- 발행일
- 2023-06
- 유형
- Proceeding
- 저널명
- 2023 한국컴퓨터종합학술대회 (KCC 2023)
- 페이지
- 337 ~ 339