사운드투벡터와 트랜스포머를 이용한 텍스트 정규화

Text Normalization using Transformer with Sound2vec

초록

텍스트 정규화는 비표준적 텍스트를 표준적 텍스트로 변환하는 자연어 처리의 상위 태스크이다. 비표 준적 텍스트에서 특히 문제가 되는 것은 사전 외 어휘 문제인데, 많은 연구가 이를 위해 단어의 음성 정 보를 이용하며, 음성 정보 인코딩을 위해 기존의 알고리즘을 이용한다. 그러나 알고리즘은 포착하지 못 하는 정보가 잠재한다는 한계를 지니며, 인코딩 결과로 단어가 음성적으로 얼마나 가까운지 직접 계산이 힘들다. 이 문제를 해결하기 위해 본 연구는 단어를 사전 규칙을 상정하지 않고 음성 정보에 따라 임베 딩하는 사운드투벡터 모델을 제안해 인코더-디코더 구조의 모델을 보완한다. 웹 수집 데이터를 이용해 사운드투벡터 모델이 음성 정보를 적절히 반영하는 사운드 벡터를 만들어내는 것을 입증하였다. 실험 결과, 사운드투벡터를 함께 사용한 트랜스포머 모델은 그렇지 않은 트랜스포머 모델에 비해 높은 F1-score를 보였다.

제목
사운드투벡터와 트랜스포머를 이용한 텍스트 정규화
제목 (타언어)
Text Normalization using Transformer with Sound2vec
저자
원은영차재혁
발행일
2021-12
유형
Proceeding
저널명
한국정보과학회 2021 한국소프트웨어종합학술대회 논문집
페이지
311 ~ 313