Sound of Vision: Audio Generation from Visual Text Embedding through Training Domain Discriminator

Citations

WEB OF SCIENCE

0
Citations

SCOPUS

0

초록

Recent advancements in text-to-audio (TTA) models have demonstrated their ability to generate sound that aligns with user intentions. Despite this advancement, a notable limitation arises from the models' inability to effectively synthesize audio from visual-domain texts. In this study, we address this challenge by utilizing a novel dataset that pairs visual and acoustic-domain texts, derived using ChatGPT-3.5, and encoding switch through a domain discriminator. This approach ensures not only computational efficiency but also enhances the model's generalization, adaptability, and flexibility. It addresses concerns that training exclusively with visual texts might compromise audio generation quality from audio texts. This study presents a novel methodology for enhancing text-to-audio synthesis, demonstrating significant improvements in audio output fidelity from visual-text inputs.

키워드

audio generationmulti-modaltext embeddingAudio signal processingEmbeddingsSignal encoding
제목
Sound of Vision: Audio Generation from Visual Text Embedding through Training Domain Discriminator
저자
Kim, JaewonChoi, Won-GookAhn, SeyunChang, Joon-Hyuk
DOI
10.21437/Interspeech.2024-1451
발행일
2024-09
유형
Proceedings Paper
저널명
INTERSPEECH 2024
페이지
3305 ~ 3309