🔗 참고자료
https://www.boannews.com/media/view.asp?idx=137849&kind=0
LG유플러스, AI로 딥페이크 보이스피싱 잡는다
LG유플러스가 AI 위변조한 음성을 탐지하는 ‘안티딥보이스’(Anti-DeepVoice) 기술을 30일 자사 AI 에이전트 서비스 ‘익시오’에 탑재해 온디바이스 형태로 상용화한다. AI가 합성한 얼굴을 골라내
www.boannews.com
http://www.ktword.co.kr/test/view/view.php?no=2742
VAD
VAD Voice Activity Detection, Voice Activity Detector, Silent Suppression 묵음 처리, 묵음 삭제, 침묵 제거(2024-08-31) 1. VAD 이란? ㅇ VoIP 등에서 대역폭 절약을 위하여, - 의미가 내포되지 않는 부분인 묵음에 대
www.ktword.co.kr
https://www.ibm.com/kr-ko/think/topics/speech-to-text
Speech To Text란 무엇인가요? | IBM
AI와 딥 러닝은 Speech to Text 소프트웨어를 더욱 발전시키고 효율적으로 만들어 사용 사례를 확대했습니다.
www.ibm.com
https://terms.tta.or.kr/dictionary/dictionaryView.do?word_seq=056506-4
TTA정보통신용어사전
한국정보통신기술협회(TTA)는 정보통신 기술 발전과 타 분야와의 기술 융합에 따라 무수히 생성되는 정보통신용어를 해설하고 표준화하여, 전문가뿐만 아니라 비전문가들도 올바르게 활용할 수
terms.tta.or.kr
딥페이크 음성의 위협 및 대응 연구 동향, 홍기훈, 한국정보보호학회논문지 제34권 제6호 pp.1566 - pp.1577 , 2024.12
1. Anti-DeepVoice
1.1 Anti-DeepVoice
- AI 위변조한 음성을 탐지하는 기술
- LG유플러스가 개발한 VAD(Voice Activity Detection), STT(Speech-to Text), 안티스푸핑(Anti-spoofing) 등 기술로 구현
- 통화 중 실제 음성 구간을 탐지(VAD)하고, 탐지된 음성을 텍스트로 변 환(STT)해 음성 위변조 여부를 분석
1.2 VAD (Voice Activity Detection)
- 대역폭 절약을 위해 의미가 내포되지 않은 묵음에 대해 삭제(Silence Suppession) 을 수행
- 통신 중 묵음 또는 실제음에 대한 검충 능력/기능
- 대화 중 묵음 기간 동안의 음성 패킷을 삭제
- VAD 알고리즘
- 입력 신호에서 실제 음성과 묵음을 분간하는 기술
- ‘배경 잡음’과 ‘실제 음성’을 구분하는 기준을 결정하는 알고리즘
- 음성부호화 기술에서 묵음/실제음을 구분하는 신호처리를 위한 알고리즘
1.3 STT (Speech to Text)
- 음성을 텍스트로 변환하는 프로세스
- 음성 입력 ➡️ 특징 추출 ➡️ 디코더 ➡️ 단어 출력
- 프로세스
1️⃣오디오 전처리
2️⃣소리 분석 및 추출
1.4 Anti-spoofing
🎭Spoofing
- 공격자가 네트워크, 웹사이트 등의 데이터 위변조를 통해 정상 시스템인 것처럼 위장하여 일반 사용자를 속이는 해킹 기법
- 네트워크 시스템의 IP주소, DNS 등을 위변조하여 공격 대상 시스템이 정상적인 사용자 또는 시스템인 것처럼 가장하여 접근/접근하도록 유도
- 생체인식 시스템의 공격에도 이용될 수 있음
2. Latest Model for AI Voice Detection
2.1 Data Augumentation (학습 음성 데이터 증강)
- AI 합성 음성 탐지 모델이 다양한 음성 형태와 노이즈, 음악 등이 포함된 음성 샘플에서도 AI 합성 음성과 사람 음성을 탐지하기 위함
- 학습 음성 데이터에 대한 데이터 증강을 수행함.
2.2 Fronted (음성 특징 추출)
- Wav2vec 2.0
- 자동 음성 인식 (ASR)을 위해 개발된 모델로서 음성을 입력 받아 텍스트로 변환
- 대규모 음성 데이터를 self supervised learning
- WavLM
- 음성 신호의 일부를 마스킹하고, 마스킹된 부분의 예측과 노이즈 제거를 동시에 수행하 면서 학습
- 다양한 노이즈를 부여하고 노이즈가 포함된 음성 신호에서 원래의 음성을 복원하도록 학습
- Convolution feature encoder + transformer encoder
2.3 Backend (음성 특징 분류)
- 최근모델들은 AASIST를 사용
- 주파수적 특징과 시간적 특징을 그래프 어텐션 네트워크 (GAT)를 이용
- 연관성과 중요도를 다양한 관점에서 고려한 특징 결합 기법을 사용하여 두 분류 간의 차이를 학습
'독학 > [etc] 보안 이슈 공부' 카테고리의 다른 글
| [🔐2025-07] 보안 이슈 찾아보기 : SSO(Single Sign-On) (3) | 2025.07.26 |
|---|---|
| [🔐2025-05] 보안 이슈 찾아보기 : BPF 도어와 FDS 2.0 (1) | 2025.05.30 |