독학/[etc] 보안 이슈 공부

[🔐2025-06] 보안 이슈 찾아보기 : AI 위변조 음성 탐지

최연재 2025. 6. 30. 22:31

🔗 참고자료

https://www.boannews.com/media/view.asp?idx=137849&kind=0

 

LG유플러스, AI로 딥페이크 보이스피싱 잡는다

LG유플러스가 AI 위변조한 음성을 탐지하는 ‘안티딥보이스’(Anti-DeepVoice) 기술을 30일 자사 AI 에이전트 서비스 ‘익시오’에 탑재해 온디바이스 형태로 상용화한다. AI가 합성한 얼굴을 골라내

www.boannews.com

 

http://www.ktword.co.kr/test/view/view.php?no=2742

 

VAD

VAD   Voice Activity Detection, Voice Activity Detector, Silent Suppression   묵음 처리, 묵음 삭제, 침묵 제거(2024-08-31) 1. VAD 이란? ㅇ VoIP 등에서 대역폭 절약을 위하여, - 의미가 내포되지 않는 부분인 묵음에 대

www.ktword.co.kr

 

https://www.ibm.com/kr-ko/think/topics/speech-to-text

 

Speech To Text란 무엇인가요? | IBM

AI와 딥 러닝은 Speech to Text 소프트웨어를 더욱 발전시키고 효율적으로 만들어 사용 사례를 확대했습니다.

www.ibm.com

 

https://terms.tta.or.kr/dictionary/dictionaryView.do?word_seq=056506-4

 

TTA정보통신용어사전

한국정보통신기술협회(TTA)는 정보통신 기술 발전과 타 분야와의 기술 융합에 따라 무수히 생성되는 정보통신용어를 해설하고 표준화하여, 전문가뿐만 아니라 비전문가들도 올바르게 활용할 수

terms.tta.or.kr

 

딥페이크 음성의 위협 및 대응 연구 동향, 홍기훈, 한국정보보호학회논문지 제34권 제6호 pp.1566 - pp.1577 , 2024.12

 

 

1. Anti-DeepVoice

1.1 Anti-DeepVoice

- AI 위변조한 음성을 탐지하는 기술

- LG유플러스가 개발한 VAD(Voice Activity Detection), STT(Speech-to Text), 안티스푸핑(Anti-spoofing) 등 기술로 구현

- 통화 중 실제 음성 구간을 탐지(VAD)하고, 탐지된 음성을 텍스트로 변 환(STT)해 음성 위변조 여부를 분석

 

1.2 VAD (Voice Activity Detection)

- 대역폭 절약을 위해 의미가 내포되지 않은 묵음에 대해 삭제(Silence Suppession) 을 수행

- 통신 중 묵음 또는 실제음에 대한 검충 능력/기능

- 대화 중 묵음 기간 동안의 음성 패킷을 삭제

- VAD 알고리즘

  • 입력 신호에서 실제 음성과 묵음을 분간하는 기술
  • ‘배경 잡음’과 ‘실제 음성’을 구분하는 기준을 결정하는 알고리즘
  • 음성부호화 기술에서 묵음/실제음을 구분하는 신호처리를 위한 알고리즘

 

1.3 STT (Speech to Text)

- 음성을 텍스트로 변환하는 프로세스

- 음성 입력 ➡️ 특징 추출 ➡️ 디코더 ➡️ 단어 출력

- 프로세스

1️⃣오디오 전처리

2️⃣소리 분석 및 추출

 

1.4 Anti-spoofing

 🎭Spoofing

- 공격자가 네트워크, 웹사이트 등의 데이터 위변조를 통해 정상 시스템인 것처럼 위장하여 일반 사용자를 속이는 해킹 기법

- 네트워크 시스템의 IP주소, DNS 등을 위변조하여 공격 대상 시스템이 정상적인 사용자 또는 시스템인 것처럼 가장하여 접근/접근하도록 유도

- 생체인식 시스템의 공격에도 이용될 수 있음

 

2. Latest Model for AI Voice Detection

2.1 Data Augumentation (학습 음성 데이터 증강)

- AI 합성 음성 탐지 모델이 다양한 음성 형태와 노이즈, 음악 등이 포함된 음성 샘플에서도 AI 합성 음성과 사람 음성을 탐지하기 위함

- 학습 음성 데이터에 대한 데이터 증강을 수행함.

 

2.2 Fronted (음성 특징 추출)

- Wav2vec 2.0

  • 자동 음성 인식 (ASR)을 위해 개발된 모델로서 음성을 입력 받아 텍스트로 변환
  • 대규모 음성 데이터를 self supervised learning

- WavLM

  • 음성 신호의 일부를 마스킹하고, 마스킹된 부분의 예측과 노이즈 제거를 동시에 수행하 면서 학습
  • 다양한 노이즈를 부여하고 노이즈가 포함된 음성 신호에서 원래의 음성을 복원하도록 학습
  • Convolution feature encoder + transformer encoder

 

2.3 Backend (음성 특징 분류)

- 최근모델들은 AASIST를 사용

- 주파수적 특징과 시간적 특징을 그래프 어텐션 네트워크 (GAT)를 이용

- 연관성과 중요도를 다양한 관점에서 고려한 특징 결합 기법을 사용하여 두 분류 간의 차이를 학습