I. 서 론
음원의 위치를 파악하기 위한 도래각(Direction of Arrival, DOA) 추정 기술은 해양 탐사, 소나 시스템 등 다양한 분야에서 핵심적인 역할을 수행하고 있다. 전통적인 도래각 추정은 주로 다수의 음압 센서를 공간적으로 이격시켜 배열을 구성하는 방식을 사용해 왔다. 그러나 음압 센서 배열 시스템은 물리적인 크기의 한계로 인해 소형 플랫폼에 탑재하기 어려운 단점이 있다. 이러한 한계를 극복하기 위해 음압뿐만 아니라 직교하는 공간의 입자 속도 성분을 동시에 측정할 수 있는 벡터 센서에 대한 연구가 진행되었다. 벡터 센서는 크기가 소형이면서도 음압과 함께 각 축에 대한 입자 속도 정보를 제공하기 때문에 음원의 도래 방향을 동시에 분석할 수 있는 장점이 있다.[1]
지난 동안 단일 또는 배열 형태의 벡터 센서를 활용한 도래각 추정을 위하여 인텐시티 기반의 기법[2]이나 고전적인 빔형성(Conventional Beamforming, CBF) 및 최소 분산 비왜곡 응답(Minimum Variance Distortionless Response, MVDR) 기반 방법[3,4]들이 제안되었다. 하지만 이러한 기법들은 낮은 신호대잡음비(Signal to Noise Ratio, SNR)를 갖는 환경에서 성능이 저하되는 한계가 있다. 최근에는 이러한 문제를 해결하기 위해 심층 학습을 접목하여 잡음에 강인하면서 비선형적 특징을 학습하려는 시도가 이어지고 있다.[5,6,7] 하지만 기존의 이미지 변환 기반 모델들은 방대한 입력 텐서 차원으로 인해 네트워크 내부의 학습 및 추론 연산량이 증가하는 문제가 존재한다.
본 논문에서는 하나의 벡터 센서를 이용하여 음원의 도래각을 추정하기 위해 심층 학습 기법인 비전 트랜스포머(Vision Transformer, ViT)[8]를 적용하였다. 기존의 방법과는 다르게 입력 데이터를 음향 신호의 특성에 맞게 재구성하고, 분류가 아닌 회귀 방식으로 변형하였다. 제안하는 기법은 수신 신호의 공분산 행렬과 통계적 순간 도래각 분포 경향성을 포함하는 인텐시티 기반 히스토그램을 병렬 입력하여 학습함으로써 낮은 신호대잡음비 환경에서 추정 정확도가 개선되도록 하였다. 또한, 이미지를 입력으로 사용하는 기존의 비전 트랜스포머 방식과 비교하여 연산량을 낮추었고, 셀프 어텐션 메커니즘을 통해 이종 입력 데이터 사이의 전역적인 상관관계를 학습하면서 클래스 토큰(Classification Token, CLS Token)의 구조적 장점을 활용하여 도래각을 연속적인 실수값으로 회귀 추정하는 방식을 제안한다.
II. 벡터 센서 신호 모델
단일 벡터 센서는 전통적인 스칼라 센서와는 다르게 음압뿐만 아니라 직교하는 축에 대한 입자 속도를 동시에 측정할 수 있다. 본 논문에서는 간단한 전개를 위해 2차원 공간에서 입사하는 단일 음원의 도래각 𝜃를 추정하기 위해 음압 센서 1개와 서로 직교하는 축 및 축 입자 속도 센서 2개로 구성된 2차원 벡터 센서를 가정하였으며, 다중경로 전달 성분은 생략하였다. 임의의 시간 에서 단일 벡터 센서의 출력 신호 벡터 는 각 성분의 출력으로 구성되며, 다음의 식과 같이 표현된다.
여기서 는 무지향성 센서에서 측정된 음압을 의미하며, 와 는 각각 축과 축 입자 속도 센서에서 측정된 신호이다. 도래각 𝜃 방향으로부터 수신되는 음원 신호를 라 할 때 벡터 센서의 출력 신호 벡터는 다음과 같이 모델링된다.[2]
벡터 센서 출력 신호 벡터 는 벡터 센서의 공간적 지향 특성을 포함하는 조향 벡터인 Eq. (2)를 이용하여 Eq. (3)으로 표현된다. 식에서 는 각 채널에 유입되는 상호 독립적인 가산성 백색 가우시안 잡음(Additive White Gaussian Noise, AWGN)으로 구성된 벡터이며, 윗 첨자 는 행렬 전치를 의미한다.
도래각 추정을 위한 심층 학습 모델의 입력으로 사용하기 위해 관측된 수신 신호로부터 공분산 행렬을 도출하는데 이는 수신 신호를 샘플링하여 얻어진 개의 을 이용하여 Eq. (5)와 같은 방법으로 추정된다.
윗 첨자 는 행렬 허미티안을 의미한다. Eq. (5)를 통해 도출된 3×3 공분산 행렬의 비대각 원소들은 𝜃에 대한 삼각함수 항들로 구성되어 음압과 입자 속도 사이의 진폭 비율 및 공간적 지향성 정보를 내포한다. 제안한 방법에서는 이러한 공분산 행렬과 함께 인텐시티 기반 기법[2]을 적용하여 도출된 순간 도래각의 통계적 분포를 심층 학습 모델의 입력으로 적용한다.
Fig. 1은 신호대잡음비가 10 dB이면서 음원의 도래각이 0°인 경우 인텐시티 기반 기법[2]을 사용하여 추정된 도래각들의 누적 분포를 시각화한 예시이다. 해당 히스토그램은 스냅샷 구간마다 산출된 도래각을 1° 간격으로 구간별로 누적한 것으로써, 신호대잡음비가 낮아질수록 넓게 분산되는 경향을 보이나, 음원이 위치한 실제 방향을 중심으로 확률적 밀집 형태를 보여준다. 이러한 누적된 통계적 분포는 실제 음원의 공간적 확률 분포 정보를 보존한다.
III. 제안하는 방법
심층 학습을 적용한 기존의 도래각 추정에서 주로 사용되었던 합성곱 신경망(Convolutional Neural Network, CNN) 기법은 지역적인 수용 영역 내의 합성곱 연산에 의존하므로 단일 벡터 센서를 구성하는 음압과 2차원 입자 속도 성분 사이의 복합적인 상관관계를 파악하는데 한계가 있다. 반면, 본 논문에서 제안하는 방법은 트랜스포머 기반 모델의 셀프 어텐션 메커니즘과 멀티 헤드 어텐션 연산을 통해 공분산 행렬 및 히스토그램의 전역적인 비선형 패턴을 각각 학습하고, 입력 데이터의 여러 특징을 병렬적으로 학습하고자 트랜스포머 기반 모델 중 하나인 비전 트랜스포머 구조를 채택하였다. 또한 단일 이미지를 입력으로 처리하던 기존 비전 트랜스포머와 다르게 제안하는 방법은 두 개의 독립적인 트랜스포머 인코더를 통해 공분산 행렬 전반에 걸친 신호 부공간 특성과 히스토그램 패치 내의 순간 도래각 분포 특징을 학습한다. 이러한 다중 특징 학습은 낮은 신호대잡음비 환경에서도 모델이 강건하게 도래각 패턴을 파악할 수 있도록 하였다. 제안하는 방법의 블록도를 Fig. 2에 나타내었다.
본 논문에서 제안하는 기법은 10개의 스냅샷 구간 단위로 집계된 181개의 방위각에 대한 확률분포가 누적된 10 × 181 차원의 히스토그램과 3 × 3 차원의 공분산 행렬을 입력으로 사용한다. 공분산 행렬은 실수부와 허수부로 나눈 뒤 10개 스냅샷 구간 단위로 집계하여 10 × 18 차원으로 구성하여 나열하고, 히스토그램은 1 × 10 크기의 비대칭 패치로 분할하여 평탄화하였다. 이후 위치 정보를 임베딩하여 두 개의 독립적인 트랜스포머 인코더를 통해 병렬로 처리한다. 인코더에서 출력된 1 × 128 차원의 두 개의 클래스 토큰을 추출하여 결합하여 생성된, 1 × 256 차원의 결합된 클래스 토큰은 다층 퍼셉트론(Multi-Layer Perceptron, MLP) 기반의 회귀기로 전달되어 순차적인 차원 축소 과정을 통해 도래각을 추정한다.
공분산 행렬과 히스토그램의 두 가지 이종 데이터를 함께 사용하는 이유는 공분산 행렬은 고유벡터로 대변되는 신호 공간의 정보를 보존하고 있으며, 히스토그램은 순간 도래각의 통계적 분포와 잡음 특성 및 오차 경향성을 복합적으로 내포하고 있기 때문이다. 두 데이터를 함께 입력함으로써 벡터 센서의 공간적 지향성 특성과 통계적 분포 특성을 상호 보완적으로 학습할 수 있으며, 이는 기존과 같이 한 종류의 데이터만을 사용하는 경우보다 낮은 신호대잡음비 환경에서의 추정 오류를 완화한다.
아울러 제안하는 방식은 기존의 비전 트랜스포머를 활용한 도래각 추정 방법에서 사용되었던 시간에 따른 도래각의 변화를 표현한 이미지를 입력으로 사용하는 방법과 비교하여 연산량이 적다는 장점이 있다. 기존 방식은 고해상도의 이미지를 입력 텐서로 사용하므로 트랜스포머 인코더로 분할되어 들어가는 패치 시퀀스의 길이가 증가한다. 이로 인하여 비전 트랜스포머 내부의 셀프 어텐션 계층에서 막대한 GPU 메모리 할당과 연산이 요구된다. 하지만 본 논문에서 제안하는 기법은 공분산 행렬과 히스토그램을 병렬 입력으로 사용한다. 그 결과, 비전 트랜스포머 모델 내부에서 상호작용하고 처리해야 할 토큰의 개수가 축소되고, 이는 모델의 전체적인 파라미터 수와 연산량을 감소시킨다.
제안하는 도래각 추정 모델이 분류가 아닌 연속적인 각도를 추출하는 회귀 추정이라는 점에서 비전 트랜스포머의 클래스 토큰의 구조적 이점이 극대화된다. 특징이 시퀀스 형태로 출력되는 기존의 시계열 기반 표준 트랜스포머[9]는 핵심 정보가 여러 토큰에 분산되어 출력되므로, 단일 회귀 값으로 수렴시키기 까다롭지만 비전 트랜스포머의 클래스 토큰은 모든 입력 패치들과 상호 작용하면서 전역적인 상관관계 정보를 단일 벡터로 응집하는 역할을 수행한다.
IV. 모의실험 및 결과
제안하는 변형된 비전 트랜스포머 기반 도래각 추정 기법의 성능을 가산성 백색 가우시안 채널에서의 모의실험을 통해 확인하였다. 도래각 범위는 –90°부터 90°까지로 설정하였으며, 단일 음원에 대해 스냅샷 수는 1,000개로 하였다. 심층 학습 모델의 최적화 기법으로는 Adam을 사용하였고, 학습률은 0.001, 에폭은 50회로 설정하였다. 손실 함수로는 평균 제곱 오차를 채택하였다. 전체 데이터 셋은 학습용 210,000개, 검증용 60,000개, 테스트용 30,000개로 분할하여 구축되었다. 학습 및 테스트를 위한 신호대잡음비 값은 특정 값에 편향되지 않도록, –20 dB ~ 10 dB 범위에서 균등 분포를 따르는 난수를 생성하여 적용하였다. 적용된 제반 모의실험 파라미터는 Table 1과 같다.
Table 1.
Simulation parameters.
Fig. 3은 신호대잡음비의 변화에 따라 인텐시티 기반 방법, 고전적인 빔형성 및 최소 분산 비왜곡 응답 방법과 같은 기존의 기법들과 함께 제안하는 방법의 도래각 추정에 있어서 평균 제곱근 오차를 비교한 결과이다. 고려된 신호대잡음비 구간에서 제안하는 기법이 낮은 오차를 보였으며, 특히 낮은 신호대잡음비 환경에서 강건한 특성을 나타냄을 확인할 수 있다.
기존의 다른 심층 학습 모델들과의 성능을 비교한 결과를 Fig. 4에 나타내었다. 기존의 공분산 행렬을 사용한 트랜스포머[5] 및 방위각 스펙트로그램을 사용한 기존의 비전 트랜스포머[6] 기법과 비교하였을 때, 제안하는 기법이 낮은 평균 제곱근 오차를 보이는 것을 확인할 수 있다. 예를 들어 신호대잡음비가 –10 dB인 경우 기존의 방법들 대비 제안한 방법은 약 30 % 정도 평균 제곱근 오차가 감소하였다.
신호대잡음비가 –10 dB인 경우 추정된 도래각의 평균 절대 오차(Mean Absolute Error, MAE)와 누적 분포 함수(Cumulative Distribution Function, CDF)를 도출하였다. Fig. 5에 나타낸 결과는 제안한 방법이 기존의 방법들에 비해 정답의 도래각을 추정할 확률이 높음을 보여준다.
기존의 비전 트랜스포머 모델과 제안한 방법의 복잡도 및 연산량을 비교하여 Table 2에 나타내었다. Table 2에서 모델의 연산량을 나타내는 지표인 Floating Point Operations(FLOPs)는 부동소수점 연산 횟수를 의미하며, 단위 M은 백만(Million, 106)을 나타낸다. 기존의 비전 트랜스포머 모델은 약 2.16 M 개의 파라미터와 616.81 M회의 연산량을 갖는다. 제안한 기법은 파라미터 수가 1.65 M 개로 약 24 % 감소했고, 연산량은 194.11 M회로 약 68 % 감소했다. 또한, 제안한 기법 안에서 입력데이터의 전처리를 수행하는 인텐시티 기반 기법[2]은 스칼라 및 벡터 곱셈과 아크탄젠트 연산으로 구성되어 있어서 이들을 포함하여도 방위각 스펙트로그램을 사용하는 기존의 비전 트랜스포머[6]보다 계산량이 적다.
V. 결 론
본 논문에서는 단일 벡터 센서를 사용한 변형된 비전 트랜스포머 기반의 도래각 추정 기법을 제안하였다. 제안한 기법은 공분산 행렬의 신호 부공간 특성과 히스토그램 패치 내의 전역적인 순간 도래각 분포를 동시에 추적하도록 하였다. 모의실험 결과에서 기존의 인텐시티 기반의 기법을 포함하는 전통적인 기법들 및 심층 학습 모델들과 비교하여 제안한 기법은 낮은 평균 제곱근 오차를 보였다. 특히 낮은 신호대잡음비 환경에서의 누적 분포 함수를 분석한 결과, 기존의 기법들 대비 작은 도래각 추정 오차 분포 범위를 보였다. 향후 다수의 벡터 센서들로 구성된 환경에서 연구를 진행할 필요가 있다.








