Detekcja akustyczna rozpoznaje dźwięk napędu, śmigieł, przekładni i przepływu UAV. Jest pasywna, niezależna od aktywnego łącza radiowego i może działać nocą albo za częściowym przesłonięciem optycznym. Jej ograniczeniem jest krótki i bardzo zależny od środowiska zasięg: wiatr, ruch drogowy, maszyny, deszcz, ptaki i samoloty szybko obniżają SNR.
FAA klasyfikuje acoustic sensors przede wszystkim jako sensory wtórnej walidacji, podczas gdy radar i RF częściej pełnią rolę primary detection [1]. Nie jest to zasada fizyczna dla każdego systemu, lecz rozsądny punkt wyjścia dla lotniska i infrastruktury o wysokim poziomie hałasu.
Spis treści#
- Źródło dźwięku UAV
- Propagacja
- Hałas tła i SNR
- Mikrofon i tor analogowy
- Osłona przeciwwiatrowa
- Widmo i blade-passing frequency
- STFT, log-mel i MFCC
- Detekcja zdarzenia
- Klasyfikacja i dataset
- Array i beamforming
- TDOA i lokalizacja
- Śledzenie źródła
- Rozmieszczenie sieci mikrofonów
- Fuzja z EO/radarem
- Metryki i eksperyment
- Prywatność i retencja audio
- Utrzymanie
- Ograniczenia
- ALIGNMENT
- Powiązane tematy
- Przypisy
Źródło dźwięku UAV#
Multirotor generuje tonalne harmoniczne związane z obrotami i liczbą łopat oraz broadband noise od turbulentnego przepływu. Silnik elektryczny i ESC mogą wnosić tony sterowania, konstrukcja — rezonanse, a payload — wentylator lub gimbal. Fixed-wing z napędem spalinowym ma inne widmo: cykle zapłonu, wydech, śmigło i drgania struktury.
Blade-passing frequency:
f_BPF = RPM / 60 · N_blades
Dla wielu wirników sumują się nieco różne częstotliwości. Regulator zmienia RPM podczas manewru, tworząc time-varying ridges na spectrogramie. Nie wszystkie rotory mają identyczne obciążenie; yaw i wiatr powodują rozszczepienie charakterystyk.
Źródło nie jest idealnym punktem. Każdy rotor ma pozycję i kierunkowość, a airframe przesłania część fal. Aspekt UAV względem mikrofonu wpływa na amplitudę. Wniosek „model X zawsze ma ton Y” jest zbyt mocny bez informacji o śmigle, baterii, payloadzie i stanie lotu.
Acoustic signature może zmienić się po wymianie propeller pitch, liczby łopat, osłon lub firmware ESC. Biblioteka egzemplarzy katalogowych nie reprezentuje wszystkich wariantów.
Propagacja#
W polu dalekim poziom od punktowego źródła spada geometrycznie w przybliżeniu o 6 dB przy podwojeniu odległości. Rzeczywisty model obejmuje absorption atmosferyczną, grunt, wiatr i refrakcję:
L_p(r) ≈ L_p(r0) - 20log10(r/r0) - α(f,T,RH)·(r-r0)
α rośnie z częstotliwością i zależy od temperatury oraz wilgotności. Wyższe harmoniczne, często cenne klasyfikacyjnie, zanikają szybciej niż niskie. Z daleka signature staje się mniej szczegółowa.
Gradient wiatru i temperatury zakrzywia promienie dźwiękowe. Downwind detection bywa lepsze, upwind gorsze. Budynki tworzą odbicia i cienie, a grunt powoduje interferencję bezpośredniej i odbitej fali. Ten sam UAV na tej samej odległości może mieć różny SNR przy innej wysokości.
Deszcz daje broadband noise na osłonie. Liście i maszty poruszane wiatrem także. Dlatego zasięg nie jest stałą sensora, tylko wynikiem scenario.
Hałas tła i SNR#
Sygnał użyteczny konkuruje z:
- ruchem drogowym i kolejowym;
- aircraft/APU;
- HVAC, generatorem i transformatorem;
- budową i maszynami;
- głosem, muzyką i syrenami;
- wiatrem oraz opadem;
- ptakami i owadami;
- własną elektroniką node.
SNR per frequency bin jest ważniejsze niż szerokopasmowy poziom. UAV może mieć harmoniczną widoczną nad tłem mimo niskiego total SNR. Z kolei ton wentylatora może przypominać rotor w jednym paśmie, ale ma stałą pozycję i inny pattern harmoniczny.
Noise profile zmienia się w czasie. Model uczony w cichym terenie może działać źle przy drodze. Adaptive noise estimation pomaga, lecz zbyt szybki algorytm może potraktować wolno zbliżający się UAV jako background.
W systemie należy rejestrować noise floor, wiatr i self-test. Alert bez SNR oraz warunków jest trudny do audytu.
Mikrofon i tor analogowy#
Istotne parametry:
- self-noise i sensitivity;
- max SPL i clipping;
- frequency response;
- directionality;
- phase matching między kanałami;
- temperature/humidity range;
- ADC sample rate, ENOB i clock;
- analog anti-alias filter;
- cable/preamp noise.
„20 Hz–20 kHz” nie opisuje płaskości ani self-noise. Tani MEMS może być wystarczający do detekcji bliskiej, ale array localization wymaga stabilnych różnic czasu/fazy. Kanały powinny być kalibrowane jako system.
Dynamic range musi obsłużyć cichy distant UAV i nagły głośny aircraft. Automatic gain control zmienia amplitudowe cechy i może pompować tło. Jeśli AGC jest używany, jego stan powinien być dostępny w metadata albo pipeline powinien używać odpornych cech.
ADC clocks między odległymi nodes muszą być zsynchronizowane dla TDOA. Drift sample clock przekłada się na narastający błąd czasu i angle.
Osłona przeciwwiatrowa#
Wind noise powstaje przez turbulentne fluktuacje ciśnienia na membranie, często dominujące w niskich częstotliwościach. Foam, furry windshield i geometryczne osłony redukują ten składnik, lecz wpływają na charakterystykę oraz fazę.
Badanie terenowe z 2025 r. pokazało silną zależność wyniku od kierunku, wiatru i zastosowanej osłony; w niektórych scenariuszach windshield wyraźnie zwiększał odległość detekcji, ale efekt nie był jednakowy we wszystkich kierunkach [2]. To ważniejsza lekcja niż pojedyncza liczba metrów.
Osłona outdoor wymaga drenażu, odporności UV i ochrony przed owadami. Woda zmienia tłumienie. Mesh ochronny może generować własny szum w wietrze.
Wynik kalibracji bez osłony nie opisuje kompletnego node. Cały tor trzeba testować w konfiguracji produkcyjnej.
Widmo i blade-passing frequency#
FFT z krótkiego okna pokazuje energy vs frequency. Rozdzielczość Δf = f_s/N rośnie z długością okna, ale pogarsza time resolution. Manewrujący UAV wymaga kompromisu.
Harmonic comb może sugerować BPF. Cepstrum pomaga wykryć okresowość harmoniczną. Autocorrelation i harmonic product spectrum są lekkimi metodami edge.
Pułapki:
- RPM zmienia się i rozmywa peak;
- kilka rotorów tworzy beating;
- aliasing może przesunąć harmoniczne;
- tonalna maszyna naziemna daje podobny comb;
- BPF zależy od blade count i throttle, nie jednoznacznie modelu;
- Doppler translacyjny jest mały, ale mierzalny dla szybkiego fixed-wing.
Feature stability powinno być testowane per flight state: hover, climb, translation, yaw i descent.
STFT, log-mel i MFCC#
STFT tworzy spectrogram:
X(m,k) = Σ x[n] w[n-mH] e^(-j2πkn/N)
Log-mel mapuje energię na filtry zbliżone do percepcji słuchowej i kompresuje dynamic range. MFCC wykonuje DCT log-mel spectrum, tworząc kompaktową reprezentację envelope. W literaturze detekcji UAV stosuje się FFT, log-mel i MFCC; nie ma jednej cechy najlepszej dla wszystkich noise conditions [3].
MFCC zaprojektowano dla mowy. Może odrzucać drobne harmoniczne istotne dla rotorów. Model łączący raw/linear spectrogram z log-mel może lepiej zachować physics.
Normalization per clip może wymazać absolutny poziom i sztucznie poprawić distant examples. Training pipeline powinien odzwierciedlać streaming inference, nie korzystać z przyszłości ani globalnych statystyk test recording.
Data augmentation może dodawać noise, reverb, gain i time/frequency shift, lecz synthetic mix nie zastępuje realnych simultaneous sources.
Detekcja zdarzenia#
Audio event detection daje probability p(drone|window). Potrzebny jest temporal post-processing:
- onset threshold;
- persistence M-of-N;
- hysteresis;
- minimum event duration;
- cooldown/merge;
- unknown/uncertain state.
Model per-frame generuje wiele zależnych próbek. Accuracy frame nie przekłada się wprost na false alerts/hour. Jedno źle sklasyfikowane urządzenie HVAC może produkować tysiące dodatnich okien.
System powinien mierzyć event-based precision/recall, detection latency i false alarms per operating hour. Threshold może być zależny od noise state, ale zmiana musi być logowana.
Primary alert akustyczny w cichym obiekcie może być praktyczny. W głośnym lotnisku lepsze jest secondary validation po cue z radaru/RF, zgodnie z ostrożnym stanowiskiem FAA [1].
Klasyfikacja i dataset#
Dataset musi obejmować nie tylko kilka dronów, lecz twarde negatives:
- lawn mower, leaf blower, generator;
- helicopter i propeller aircraft;
- birds/insects;
- HVAC/fans;
- road traffic;
- construction tools;
- rain/wind;
- overlapping sources.
Najczęstszy błąd to leakage: krótkie fragmenty tego samego ciągłego nagrania trafiają do train i test. Model uczy się recording session, microphone i background zamiast UAV. Podział powinien być wykonywany po całych sesjach, lokalizacjach, dniach, egzemplarzach, a najlepiej także po modelach.
Test cross-site jest krytyczny. Model uczony przy jednym field może rozpoznawać lokalny ambience. Metadata powinny zawierać drone/propeller/battery, flight state, range, bearing, weather, microphone, gains i synchronization.
Confusion matrix per class i unknown rejection są ważniejsze niż ogólna accuracy w niezbalansowanym zbiorze.
Array i beamforming#
Array wykorzystuje różnice czasu/fazy. Dla kierunku jednostkowego u i pozycji mikrofonu r_i oczekiwane opóźnienie:
τ_i = r_i · u / c
Delay-and-sum wyrównuje kanały i sumuje je, zwiększając SNR dla danego kierunku. MVDR tłumi zakłócenia, ale jest wrażliwy na covariance estimate i mismatch. MUSIC wykorzystuje podprzestrzenie sygnału/szumu i założenie liczby źródeł.
Array aperture kontroluje angular resolution. Mały array ma słabe rozróżnienie niskich frequency; duży array może mieć spatial aliasing dla high frequency przy zbyt dużym spacing. Geometria 3D pomaga rozdzielić elevation.
Array nie daje automatycznie range. Jedna stacja szacuje przede wszystkim direction. Near-field curvature może dać range przy odpowiedniej aperturze i SNR, ale w typowej dalekiej detekcji jest niestabilna.
Badania wykorzystują array od kilku do setek mikrofonów, więc deklarowany zasięg jest nierozerwalny z hardware, środowiskiem i metodą. Nie wolno porównywać samych metrów.
TDOA i lokalizacja#
GCC-PHAT szacuje opóźnienie między parami, normalizując magnitude spectrum. Działa dobrze dla broadband source, lecz periodic rotor sound tworzy wiele podobnych peaków. Reverberation dodaje fałszywe opóźnienia.
W array local TDOA daje bearing. Kilka oddalonych nodes może triangulować źródło. Wymagania:
- wspólny timebase;
- znane pozycje i orientations;
- korelacja tego samego source/event;
- model speed of sound;
- synchronizacja latency pipeline;
- odporność na multipath.
Prędkość dźwięku zależy od temperatury, słabiej wilgotności. Dla dużych baseline błąd modelu wprowadza bias. Wiatr powoduje efektywną adwekcję i anisotropy.
Geometry dilution rośnie, gdy bearings są równoległe. Ellipse błędu powinna być przekazywana do fusion, nie pojedynczy punkt.
Śledzenie źródła#
Kolejne DoA mogą być filtrowane przez Kalman/particle filter. State może obejmować angle i angular rate albo pozycję 3D po triangulacji. Association jest trudna przy kilku dronach i machinery.
Track powinien mieć tentative/confirmed/coasting. Gdy źródło chwilowo cichnie albo jest zasłonięte, covariance rośnie. UAV nie znika fizycznie wraz z classifier score.
Acoustic latency zależy od okna STFT i persistence. Cue EO powinien extrapolować bearing na czas slewu. Przy 2-sekundowym oknie fast target może być już poza narrow FOV.
Sound propagation itself dodaje około 3 s/km. Radar/RF docierają praktycznie natychmiast w tej skali. Fusion musi używać emission time estimate, a nie tylko receive timestamp.
To często pomijany błąd: akustyczny bearing opisuje pozycję źródła w przeszłości. Przy 300 m opóźnienie propagacji wynosi blisko 0,9 s plus processing.
Rozmieszczenie sieci mikrofonów#
Node powinien być z dala od wentylatorów, dróg i refleksyjnych ścian, ale mieć zasilanie, sieć i dostęp serwisowy. Wysokość wpływa na ground interference i wind exposure.
Site survey obejmuje soundscape maps w porach dnia, sezonach i weather. Coverage nie jest okręgiem: ma kierunkowe lobes zależne od noise i wiatru.
Distributed network może:
- zwiększyć coverage;
- triangulować;
- odrzucać lokalny false source;
- zapewnić redundancy;
- wymagać time synchronization i bandwidth.
Edge inference ogranicza przesył audio i privacy risk. Central processing ułatwia coherent multichannel algorithms. Hybryda wysyła cechy i krótkie event clips z ring buffer.
Każdy node musi raportować health: microphone failures, clipping, wind, clock quality, CPU load i storage.
Fuzja z EO/radarem#
Acoustic jest dobrym coarse cue:
acoustic DoA + uncertainty + age
↓
fusion / predicted bearing
↓
EO wide FOV acquire → zoom classify
Radar dodaje range i kinematics. RF może potwierdzić emisję. EO daje obraz. Acoustic może utrzymać świadomość za drzewami, ale reflections mogą mylić direction.
Fuzja nie może uznawać kolejnych okien tego samego dźwięku za niezależne dowody. Acoustic track ma silną temporal correlation. Jeśli camera została cue'd przez acoustic, wspólna inicjacja powinna być zapisana.
Korelacja z radar track wymaga compensation sound delay. Bez tego fast target będzie spatially offset i system może stworzyć dwa tracki.
FAA wskazuje acoustic i EO jako typowe sensory supportive [1]. W dobrze zaprojektowanej architekturze supportive nie znaczy zbędny: może znacząco zmniejszyć false alerty radaru.
Metryki i eksperyment#
Ground truth musi zawierać 3D position/time, RPM jeśli możliwe, flight mode, payload, weather i background events. Scenariusze: hover, approach/recede, crossing, behind vegetation, multiple UAV, road traffic, aircraft overflight i wind bins.
Metryki:
- event probability of detection vs range/SNR;
- false alerts/hour/site state;
- onset latency;
- DoA angular error i localization ellipse;
- track continuity;
- class confusion/unknown rejection;
- performance per wind speed/direction;
- cross-site i unseen-model result;
- microphone/node failure degradation;
- compute/power/network load.
Range should be reported as probability contour, not single maximum. Artykuły naukowe podają bardzo różne wartości — od dziesiątek metrów w wind do setek w dużych array — ponieważ setups są nieporównywalne [2][3][4].
Publikacja z systemem acoustic–camera–lidar demonstruje coarse-to-fine fusion, ale jej reported maximum należy traktować jako wynik konkretnej instalacji i datasetu, nie gwarancję każdej kamery/microphone array [4].
Prywatność i retencja audio#
Mikrofony mogą rejestrować mowę i zdarzenia niezwiązane z UAV. To zwiększa ryzyko prywatności bardziej niż przechowywanie samych detekcji radarowych.
Privacy by design:
- edge extraction bez stałego streamingu audio;
- ograniczone pasma, jeśli nie niszczy to funkcji;
- ring buffer nadpisywany bez eventu;
- krótkie event clips tylko dla uzasadnionego incydentu;
- encryption i access control;
- retention schedule;
- audit każdego odsłuchu/exportu;
- informacja i podstawa prawna odpowiednia do miejsca.
Feature vector też może ujawniać background. Nie jest automatycznie anonimowy. Lokalny prawnik i inspektor ochrony danych powinni ocenić konkretną instalację.
Chain of custody wymaga original hash, czasu, konfiguracji preprocessing i zachowania niezmodyfikowanego pliku. Denoised audio nie zastępuje raw evidence.
Utrzymanie#
Outdoor nodes degradują przez wodę, kurz, owady, UV i corrosion. Periodic self-test może używać znanego acoustic calibrator albo wbudowanego speaker, ale test speaker–mic nie zawsze sprawdza windscreen transmission.
Utrzymanie obejmuje:
- visual inspection osłon;
- gain/frequency/phase calibration;
- clock synchronization check;
- noise-floor trending;
- test known-source w kilku directions;
- model/library regression;
- cybersecurity updates;
- vegetation/infrastructure change review.
Mikrofon uszkodzony w array może przesunąć beam bez całkowitej utraty outputu. Health logic musi wykrywać phase/amplitude anomaly.
Po zmianie osłony, uchwytu lub firmware DSP potrzebna jest rewalidacja. Mechanical mounting jest częścią odpowiedzi akustycznej.
Ograniczenia#
Acoustic nie zna intent, zwykle nie daje precyzyjnego range z pojedynczego node i ma zasięg silnie zależny od noise/weather. Cichy fixed-wing/electric glider może być praktycznie niewidoczny. Duży ruch lotniczy może zdominować pasmo.
Klasyfikacja modelu drona na podstawie audio jest krucha wobec śmigieł, payloadu i RPM. Najbezpieczniejsza etykieta to często rotorcraft-like acoustic source, dopiero potem fusion.
System jest atrakcyjny cenowo i pasywny, ale potrzebuje wielu nodes dla dużego perimeter. Maintenance privacy i data bandwidth mogą zniwelować prostotę pojedynczego mikrofonu.
Najlepsze zastosowanie to secondary verification, blind-zone fill i coarse cue w środowisku, którego soundscape został zmierzony.
ALIGNMENT#
ALIGNMENT — świadome ograniczenie zakresu: artykuł nie opisuje akustycznego wyznaczania tras przechwycenia, kierowania efektorem ani budowy zasadzki na operatora. Wszystkie przykłady dotyczą defensywnej detekcji, walidacji sensorów i legalnych lotów testowych z ground truth.
Audio nie służy tu do podsłuchu ludzi. Projekt powinien minimalizować zapis mowy i mieć jawne zasady retencji.
Powiązane tematy#
- Detekcja optyczna UAV
- Radar w Counter-UAS
- Detekcja RF UAV
- Fuzja sensorów Counter-UAS
- Warstwowa architektura Counter-UAS
- Poziomy pewności danych
Przypisy#
- FAA, „Unmanned Aircraft Systems Detection — Technical Considerations”, 2019.
- „Outdoor Microphone Range Tests and Spectral Analysis of UAV Acoustic Signatures for Array Development”, Sensors 2025, CC BY.
- „Drone Detection and Tracking in Real-Time by Fusion of Different Sensing Modalities”, Drones 2022, CC BY.
- „Drone Detection and Tracking System Based on Fused Acoustical and Optical Approaches”, Advanced Intelligent Systems 2023.
Źródła z centralnego rejestru
- FAA: Unmanned Aircraft Systems Detection — Technical Considerations [oficjalny dokument techniczny 2019; radar, RF, EO/IR, acoustic, coverage, interference, data, fusion i pytania zakupowe; nie ustanawia standardu]
- Outdoor Microphone Range Tests and Spectral Analysis of UAV Acoustic Signatures for Array Development [recenzowane badanie terenowe 2025 CC BY; mikrofony, osłony przeciwwiatrowe, aspekt, wiatr i widmo UAV]
- Drone Detection and Tracking in Real-Time by Fusion of Different Sensing Modalities [recenzowany artykuł 2022 CC BY; acoustic features, ograniczenia zasięgu i multimodal fusion]
- Drone Detection and Tracking System Based on Fused Acoustical and Optical Approaches [recenzowany demonstrator 2023 acoustic array–camera–lidar; wyniki dotyczą konkretnej instalacji]