이 논문은 현재 시계열 구간의 이상 여부를 판별하는 anomaly detection과, 현재 구간을 이용해 다음 미래 구간의 이상 발생 여부를 예측하는 Precursor-of-Anomaly(PoA) detection을 함께 정의함.
제안 모델 PAD는 두 개의 Neural Controlled Differential Equation(NCDE), multi-task learning, knowledge distillation, self-supervised anomaly augmentation을 결합함
일반적인 시계열 이상탐지는 현재 또는 이미 관측된 시계열에서 정상 패턴과 다른 구간을 찾는 문제다. 논문에서는 이를 다음 질문으로 표현함
현재 입력 시계열 구간에 이상 관측치가 포함되어 있는가?
이 논문은 여기에 미래 구간에 관한 문제를 추가함
현재까지 관측된 시계열을 이용해, 다음 미래 구간에 이상 관측치가 포함될지를 예측할 수 있는가?
저자들은 두 번째 문제를 Precursor-of-Anomaly detection, 줄여서 PoA detection이라고 정의한다. 이때 precursor는 미래의 이상 발생과 연결되는 현재의 패턴 또는 징후를 의미함.

Anomaly detection은 현재 구간을 분류하고, PoA detection은 현재 구간을 입력으로 다음 미래 구간의 이상 포함 여부를 예측함.
논문은 길이 인 다변량 시계열을 다음과 같이 정의함
여기서 은 변수의 개수
Regular time series에서는 연속된 관측 시점 사이의 간격이 일정한 반면 irregular time series에서는 관측 간격이 일정하지 않음
전체 시계열은 크기 인 non-overlapping window로 나뉜다.
각 윈도우는 anomaly detection 또는 PoA detection의 입력 단위가 된다.
현재 입력 윈도우를 , 바로 다음 윈도우를 이라고 하면 논문의 두 과제는 다음과 같다.
현재 입력 구간 다음 미래 구간
┌──────────────┐ ┌──────────────┐
│ w_i │ │ w_{i+1} │
└──────────────┘ └──────────────┘
Anomaly detection: w_i가 정상인가, 이상인가?
PoA detection: w_{i+1}에 이상이 포함될 것인가?
PAD의 PoA 출력은 미래 값을 직접 생성하는 forecasting 결과가 아니라, 다음 미래 윈도우의 이상 포함 여부에 대한 binary classification 결과다.
논문은 irregular time series를 처리하기 위해 NCDE를 사용한다.
이산 관측이
로 주어지면, interpolation을 통해 연속시간 경로 를 만든다. 논문은 일반적인 NCDE 설정에서 사용되는 natural cubic spline을 설명한다.
NCDE의 hidden state는 다음과 같이 정의된다.
이를 시간에 대한 적분 형태로 쓰면 다음과 같다.
NCDE는 보간된 입력 경로 에 의해 hidden state가 연속적으로 변화하는 구조다. 논문에서는 이를 RNN의 continuous-time analogue로 설명한다.

불규칙하게 관측된 이산 시계열을 interpolation한 뒤 Neural CDE가 hidden state를 계산하는 구조
Multi-task learning은 여러 과제를 독립적으로 학습하지 않고, 일부 파라미터 또는 표현을 공유하면서 함께 학습하는 방식이다.
논문은 다음 세 가지 parameter sharing 유형을 소개한다.
PAD는 anomaly task와 PoA task가 각자의 파라미터를 가지면서 일부 파라미터를 공유하는 task-specific parameter sharing 구조를 사용한다.
Knowledge distillation은 teacher model의 출력을 student model의 학습 신호로 사용하는 방법이다.
PAD에서는 다음 미래 윈도우를 직접 입력받은 anomaly NCDE가 teacher 역할을 하고, 현재 윈도우만 입력받는 PoA NCDE가 student 역할을 한다.
PAD는 (Precursor of) Anomaly Detection의 약자다. 모델은 anomaly detection용 NCDE와 PoA detection용 NCDE로 구성된다.

PAD 전체 구조. 위쪽 anomaly NCDE, 아래쪽 PoA NCDE, 공유 파라미터 , anomaly branch에서 PoA branch로 전달되는 knowledge distillation 관계가 표시되어 있다.
논문이 제시한 전체 학습 흐름은 다음과 같다.
PAD는 anomaly detection용 hidden state 와 PoA detection용 hidden state 를 각각 계산한다.
각 파라미터의 역할은 다음과 같다.
논문에서 와 는 task-specific network와 shared network의 출력을 합하는 형태로 정의된다.
각 network는 fully connected layer, ReLU, tanh를 사용한다. 두 NCDE는 를 공동으로 갱신하므로 학습 과정에서 함께 변화한다.
Anomaly detection 출력은 다음과 같다.
PoA detection 출력은 다음과 같다.
는 sigmoid이며, 두 출력 모두 binary classification probability다.
구현에서는 두 hidden state를 하나의 augmented state로 구성하고 같은 ODE solver에서 함께 계산한다.
초기 hidden state는 을 fully connected layer에 통과시켜 만든다.
현재 윈도우 의 anomaly label을 라고 하면 anomaly detection loss는 다음과 같다.
학습 과정에서 anomaly NCDE는 다음 윈도우 을 직접 입력받아 anomaly probability 를 생성한다.
PoA NCDE는 현재 윈도우 만 입력받아 다음 구간에 관한 probability 를 생성한다.
Knowledge distillation loss는 다음과 같다.
즉, PoA NCDE는 미래 윈도우를 직접 본 anomaly NCDE의 출력을 모방하도록 학습된다.
논문의 Algorithm 1은 파라미터를 다음과 같이 갱신한다.
학습에는 adjoint sensitivity method가 사용된다. 논문은 두 NCDE를 사용하기 때문에 필요한 메모리를 로 설명한다.
Anomaly detection benchmark는 일반적으로 training set에는 정상 데이터만 제공하고 test set에 anomaly label을 제공한다. PAD는 정상 training sequence에 인공 이상을 삽입해 학습 데이터를 구성한다.
논문에 제시된 augmentation 절차는 다음과 같다.
이 방법은 정상 시계열 내부의 한 구간을 다른 위치로 이동시켜 문맥이 달라진 패턴을 인공 anomaly로 사용한다.
| 데이터셋 | 설명 | 변수 수 | 테스트 이상 비율 |
|---|---|---|---|
| MSL | NASA Mars Science Laboratory 장비 health-check telemetry | 55 | 약 10.72% |
| SWaT | 수처리 공정 testbed의 정상 및 공격 시나리오 데이터 | 51 | 약 11.98% |
| WADI | 물 분배 공정 testbed의 정상 및 공격 시나리오 데이터 | 123 | 약 5.99% |
| 데이터셋 | Epoch | Learning rate | Weight decay | hidden size | 입력 window length | PoA prediction length |
|---|---|---|---|---|---|---|
| MSL | 300 | 256 / 512 / 256 | 30 | 10 | ||
| SWaT | 300 | 128 / 64 / 64 | 60 | 20 | ||
| WADI | 300 | 128 / 128 / 256 | 100 | 30 |
논문은 다음 계열의 모델들과 비교한다.
PoA detection 실험에서는 LSTM, LSTM-VAE, USAD와 비교한다.
평가지표는 Precision, Recall, F1-score다.
Table 1에 보고된 PAD의 결과는 다음과 같다.

관측치 제거 비율에 따른 PAD anomaly F1-score는 다음과 같다.

논문은 NCDE가 보간된 continuous path 를 통해 hidden representation을 계산하기 때문에 irregular setting에서도 성능을 유지한다고 설명한다.
Table 3의 F1-score는 다음과 같다.

PAD PoA의 F1-score는 다음과 같다.

Figure 5는 MSL, SWaT, WADI의 일부 구간을 시각화한다.
논문은 여러 예시에서 빨간색 PoA 구간이 실제 anomaly 구간보다 앞에 나타나는 결과를 제시한다.

논문은 anomaly detection task와 PoA detection task를 함께 학습하는 multi-task setting을 확인하기 위해 두 종류의 ablation model을 구성한다. 표에서는 이를 Type (i), Type (ii)로 표시한다.


논문은 한 task를 제거한 경우 anomaly detection 또는 PoA detection 성능이 감소하는 결과를 multi-task learning의 효과로 설명한다.
입력 길이는 30으로 고정하고 PoA output length를 다음과 같이 변경한다.
비교 모델은 LSTM, LSTM-VAE, USAD이며, Figure 4는 MSL, SWaT, WADI에서 output length에 따른 F1-score 변화를 보여준다.

논문은 PoA detection을 미래 anomaly를 예측하는 과제로 정의하고, anomaly detection과 PoA detection을 하나의 dual-NCDE framework에서 함께 학습한다.
제안 방법을 구성하는 요소는 다음과 같다.
저자들은 향후 연구로 unsupervised precursor-of-anomaly detection을 제시한다. 현재 방법의 time-series augmentation이 별도의 preprocessing 단계를 필요로 하기 때문이다.