无线频谱预测看起来和普通时间序列预测很像:拿过去一段数据,预测未来几十个时间点。但真正放进无线通信环境以后,问题复杂得多。频谱数据同时具有时间和频率两个维度,一个频点发生变化时,附近频点或者同一业务频段往往也会一起变化;更麻烦的是,窄带阻塞、宽带脉冲、扫频干扰等异常信号可能突然出现。如果模型把这些高能量干扰误认为正常趋势,就会把错误结构继续“预测”到未来。本文围绕无线频谱预测、电磁干扰、Transformer、频谱感知和人工智能展开,介绍一种名为DS-SpecIT的Decomposed Spectral Inverted Transformer。它不是只追求干净数据上的平均MSE,而是同时考虑整个频谱预测误差和干扰区域的局部误差,并通过趋势—残差分解、频率Token倒置注意力以及正交特征分离,减少干扰向未来预测区间传播。实验显示,该模型在无干扰条件下保持较好的预测精度,同时在完全干扰条件下,相比iTransformer将全局干扰预测误差降低43.4%,局部干扰区域误差降低53.5%。

一、无线频谱为什么需要预测?
无线通信系统使用的电磁频谱是一种有限资源。
移动通信、广播、卫星通信、公共安全网络以及物联网设备,都需要使用不同频段完成信息传输。
问题是:
频谱并不是一直以固定方式被占用。
一个频段现在可能很忙,几分钟以后又可能空闲。
造成这种变化的原因很多:
用户数量变化;
移动终端位置变化;
无线业务开启或结束;
传播环境发生变化;
设备噪声和硬件漂移;
外部无线干扰。
如果能够提前预测未来一段时间的频谱状态,就可以给后续:
频谱感知;
动态频谱接入;
无线资源调度;
干扰规避;
Radio Environment Map构建;
提供参考。
二、什么是PSD频谱预测?
PSD全称:
Power Spectral Density。
简单来说,它表示:
不同频率位置上有多少信号能量。
频谱监测系统会连续记录这些数据。
如果每一次测量都有几百个Frequency Bins,那么连续记录以后就得到一个典型的:
Multivariate Spectral Time Series。
三、为什么它和普通时间序列预测不一样?
普通Time Series经常研究:
一个指标随时间如何变化。
例如:
温度;
电力负荷;
股票价格;
交通流量。
频谱预测不一样。
每一个时间点不是一个数。
而是:
一整组Frequency Bins。
因此模型同时需要理解:
时间关系 + 频率之间的关系。
四、邻近频点为什么会相关?
无线业务通常不是只占一个精确Frequency Point。
它往往占据一个Frequency Band。
因此:
某个Bin功率变化时,旁边几个Bin也可能一起变化。
同一通信Service Band里的Frequency Channels也可能共享相似的Temporal Pattern。
所以:
Cross-frequency Dependency
是频谱预测里不能忽略的信息。
五、真正麻烦的是电磁干扰
假设模型过去一直学习正常GSM Spectrum。
突然输入里出现一个很强的Jammer。
普通预测模型可能会认为:
“这个高能量模式就是新的正常趋势。”
于是未来几十个时间点仍然继续预测这种结构。
但实际上干扰可能只出现了几秒钟。
这就产生:
Interference Propagation。
六、为什么平均MSE可能看不出这个问题?
这是这篇研究非常重要的一点。
假设整个Frequency Axis有128个Channel。
真正被干扰的只有其中10个。
即使这10个Channel错得非常严重:
剩下118个Channel预测还不错。
最后算Global MSE:
可能仍然看起来不算太差。
但如果实际无线系统刚好依赖那10个Channel:
问题就很严重。
七、所以需要同时看Global Error和Local Error
| 指标 | 主要评价什么 |
|---|---|
| MSEglobal | 整个未来时间×频率空间的平均预测误差 |
| MSElocal | 只统计干扰影响区域内的预测误差 |
| Degradation Ratio | 受到干扰后相对于干净条件性能下降多少 |
八、什么是DS-SpecIT?
DS-SpecIT全称:
Decomposed Spectral Inverted Transformer。
它是专门为:
Interference-aware Spectrum Forecasting
设计的一套模型。
核心思路不是单纯把Transformer做得更深。
而是重新考虑:
频谱数据到底应该怎样被Transformer读取。
九、DS-SpecIT主要解决哪几个问题?
| 传统问题 | DS-SpecIT处理方法 |
|---|---|
| 只优化平均预测误差 | 增加Interference Region Local Loss |
| 干扰被误认为正常趋势 | Trend–Residual Decomposition |
| 传统Attention偏重时间Token | Frequency Token Inverted Attention |
| 背景和干扰Feature混合 | Orthogonality Feature Separation |
| 单一时域Feature | Time-domain + Frequency-domain Dual View |
十、为什么要把Frequency Bin当成Token?
普通Transformer可能:
把每个Time Step当成一个Token。
DS-SpecIT采用类似iTransformer的思路:
把每个Frequency Channel当成一个Variable-level Token。
于是Attention直接学习:
Frequency 1和Frequency 2有什么关系。
Frequency 20和Frequency 25是不是同一业务活动。
不同频段之间是否存在相关变化。
十一、原始429个频点为什么缩减到128?
实验数据原始Frequency Dimension:
429 bins。
模型训练之前通过Frequency-axis Pooling降到:
128 Channels。
这样做主要有两个目的:
降低Attention计算量;
平滑部分硬件测量噪声。
同时尽量保留主要:
Spectral Envelope和Macro-level Interference Pattern。
十二、输入和输出时间长度是多少?
实验设置:
Input Length=96。
Forecast Horizon:
48。
最终模型面对的是:
96 × 128
的历史频谱数据。
预测:
48 × 128
的未来Frequency Spectrum。
十三、DS-SpecIT为什么先拆Trend和Residual?
Spectrum Signal通常同时存在:
Slow Background Evolution。
和:
Fast Local Variation。
例如正常无线业务可能缓慢变化。
但Jamming可能突然出现。
如果全部放在同一个Representation里:
模型很容易把两种变化混在一起。
十四、Trend Branch负责什么?
Trend Component主要表示:
较平滑的背景频谱;
长期Spectrum Occupancy趋势;
低频变化。
它由比较轻量的Prediction Head处理。
十五、Residual Branch负责什么?
Residual主要包含:
快速变化;
局部波动;
Transient Interference;
高能量异常结构。
所以它进入更复杂的Encoder。
十六、为什么Residual还要做Time/Frequency双视角?
同一种干扰在:
Time Domain
和:
Frequency-related Representation
里可能表现完全不同。
因此DS-SpecIT同时建立:
Time-domain Embedding;
Frequency-domain Embedding。
十七、Frequency View怎么获得?
模型对Residual Signal沿时间轴做:
RFFT。
也就是Real-valued Fast Fourier Transform。
然后把:
Real Part;
Imaginary Part;
连接起来。
这样能够捕获:
Periodic Pattern;
Oscillation;
部分Interference Signature。
十八、两个View怎么融合?
不是直接平均。
模型学习一个:
Gate。
可以简单理解成:
对于当前Residual Pattern:
Time-domain更重要还是Frequency-domain更重要?
Gate会动态决定两边贡献。
十九、什么叫Inverted Attention?
这里Self-attention不是沿Time Step进行。
而是沿:
Frequency Token Axis。
因此模型直接建模:
Cross-frequency Relation。
这比把每一个Frequency Bin当成互不相关的变量更符合无线频谱结构。
二十、为什么还需要Local Mask?
训练阶段人为注入干扰时:
系统知道:
哪些未来Time–Frequency Points属于干扰区域。
于是可以建立Binary Mask。
Mask=1:
代表这个位置受干扰影响。
Mask=0:
代表不属于干扰Region。
二十一、这个Mask会不会造成测试数据泄漏?
不会。
这是原文专门强调的地方。
Mask只用于:
Training Local Loss;
Offline Evaluation JamMSElocal。
真正Test Time:
模型看不到Mask。
它只能根据Perturbed Spectrum Input自己完成Forecast。
也就是说:
Inference是Blind Forecasting。
二十二、Local Loss到底解决什么问题?
假设大部分频谱区域预测正确。
只有一个很小的Jamming Region严重错误。
Global MSE可能看不出来。
Local Loss则明确告诉模型:
这块小区域也必须认真预测。
二十三、什么叫Dual-scale Objective?
可以理解成:
整体也要准,局部也不能崩。
训练目标同时包含:
Clean Global Loss;
Jammed Global Loss;
Jammed Local Loss;
Orthogonality Regularisation。
二十四、为什么要加入Orthogonality Regularisation?
模型同时观察:
Clean Input。
和:
同一条数据加入干扰后的Perturbed Input。
然后计算:
Clean Representation。
以及:
Interference额外引起的Representation Difference。
目标是让这两个方向:
尽量不要高度相关。
二十五、这个设计直观上意味着什么?
希望模型学会:
“正常Spectrum是什么。”
和:
“Jammer额外带来了什么。”
不要把两件事情编码成同一种Feature。
否则:
干扰就很容易污染正常Forecast Representation。
二十六、研究模拟了哪三类电磁干扰?
| 干扰类型 | 特点 |
|---|---|
| Narrowband Blocking | 固定窄频段持续高能量阻塞 |
| Wideband Pulse | 短时间、高幅值、影响较宽频带 |
| Sweeping Chirp | 干扰中心频率随时间移动 |
二十七、Narrowband Blocking是什么样?
它模拟:
Persistent Narrowband Jammer。
干扰集中在固定Frequency Range。
实验中:
影响大约:
10%的Frequency Channels。
Amplitude Scale:
3.0。
二十八、Wideband Pulse为什么更难?
它不持续。
而是突然出现一串强脉冲。
Amplitude Scale:
8.0。
Pulse Duration:
2–5个Time Steps。
影响:
50%的Frequency Channels。
因此很容易造成模型Baseline突然偏移。
二十九、Sweeping Interference是什么?
这类干扰中心频率会不断移动。
放在Time–Frequency Spectrogram里:
通常表现成:
一条斜线。
实验中Sweep覆盖:
40%的Channels。
三十、为什么扫频干扰对Transformer特别容易造成误导?
因为它本身具有非常清楚的:
Temporal Pattern。
模型很容易认为:
“这个斜线运动是正常信号变化。”
然后继续往未来:
外推整个Sweep Trajectory。
三十一、训练时是不是每条数据都有干扰?
不是。
Training Interference Probability:
0.5。
也就是:
一部分使用Clean Spectrum。
一部分使用Perturbed Spectrum。
这样既学习正常频谱:
又学习Interference Robustness。
三十二、训练过程分成两个阶段
第一阶段:
15 Epoch Clean Pretraining。
主要学习Normal Spectrum Evolution。
第二阶段:
35 Epoch Interference-mixed Fine-tuning。
重点提升Robustness。
三十三、实验使用什么真实数据?
数据来自:
ElectroSense。
这是一个分布式Spectrum Monitoring Platform。
主要训练数据来自:
西班牙Alcorcon。
Sensor Node:
alcorcon1。
三十四、使用的是哪个Frequency Band?
选取:
935 MHz–939 MHz。
也就是GSM Downlink范围的一部分。
这一频段通信活动比较密集。
适合验证:
真实复杂Spectrum Evolution。
三十五、为什么先用真实频谱,再注入Synthetic Jamming?
这样可以把两件事分开。
背景Spectrum:
是真实城市无线环境。
包括:
真实业务活动;
Multipath;
Thermal Noise;
实际测量波动。
干扰:
人工可控。
方便精确比较每个Model在相同Jamming Condition下的表现。
三十六、比较了哪些Baseline?
| 模型 | 代表思路 |
|---|---|
| DLinear | 简单Linear Baseline |
| LSTM | Recurrent Sequence Model |
| TCN | Temporal Convolution |
| PatchTST | Patch-based Transformer |
| iTransformer | Variable-token Inverted Attention |
| TimeMixer | Multi-scale Mixing |
| DS-SpecIT | Interference-aware Spectral Transformer |
三十七、Clean Setting下谁最好?
DS-SpecIT:
Global MSE=0.370±0.006。
iTransformer:
0.372±0.012。
PatchTST:
0.380±0.014。
差距并不是特别大。
但至少说明:
为了提高抗干扰能力,并没有明显牺牲正常预测精度。
三十八、Clean Accuracy最高是不是这篇论文真正的重点?
不是。
0.370和0.372非常接近。
如果只看Clean MSE:
完全看不出模型真正的优势。
真正差距出现在:
Structured Interference。
三十九、完全干扰测试是怎么做的?
Testing阶段设置:
ptest=1.0。
也就是说:
每一条Test Sample都受到干扰。
然后同时测:
JamMSEglobal;
JamMSElocal。
四十、iTransformer受到干扰后表现怎么样?
JamMSEglobal:
0.945±0.032。
JamMSElocal:
1.380±0.045。
这说明一个很重要的问题:
Clean Setting表现很好,并不自动代表Jamming Robustness也很好。
四十一、DS-SpecIT干扰条件下是多少?
JamMSEglobal:
0.535±0.008。
JamMSElocal:
0.642±0.012。
明显低于iTransformer。
四十二、到底降低了多少?
| 指标 | iTransformer | DS-SpecIT | 下降幅度 |
|---|---|---|---|
| JamMSEglobal | 0.945 | 0.535 | 43.4% |
| JamMSElocal | 1.380 | 0.642 | 53.5% |
四十三、为什么Local Error下降53.5%特别重要?
因为频谱干扰本身往往就是:
局部发生。
例如一个Narrowband Jammer:
只影响很小一段Frequency。
如果只看Global MSE:
这个错误可能被大量正常Channel稀释。
JamMSElocal则直接测:
模型在真正干扰区域有没有失效。
四十四、窄带阻塞下普通模型会出现什么问题?
DLinear容易产生:
整体Global Shift。
LSTM可能:
干扰结束后恢复过慢。
iTransformer则可能继续:
把高能量窄带结构传播到Future Horizon。
在Spectrogram上表现成:
Horizontal Leakage。
四十五、DS-SpecIT为什么相对稳定?
因为它把大量异常Energy:
压到Residual Path。
Trend Branch仍然保持比较干净的Background Forecast。
四十六、Wideband Pulse下又会发生什么?
这种短时高能量Broadband Disturbance:
容易让模型产生:
Future Oscillation;
Baseline Lifting;
Energy Smearing。
PatchTST可能出现:
Block-like Reconstruction Artefacts。
TimeMixer可能:
把瞬时Energy向未来扩散。
四十七、Sweeping Chirp是最直观的案例
扫频干扰在Time–Frequency Plane形成:
Diagonal Trajectory。
某些模型会直接把这条斜线:
继续预测到未来。
相当于把Jammer的运动轨迹当成Normal Spectrum Dynamics。
四十八、DS-SpecIT怎样处理Sweeping Interference?
它会尽可能把这种Dynamic Anomaly:
留在Residual Representation。
而不是让它污染主要Trend。
所以预测区域不会出现那么明显的False Diagonal Continuation。
四十九、为什么还要做Ablation Study?
只看完整模型好:
仍然不知道:
到底哪个模块真正有用。
所以研究分别移除:
Local Loss;
Orthogonality Regulariser;
Trend–Residual Decomposition。
五十、去掉Local Loss会发生什么?
CleanMSE甚至从:
0.370
轻微改善到:
0.368。
如果只看Clean Accuracy:
你甚至会觉得模型变好了。
但:
JamMSElocal从:
0.580升到0.950。
Degradation Ratio:
1.32升到1.65。
五十一、这个结果说明什么?
只优化Clean平均误差,很可能让模型看起来更准,却在真正受到干扰的局部区域更加不可靠。
五十二、去掉Orthogonality又会怎样?
CleanMSE:
0.385。
JamMSElocal:
0.680。
Degradation Ratio:
1.45。
说明背景Feature和Interference Feature分离:
确实有助于稳定Representation。
五十三、去掉Trend–Residual Decomposition呢?
CleanMSE增加到:
0.410。
整体表现也变差。
说明:
平滑背景和Abrupt Local Disturbance:
最好不要完全让同一条Representation Path承担。
五十四、为什么还做跨城市Zero-shot测试?
如果只在一个Sensor Node训练和测试:
模型可能只是:
记住这个城市这个频段的统计特征。
所以研究进一步把:
Madrid的alcorcon1训练模型:
直接拿到Barcelona测试。
不重新训练。
五十五、Barcelona使用什么数据?
来自:
bcn-L Sensor Node。
包含:
GSM:
924–929 MHz。
以及LTE:
791–821 MHz。
同时:
城市、时间和Season都和原训练环境不同。
五十六、跨城市以后所有模型都变差了吗?
是。
这是正常的:
Domain Shift。
无线环境换城市以后:
业务流量不同;
频谱利用情况不同;
传播环境不同;
季节和时间分布也不同。
五十七、DS-SpecIT跨节点表现怎样?
Baselines例如:
iTransformer、PatchTST。
JamMSElocal:
超过1.400。
DS-SpecIT:
0.655。
说明它在这个Zero-shot Cross-node Setting下:
仍然保持更好的干扰鲁棒性。
五十八、但不能把这个结果说成“完全泛化”
这只是:
一个Madrid → Barcelona的Generalisation Experiment。
还不能证明:
换任何:
国家;
频段;
硬件;
无线标准;
都一定保持同样优势。
五十九、这篇研究最重要的认识是什么?
不是:
“Transformer比LSTM好。”
而是:
低Point-wise Error并不一定代表真实频谱趋势预测可靠。
模型可能MSE不高。
但仍然出现:
Local Oscillation;
Delayed Recovery;
Interference Leakage;
False Trend Extrapolation。
六十、这对无线AI模型评价意味着什么?
以后评价一个Spectrum Forecasting Model:
不能只放:
MSE;
MAE;
R2。
还应该研究:
Interference Region Error;
Degradation Ratio;
Cross-node Robustness;
Physical Trend Consistency。
六十一、当前研究最大的限制是什么?
最重要的一点:
干扰是Synthetic生成的。
背景频谱是真实城市测量。
但Jammer并不是真实射频设备产生的。
六十二、Synthetic Jamming有什么优点?
方便严格控制:
Amplitude;
Bandwidth;
Duration;
Location;
Interference Probability。
因此适合:
算法比较。
六十三、它又缺少什么?
真实Jamming Device可能存在:
Hardware Drift;
RF Front-end Distortion;
不规则时间变化;
真实Propagation Effect;
Device-specific Artefacts。
数学注入的Pattern不一定能完全模拟这些情况。
六十四、所以未来为什么需要SDR Hardware-in-the-loop?
SDR:
Software-defined Radio。
未来可以在可控条件下:
真正发射物理Interference Signal。
然后让Receiver实际采集。
再验证DS-SpecIT是否仍然Robust。
六十五、未来还可以向Multi-node Spectrum Forecasting发展
现在主要是:
Single-node Spectrum Forecasting。
如果同时有多个城市、多个Receiver:
就会产生:
Spatial + Temporal + Frequency
三重关系。
这会变成真正的:
Spatiotemporal Spectrum Forecasting。
六十六、为什么Conformal Prediction也值得研究?
现在模型主要输出:
Point Forecast。
但实际无线系统更想知道:
“这个预测有多可信?”
未来可以增加:
Prediction Interval;
Uncertainty Estimation;
Conformal Prediction。
用于Risk-aware Deployment。
六十七、未来还可以把Forecasting和Jamming Detection放在一起
现在DS-SpecIT主要负责:
Forecasting。
原模型架构中已经预留:
Jamming Probability Branch。
未来可以联合完成:
预测未来Spectrum;
识别当前是否存在Interference;
定位Affected Region;
辅助Anti-jamming Decision。
六十八、无线频谱预测可以应用在哪些领域?
| 应用 | 频谱预测的价值 |
|---|---|
| 认知无线电 | 提前判断可用频段 |
| 动态频谱接入 | 减少频段冲突 |
| 无线监测 | 发现异常频谱变化 |
| 无线资源管理 | 辅助信道和功率调度 |
| 抗干扰系统 | 避免模型把干扰误认为未来正常信号 |
六十九、人工智能做频谱预测还能研究哪些方向?
Transformer频谱预测;
无线频谱感知;
频谱占用预测;
认知无线电AI;
抗干扰机器学习;
电磁环境智能感知;
长时间序列预测;
多节点频谱预测;
频谱异常检测;
无线通信Transformer;
Conformal Spectrum Forecasting;
联合干扰检测与预测。
七十、做无线通信AI论文最容易出现哪些问题?
| 研究环节 | 常见问题 | 更合理的处理 |
|---|---|---|
| 模型评价 | 只比较Clean MSE | 同时分析干扰条件 |
| Robustness | 只统计整个频谱平均误差 | 增加Local Interference Error |
| Transformer设计 | 单纯增加层数 | 根据频谱结构设计Token |
| 实验数据 | 完全Synthetic Spectrum | 真实背景数据+可控干扰 |
| Generalisation | 只在一个Node测试 | 增加跨城市或跨频段实验 |
七十一、无线通信、人工智能论文辅导可以重点关注什么?
无线通信和人工智能交叉方向,现在常见研究主题包括频谱预测、频谱感知、抗干扰通信、认知无线电、Transformer时间序列以及Edge AI。
真正写论文时,比较容易出现的问题不是代码跑不出来,而是:
模型为什么这样设计没有解释清楚。
例如频谱预测研究中,如果只是把LSTM、Transformer、PatchTST、iTransformer跑一遍,然后按照MSE排序,很容易停留在普通Algorithm Comparison。
更完整的思路应该继续回答:
频率之间的相关性怎么建模;
受到干扰以后模型是否仍然稳定;
局部错误有没有被Global MSE掩盖;
模型为什么会把Jamming传播到未来;
关键模块的Ablation结果如何;
换城市、换节点以后能否继续工作。
对于已经有研究题目、实验数据、模型代码或者论文初稿的项目,辅导过程通常可以围绕研究问题梳理、实验方案、Baseline设计、消融实验、统计结果、模型解释、图表整理和目标期刊方向展开,而不是单纯追求模型结构越来越复杂。
FAQ:无线频谱预测、Transformer和电磁干扰常见问题
Q1:什么是无线频谱预测?
无线频谱预测是利用历史PSD、频谱占用等数据预测未来一段时间各个频率位置上的信号变化,可用于频谱感知、认知无线电和动态频谱接入。
Q2:为什么频谱预测比普通时间序列更复杂?
因为每个时间点包含大量Frequency Bins,既有时间相关性,也有频率通道之间的相关性,同时还容易受到无线噪声、硬件漂移和电磁干扰影响。
Q3:DS-SpecIT是什么?
DS-SpecIT是一种Decomposed Spectral Inverted Transformer,通过趋势残差分解、频率Token倒置注意力、局部干扰损失和正交特征约束提高结构化干扰环境下的频谱预测鲁棒性。
Q4:为什么要把频率Bin作为Transformer Token?
因为邻近频点以及同一业务频段中的Frequency Channels往往存在相关变化,把Frequency Channel作为Token可以直接通过Self-attention学习跨频率关系。
Q5:DS-SpecIT在无干扰数据上的效果怎么样?
Clean Setting中DS-SpecIT的Global MSE为0.370±0.006,略低于iTransformer的0.372±0.012和PatchTST的0.380±0.014,说明增加鲁棒性机制后没有明显牺牲正常预测精度。
Q6:受到电磁干扰后提升有多大?
相比iTransformer,DS-SpecIT把JamMSEglobal从0.945降低到0.535,下降43.4%;JamMSElocal从1.380降低到0.642,下降53.5%。
Q7:为什么Clean MSE低不代表抗干扰能力强?
因为模型可能非常擅长拟合正常数据,却把突然出现的干扰信号当作新的时间趋势继续向未来外推,因此还需要单独测试JamMSE和局部干扰区域误差。
Q8:研究模拟了哪些干扰?
主要包括固定频段的窄带阻塞、短时间高能量宽带脉冲以及中心频率持续移动的扫频Chirp干扰。
Q9:Local Interference Mask在实际预测时需要提供吗?
不需要。Mask用于训练阶段构造Local Loss以及离线计算JamMSElocal,真正Inference时模型只根据受干扰的Spectrum Input进行预测,不知道未来干扰区域。
Q10:为什么要做Orthogonality Regularisation?
目的是减少正常频谱背景Representation和干扰引起的额外Feature之间的相关性,避免高能量干扰污染主要预测表示。
Q11:模型可以跨城市直接使用吗?
研究从Madrid的alcorcon1节点Zero-shot测试到Barcelona的bcn-L节点。所有模型都因Domain Shift而变差,但DS-SpecIT的JamMSElocal仍为0.655,而部分Transformer Baseline超过1.400,说明该模型在这次跨节点实验中更稳定。
Q12:这项研究最大的局限是什么?
主要限制是Jamming Pattern属于人工合成,虽然背景频谱来自真实城市无线测量,但还没有使用真实Jammer和SDR硬件完成Hardware-in-the-loop实验。
Q13:无线频谱预测适合做哪些研究?
可以进一步研究抗干扰Transformer、多节点时空频谱预测、频谱异常检测、Conformal Prediction、无线AI鲁棒性以及联合Jamming Detection和Forecasting等方向。