Classified Identification and Nowcast of Hail Weather Based on Radar Products and Random Forest Algorithm

  • Xinwei LIU , 1 ,
  • Yingsha JIANG , 2 ,
  • Wubin HUANG 1 ,
  • Yongjie PAN 2 ,
  • Xia LI 2 ,
  • Runxia GUO 1 ,
  • Yuxia HUANG 1
Expand
  • 1. Lanzhou Central Meteorological Observatory,Lanzhou 730020,Gansu,China
  • 2. Key Laboratory of Land Surface Process and Climate Change in Cold and Arid Regions,Northwest Institute of Eco-Environment and Resources,Chinese Academy of Sciences,Lanzhou 730000,Gansu,China

Received date: 2020-03-09

  Revised date: 2020-08-20

  Online published: 2021-08-28

Highlights

Hail is a kind of strong convective weather with high possibility to cause serious disasters, but it is hard to be early-warned and nowcasted accurately for present meteorological operations.This study pre-warns and now-casts the hail disastrous weather and its accompanying strong convective weathers based on C-band radar products and random forest (RF) algorithm, and gets the following results.In the training set (from 2008 to 2017), the identification of the four types of hail disastrous weather (the hail, hail with strong wind, hail with short-time heavy precipitation, hail with strong wind and short-time heavy precipitation) using the RF model has a mean probability of detection (POD) of 90.2% and a mean false alarm ratio (FAR) of 11.1%.This indicates that the RF model developed in this study is generally ideal.Then the RF model is used in the independent testing set in 2018-2019, which shows that the mean POD and FAR of the model identification for the testing set is 72.8% and 34.7%, respectively.Among the four types of the hail disastrous weather, the hail with strong wind has the highest POD of 83.3%, while the hail with short-time heavy precipitation has the lowest FAR of 12.5%.Thus, the testing set has a lower POD and higher FAR compared to the training set, which is probably because the sample numbers of the testing set is lower.The RF model is then applied in the nowcast of hail disastrous weather in 15~60 min using the storm identification and tracking (SCIT) products.Results show that the RF model has a good performance for the nowcast of hail disastrous weather with a mean POD of 74.8%, mean critical success index (CSI) of 60.8% and mean FAR of 24.4%.Among the four types of the hail disastrous weather, the hail with strong wind has the highest POD and CSI for the forecast in 15~60 min, while the hail with short-time heavy precipitation has the lowest FAR.Furthermore, the POD of RF model is comparable to other hail identification system, but its FAR (<35%)is lower than that of other systems.Therefore, the random forest model can well classify, early-warn and nowcast the hail disastrous weather and its accompanying severe convective weather efficiently and automatically, and is suitable to be applied in the real weather forecast operations.

Cite this article

Xinwei LIU , Yingsha JIANG , Wubin HUANG , Yongjie PAN , Xia LI , Runxia GUO , Yuxia HUANG . Classified Identification and Nowcast of Hail Weather Based on Radar Products and Random Forest Algorithm[J]. Plateau Meteorology, 2021 , 40(4) : 898 -908 . DOI: 10.7522/j.issn.1000-0534.2020.00063

1 引言

强对流天气通常指的是由深厚湿对流产生的包括冰雹、 大风、 龙卷、 强降水等各种灾害性天气(Doswell, 2015), 具有生命史短、 空间尺度小、 致灾性强等特点(张小玲等, 2018)。目前国际上对强对流天气的定义尚没有统一标准, 但中国气象局中央气象台定义的强对流天气指的是出现直径5 mm及以上的冰雹、 任何级别的龙卷、 17 m·s-1及以上的雷暴大风或20 mm·h-1及以上的短时强降水等任意一种或几种天气。在强对流天气中, 冰雹由于其来势猛烈、 破坏性强, 常给工农业和人民的生产生活造成极大危害。当冰雹天气伴随着雷暴大风、 强降水、 急剧降温等其他阵发性灾害性天气过程时, 造成的灾害将更加严重。但是, 由于冰雹灾害性天气出现的范围较小、 时段较短、 突发性较强, 在实际气象业务工作中有一定的预警和预报困难。比如, 唐文苑等(2017)的研究结果指出, 2010 -2015年4 -9月国家级天气落区主观分类预报中, 6~24 h时效逐6 h预报冰雹的TS评分为0.01~0.07, 空报率为90%~98%, 漏报率为84%~96%。目前气象业务系统中广泛使用的短时临近预报系统(Server Weather Automatic Nowcasting, SWAN)对冰雹的预警虽然在采用新冰雹指数后能有90%以上的命中率, 但虚报率也在90%以上(马洪波等, 2016)。
随着多普勒天气雷达布网的不断加密, 多普勒天气雷达在强对流天气的监测分析和短临预警方面起着关键作用, 国内外学者也对多普勒天气雷达在冰雹灾害性天气的预警及预报方面做了大量研究, 并对冰雹天气发生时的雷达回波特征进行了总结分析, 表明冰雹天气发生时, 多个雷达产品, 包括反射率因子强度和垂直液态水含量、 回波顶高等, 均可用于冰雹的识别和预警(王萍等, 2013王莎等, 2019曾智琳等, 2019路亚奇等, 2016刘君等, 2013赵海军等, 2018吴剑坤等, 2019王研峰等, 2019)。目前我国的新一代多普勒天气雷达大部分是S波段和C波段雷达, 其中, S波段雷达产品由于其回波衰减较弱被广泛地采用(刘雨佳等, 2014), 而基于C波段雷达产品的工作仍比较少, 但我国西部地区主要采用的是C波段雷达(王红艳, 2015)。除回波衰减问题外, 有研究表明S波段和C波段雷达的一致性较好(刘雨佳等, 2014), 也有部分研究利用C波段雷达产品改善了降水的预报性能(李平等, 2013王坚红等, 2019)。因此, 对于我国西北部这样复杂地形、 易发生山洪泥石流等地质灾害的区域, 研究C波段雷达对强对流天气的预警和预报作用十分重要。
虽然天气雷达产品可以有效地识别冰雹, 但目前主要依赖于人工识别雷达图像的预报方法效率较低且需要较为丰富的预报经验, 而气象业务工作中短时临近预报的时间紧、 任务急, 需要对强对流天气进行方便、 快捷的系统化监测和自动化预警(郑永光等, 2013)。因此, 将国际先进的大数据和机器学习方法应用于强对流天气的短临预报, 是目前具有突破性的强对流天气预报的研究热点之一(张小玲等, 2018)。Mecikalski et al (2015)使用Logistic回归和人工智能随机森林等方法发展了基于卫星资料和数值模式资料的对流初生(CI)临近概率预报技术。在国内, 李国翠等(2014)张秉祥等(2014)基于雷达三维组网数据利用模糊逻辑方法分别开发了雷暴大风和冰雹的自动识别算法。周康辉等(2017)将模糊逻辑算法用于雷暴大风的监测识别, 实现了雷暴大风和非雷暴大风的有效区分。修媛媛等(2016)用机器学习中有监督学习模型支持向量机来进行强对流天气的识别和预报。
机器学习中的随机森林(Random Forest, RF)算法是数据挖掘、 生物信息学、 分类识别等领域的研究热点之一(方匡南, 2011)。强对流天气作为一种极端天气事件, 也可以作为不平衡数据的分类问题, 用随机森林算法来处理(修媛媛等, 2016)。李文娟等(2018)基于数值预报和随机森林算法对强对流天气进行了分类预报, 并指出随机森林模型对强对流天气预报准确率高, 可用于日常业务。国内外学者将随机森林算法与传统的神经网络、 SVM、 Logistic等机器学习方法做了一些对比, 黄衍等(2012)证明随机森林泛化能力在多分类问题上优于SVM。梁慧玲等(2016)在基于气象因子的塔河地区林火发生预测模型研究中, 得出随机森林模型预测准确率高于传统Logistic模型。张雷等(2014)白琳等(2017)研究证明随机森林算法比传统的多元线性回归的结果更为理想, 处理非线性和分级关系更具优势, 相比神经网络、 支持向量机等其他暗箱方法在分析变量关系上也存在优势, 且目前的常用算法中随机森林的精度比较高。
因此, 本文基于C波段雷达回波资料, 建立了随机森林模型, 检验了该模型对冰雹灾害性天气及其伴随强对流天气的分类判识(预警)和预报性能。在目前全球极端天气和气象灾害频发的情况下, 研究机器学习和人工智能在强对流灾害性天气临近预报中的应用, 提高强对流天气, 尤其是致灾性较强的冰雹天气的临近预报水平, 对中西部的防灾减灾工作具有十分重要的意义。

2 随机森林算法及模型构建

随机森林是一种统计学习理论, 它是利用bootsrap重抽样方法从原始样本中抽取多个样本, 对每个样本进行决策树建模, 然后综合考虑各个决策树的结果, 即通过投票, 以少数服从多数的原则取得模型预测的最终结果(方匡南等, 2011唐亘等, 2018)。随机森林具有较高的预测准确率以及对异常值和噪声有较好的容忍度, 且不容易出现过拟合, 因此与传统的支持向量机、 决策树等的方法相比, 随机森林算法具有犯错小、 准确率高、 适应性强等特点。此外, 随机森林对高维数据分类问题也具有良好的可扩展性和并行性, 所以被广泛地应用在生物信息、 医学研究、 商业管理、 金融等各个领域(董师师等, 2013)。
根据随机森林算法理论(图1), 构建了随机森林模型如图2所示。随机森林前期需要大量训练以得到较为可靠的分类树, 因此需要先生成训练集, 经过训练后得到随机森林模型, 然后再将模型应用在测试集中检验其分类精度, 最后, 该研究还将模型应用在风暴单体识别与跟踪(SCIT)中。随机森林模型中的自变量, 即特征值是C波段雷达产品, 而因变量是2008 -2019年的强对流天气观测数据。随机森林的两个重要参数分别为决策树的棵数n, 以及每棵树的输入变量k。其中, n越大, 随机森林算法的过拟合效应越小, k越大, 子预报模型间的差异性越小。一般情况下k的取值为1, m/2, m 2 l o g 2   m + 1等, 其中m为原始数据集中实际特征数。本文采用k= l o g 2 m + 1, 当m=15(即15个自变量)时, k取值为5。分类棵树n的取值在100~300时是比较理想的分类, 而本文n取值为130(李毓等, 2011Bernard et al, 2007Geurts et al, 2006)。
图1 随机森林算法示意图

Fig.1 Schematic map of the random forest algorithm

图2 随机森林模型流程图

Fig.2 Flow map of the random forest model

3 资料来源

3.1 雷达产品及其指标简介

大量研究表明, 发生冰雹灾害性天气时, 反射率因子、 回波强度、 顶高、 垂直液态水含量等雷达产品均可提供定量化判据(路亚奇等, 2016赵海军等, 2018王研峰等, 2019), 且冰雹、 暴雨和雷暴大风的强对流天气的雷达回波特征有显著的差异(王令等, 2004), 本文在雷达产品的特征分析中也有同样的结论。因此, 可利用雷达产品对冰雹以及其他的强对流天气进行分类识别, 作为随机森林模型的自变量。
本文中所使用的雷达产品为甘肃省天水市的C波段雷达回波产品, 并对反射率因子(R)和组合反射率(CR)进行了质量控制, 主要是通过隶属函数, 滤除了地物杂波(李丰等, 2014)。由于C波段雷达有效扫描半径为150 km, 但小于30 km不能够完全扫描风暴体中上部, 而大于120 km则不能完全扫描风暴体中下部, 因此, C波段雷达探测风暴的最佳距离为30~120 km, 也是本文所采用的雷达扫描范围[图3, 该图是基于国家测绘地理信息局标准地图服务网站下载的审图号为GS(2019)1824的中国地图制作, 底图无修改]。本文用于鉴别强对流天气的雷达产品共15个, 全部采用极坐标, 下面分别进行介绍:
图3 天水雷达扫描范围示意图

十字为天水雷达位置, 黑色圆圈从里向外分别表示30, 120和150 km半径的范围

Fig.3 The scanned area of Tianshui Rada.The cross is the location of Tianshui Radar, and the circles from small to large are the area in 30 km, 120 km and 150 km radius, respectively

反射率因子(R)、 组合反射率(CR)和平均径向速度(V)均是采用降水模式的雷达产品, 空间分辨率为1 km×1°(极坐标)。其中, 反射率因子(R)和平均径向速度(V)共采用了0.5°, 1.5°和2.4°三个仰角的数据(即0.5°R、 1.5°R、 2.4°R、 0.5°V、 1.5°V、 2.4°V), 因此分别有3套产品。在产品特征数据提取中, 以强对流天气实况观测点最近的像素为中心, 提取周围5×5个像素范围内的最大值, 作为强对流天气的风暴体特征值, 具体计算公式为:
Value n=max(Value n i, j
式中: n为风暴单体编号; ij的取值从-2~2。
类似的提取方法还用在了回波顶高(ET)提取中。ET是指反射率因子≥18.3 dBZ的回波所在的高度, 采用的是周围5×5个像素点范围内的平均值。文中还用到了雷达的其他产品, 包括风暴顶高(TOP)、 最强回波对应的高度(HT)及垂直累积液态水含量(VIL)。TOP为风暴体≥30 dBZ所在的最大高度, 反映风暴体的强回波顶的高度。HT是雷达根据各仰角最强回波垂直差分计算后的强回波高度, 比单一分仰角寻找的最大反射率高度更为准确可信。
此外, 还用到了垂直累积液态水含量密度(VILD)、 核心区厚度(H)和45 dBZ以上质心高度(H_45)及强回波(≥45 dBZ)持续时间(Time), 它们均为计算量。VILDVILTOP之比, H为风暴体回波≥45 dBZ的上边界与下边界高度之差。
在业务应用过程中, 还需要对识别的分类强对流进行追踪和预报, 雷达的风暴单体识别和跟踪产品(SCIT)是目前最具有代表性的强对流识别算法之一, 能够正确跟踪识别70%~90%的风暴单体(俞小鼎, 2011), 所以使用该产品用于强对流天气移动位置的预报。本文中SCIT产品的预报持续时间为预报间隔时间15 min与预报间隔数(1~4个)的乘积, 即预报时间为15~60 min。

3.2 强对流天气资料

收集整理了天水雷达扫描范围内2008 -2019年强对流天气资料, 并将搜集到的冰雹灾害性天气分为冰雹(指以冰雹为主的天气)、 冰雹伴随大风、 冰雹伴随短强和冰雹伴随大风短强四种类型。其中, 冰雹指直径≥5 mm的冰雹且没有伴随大风和强降水, 大风为瞬时风速,达17.2 m·s-1以上, 短时强降水(下文统称短强)为小时雨量超过20 mm。本文所采用的强对流天气实况观测数据来源于地面加密观测站, 其中冰雹是各台站直接上报的记录, 短强和大风是兰州中心气象台的监测数据, 并与相应台站进行了电话核实。强对流天气样本是根据地面观测到的强对流天气的经纬度信息, 所提取的相应时段内的NN≥1)个雷达体扫数据。比如某站点在14:28(北京时, 下同) -14:58出现了以冰雹天气为主的强对流, 此时雷达体扫时间为14:26开始的逐6 min体扫, 则提取该30 min内完整的5个(14:32, 14:38, 14:44, 14:50和14:56)雷达体扫数据作为1个冰雹天气样本。对于无强对流天气, 其样本是选取地面观测站点未观测到强对流天气的时段中, 随机抽取雷达体扫的结果, 其中包含了无回波、 弱回波及强回波等多种情况。由于随机森林模型需要一个较大的训练集, 所以将2008 -2017年作为模型的训练期, 共287个冰雹灾害性天气样本, 然后将2018 -2019年作为模型的验证期, 共62个冰雹灾害性天气的独立测试样本。训练期和验证期样本集中四种冰雹天气的分布情况见表1
表1 随机森林模型的训练集(2008 -2017年)和测试集(2018 -2019年)中各类冰雹灾害性天气的发生次数

Table 1 The occurrence frequencies of four types of hail disaster weather in the training set 2008 -2017 and the testing set 2018 -2019 used in the random forest model respectively

样本 冰雹灾害性天气的发生次数/次
冰雹 冰雹大风 冰雹短强 冰雹大风短强 无强对流
训练样本集 52 45 16 24 150
测试样本集 9 6 10 5 32

3.3 模型检验指标

在气象领域, 命中率(POD)、 临界成功指数(CSI)、 空报比率(FAR)常被用于判别强对流天气的识别和预报效果(路志英等, 2018), 其定义分别为:
P O D = × 100 %
C S I = + × 100 %
F A R = + × 100 %
本文主要采用了PODFAR 评分来评价随机森林模型对强对流天气的分类识别和预报效果, CSI也有采用。POD的判别标准是观测到的冰雹天气持续时长内所有时次雷达产品的模型预报结果与观测实况的点对点对比验证, 命中标准的空间范围为5°×5 km(雷达提取半径, 极坐标)。例如, 对于训练集和测试集, 某日某地10:00 -10:30发生冰雹天气, 则利用随机森林模型识别该时段内所有时次、 该站点5°×5 km内的雷达产品, 给出判识结果, 正确识别及分类则为命中。因此, 判定随机森林模型对训练集和测试集中的样本是否命中, 是与样本的发生时间同步的, 便于应用于业务工作的预警系统, 而判断模型是否准确预测冰雹天气, 则提前15~60 min, 判识了该时段内所有的雷达产品。因此, 对于模型的预测结果, 命中时效最长为60 min。CSIFAR检测标准与POD类似。

4 结果分析

4.1 雷达产品的特征分析

在构建随机森林模型之前, 首先对强对流天气发生时各雷达产品的特征值进行了分析, 以证明采用的雷达产品可以判别不同类型的强对流天气, 确保研究的可行性。根据以往的研究以及多年的预报经验, 选取了8个对于强对流天气预报较为重要的雷达产品, 并人工统计分析了130个强对流天气样本发生时, 这些雷达产品的特征值, 得到了它们在不同冰雹天气时的概率密度分布(图4)。从图4可知, 不同产品的概率密度分布在有无强对流天气时存在显著的差异。在无强对流天气时, CRVILDHETHT等的分布特征与发生冰雹灾害性天气时的特征有显著的差异, 峰值处于不同的阈值区间。CR无强对流时一般在38~50 dBZ, 发生强对流天气时一般>50 dBZ, 而发生冰雹短强天气时, 在60~65 dBZ。在无强对流时, H一般在2 km以下, 发生冰雹以及冰雹大风时H主要分布在5 km左右, 而发生冰雹短强时H主要分布在6 km左右。ET在无强对流时在9 km左右, 而发生强对流时峰值在11 km左右。发生四类冰雹天气时的VILD峰值在2~5 g·m-3, 且彼此间有1~2 g·m-3的差异。除此之外, 冰雹短强的H峰值、 冰雹大风的H_45峰值以及冰雹的TOP峰值也与其他冰雹天气类型有显著差异。因此, 各个因子的综合应用为无强对流天气以及四类冰雹天气的区分提供了可靠的判别依据, 为随机森林模型的构建提供了基础。
图4 随机森林模型中雷达产品8个主要自变量CR (a)、 H (b)、 ET (c)、 VILD (d)、 VIL (e)、 TOP (f)、 HT (g)、 H_45 (h)在无强对流天气、 冰雹、 冰雹大风、 冰雹短强以及冰雹大风短强概率密度分布

Fig.4 The probability density distribution of 8 main independent variables of the random forest model for the no convective weather, the hail weather, hail with strong wind, hail with short-time strong precipitation, and hail with strong and short-time strong precipitation, the radar products of CR (a), VIL (b), ET (c), HT (d), H (e), TOP (f), VILD (g) and H_45 (h)

随机森林算法能够根据不同类型强对流天气的雷达产品特征对样本进行分类, 并根据重要程度分配自变量在计算中的权重。因此能够得到各自变量对分类结果的重要程度, 称为自变量的重要度。利用随机森林模型对自变量, 即各雷达产品的重要度得分进行排序, 值越大表示越重要。从随机森林模型自变量(15个雷达产品)重要性排名(图5)可以看出, CR、 1.5°R、 0.5°RVILDHVILETH_45、 TOPHT等的特征值得分均较高, 表示这些量对不同的强对流天气有较明显的差异, 易于模型通过这些差异来进行分类。其中, CRVILDHVILET较适用于识别强对流天气的结论, 与图4中人工统计分析所得的结果是一致的。随机森林模型的研究结果还指出了1.5°R和0.5°R产品的重要性, 值得预报工作的关注。同时, 应用随机森林模型的结果进行统计大大提高了工作效率, 比以往的人工统计更加高效、 客观, 具有显著的优势。此外, 随机森林模型自变量因子的选择对模型的判识结果有一定的影响, 其影响程度取决于该因子的重要性。根据前期在筛选模型的自变量因子时所做的测试, 增加或减少某一自变量得到的随机森林模型的判识结果均差于目前的判识水平。
图5 随机森林模型自变量(15个雷达产品)重要性排名

Fig.5 The importance ranking of the independent variables (15 radar products) of the random forest model

4.2 随机森林模型在训练期的判识结果

以2008-2017年训练期的四类冰雹灾害性天气样本为训练集, 构建了随机森林模型, 并以PODFARCSI的评分来表征模型的分类判识准确性(表2表3)。由表2表3可知, 随机森林模型训练集的POD较高, 平均为90.2%。其CSI也较高, 为81.9%, 同时, FAR较低, 平均为11.1%。其中, 模型对无强对流天气的判识最准确, 在150个样本中均没有出现误判。四类冰雹天气中, 冰雹大风和冰雹的POD较高, 在93%左右。但模型也较易混淆这两类天气, 冰雹天气主要误判为冰雹大风和冰雹大风短强, 而冰雹大风主要误判为冰雹天气。其次, 冰雹短强和冰雹大风短强的POD相当, 均为87.5%, 但冰雹大风短强的FAR高于冰雹短强, 达到19.1%, 主要是将其他三类冰雹天气空报为冰雹大风短强。相比于单棵树在79%左右的POD, 随机森林模型的POD较高, 判别效果比较理想。与应用新冰雹指数的SWAN系统的判识结果相比, 随机森林模型对四类冰雹天气的平均POD在90.2%左右, 与SWAN新冰雹指数相当, 但随机森林模型的FAR在9%左右, 显著优于SWAN高于90%的虚报率(马洪波等, 2016)。
表2 随机模型训练期(2008 -2017年)的分类识别结果

Table 2 The identification results of the random forest model for the training set during 2008 -2017

实况观测 随机森林模型结果
冰雹 冰雹大风 冰雹短强 冰雹大风短强 无强对流
冰雹 48 2 0 2 0
冰雹大风 2 42 0 1 0
冰雹短强 1 0 14 1 0
冰雹大风短强 0 1 2 21 0
无强对流 0 0 0 0 150
表3 随机模型训练期(2008 -2017年)的分类识别结果评分

Table 3 The POD FAR and CSI scores for the classified identification of random forest model in the training set from 2008 to 2017

天气类型 POD FAR CSI
冰雹 92.3% 5.9% 87.3%
冰雹大风 93.3% 6.7% 87.5%
冰雹短强 87.5% 12.5% 77.8%
冰雹大风短强 87.5% 19.1% 75.0%
平均值 90.2% 11.1% 81.9%

4.3 随机森林模型的独立样本测试

将训练集构建的随机森林模型应用到2018 -2019年测试集的62次冰雹天气的观测数据中, 对模型进行了验证(表4表5)。四类冰雹天气中, 冰雹大风的POD最高, 为83.3%, 冰雹大风的6次过程有1次误判为冰雹天气。其次, POD较高的是冰雹天气, 为77.8%, 冰雹天气7次过程有1次误判为冰雹大风, 1次漏报为无强对流。冰雹短强和冰雹大风短强的POD较低, 冰雹短强的10次过程误判了3次, 而冰雹大风短强的5次过程有2次误判。从FAR来看, 除冰雹短强的FAR较低外, 其他三类冰雹强对流天气的FAR都在40%左右, 其中有3次将无强对流天气空报为冰雹, 2次空报为冰雹大风。此外, 模型在测试集的CSI也不高, 在50%~60%。整体来说, 随机森林模型在测试期的平均PODCSI较训练期有降低, 分别为72.8%和51.6%, FAR也更高。这可能是由于测试期的总样本量比训练期的偏少造成的。以冰雹大风为例, 测试集中一共只有6次样本, 如果误判一次, 则POD减少16.7%, 而假设样本次数达到20次, 同样出现一次误判, POD仅降低5%。与应用新冰雹指数的SWAN的判识结果相比, 随机森林模型在测试集中对四类冰雹天气的FAR在40%以内, 仍然显著优于SWAN系统90%以上的虚报率(马洪波等, 2016)。
表4 随机森林模型测试集(2018 -2019年)的判识结果

Table 4 The identification results of the random forest model for the testing set from 2018 to 2019

实况观测 随机森林模型判识结果
冰雹 冰雹大风 冰雹短强 冰雹大风短强 无强对流
冰雹 7 1 0 0 1
冰雹大风 1 5 0 0 0
冰雹短强 1 0 7 2 0
冰雹大风短强 0 1 1 3 0
无强对流 3 2 0 0 27
表5 随机森林模型测试集(2018 -2019年)的判识结果评分

Table 5 The POD FAR and CSI scores for the classified identification of random forest model in the testing set from 2018 to 2019

天气类型 POD FAR CSI
冰雹 77.8% 41.7% 50.0%
冰雹大风 83.3% 44.4% 50.0%
冰雹短强 70.0% 12.5% 63.6%
冰雹大风短强 60.0% 40.0% 42.9%
平均值 72.8% 34.7% 51.6%
总体来说, 基于随机森林算法的强对流天气分类模型对冰雹天气的识别较为理想, 也具备识别冰雹天气的伴随强对流天气的能力。目前, 气象业务工作中主要依赖人工识别雷达图像来判识并预警冰雹天气, 且没有根据冰雹的伴随强对流天气进行分类, 因此, 该方法在未来的自动化强对流天气预警中有较为广阔的应用前景。
此外, 文章分析了2018年两次以冰雹灾害性天气为主的强对流过程以及随机森林模型的分类识别结果, 来检验其预警效果。从天气实况来看, 6月6日17:00开始在宕昌县、 礼县等地有对流开始发展, 在18:00 -19:00在宕昌西部地区出现冰雹短强天气, 在礼县北部出现以冰雹为主的天气[图6(a)]。从该时段的预警结果, 即随机森林模型对雷达产品的判识结果来看[图6(b)], 模型除了对对流初生时段的短时强降水没有识别外[图6(a)], 对对流发展旺盛阶段所产生的冰雹短强等天气有很好的预警, 正确识别了CR高值区的冰雹天气和短时强降水[图6(b)]。同时, 随机森林模型也正确判别了礼县地区的冰雹。第二个个例中, 不同的风暴体在各地区均有不同的强对流天气发生, 6月10日在会宁出现以冰雹为主的天气, 通渭出现冰雹、 冰雹短强和冰雹大风短强天气, 静宁、 甘谷出现冰雹大风短强天气, 秦安出现以冰雹为主的天气。而从对应时刻(18:00 -19:00)随机森林模型根据雷达产品的预警效果来看[图6(d)], 此次过程中, 除对静宁和秦安地区空报了两个冰雹外[图6(d)], 其余地区的强对流天气不论是落区还是强对流的分类上, 均完全识别正确。综合来看, 随机森林模型能较好地利用雷达产品实现对强对流天气的预警, 不足之处是对弱风暴区有一定的漏报, 对强风暴区有一定的空报。
图6 2018年6月6日(a, b)和10日(c, d)强对流天气实况和随机森林模型的分类识别结果

三角形、 圆点、 星形分别代表短时强降水、 冰雹和大风; 色斑为时段内的雷达产品CR的值

Fig.6 Example of severe convective weather for observations and the classified results of random forest model on 6 (a, b) and 10 (c, d) June 2018.Triangle, round point and square mean the occurrence of short-time strong precipitation, hail and strong wind, respectively; Colorful shadow is the radar product of CR

4.4 随机森林模型的预报效果评估

在随机森林模型能较好地识别冰雹及其伴随强对流天气的基础上, 利用SCIT产品对产生强对流的风暴体进行追踪预报, 将风暴体追踪预报结果应用到随机森林模型识别结果中, 对未来一段时间发生的强对流天气类型及位置进行预报, 预报时效为15~60 min。共选取了测试期中30个各类强对流天气样本进行预报试验, 并对样本中所有时次的预报结果与实况进行对比检验。此外, 虽然SCIT产品只能预报风暴质心的移动位置, 但考虑到雷达提取半径以及模型判定命中的范围均为5°×5 km(极坐标), 实际评估的是模型对可能发生在5°×5 km范围的所有强对流天气的预报效果。
由预报效果评分可知(表6), 基于随机森林模型和SCIT产品能较好地预报未来15~60 min的冰雹灾害性天气。在四类冰雹天气分类预报中, POD最高的为冰雹大风, 达84.3%, 其次是冰雹, 为78.8%。CSI最高的也为冰雹大风(65.0%), 冰雹短强次之。但是, FAR最小的为冰雹短强, 为12.5%, 而冰雹大风次之。综合来看, 对四类强对流天气的平均POD为74.8%, 平均CSI为60.8%, 平均FAR为24.4%。虽然随机森林对冰雹灾害性天气的预报效果没有其分类识别的准确性高, 仍能够满足实际的气象预报工作中对强对流天气临近预报的分类预报需求, 且具有高效、 自动化等优点。
表6 随机森林模型的预报效果评分

Table 6 The prediction scores of random forest model

天气类型 POD FAR CSI
冰雹 78.8% 30.7% 61.6%
冰雹大风 84.3% 24.4% 65.0%
冰雹短强 70.8% 12.5% 63.6%
冰雹大风短强 65.3% 30.0% 52.8%
平均值 74.8% 24.4% 60.8%
为进一步说明随机森林模型和SCIT产品对强对流天气的预报功能, 图7列举了2019年两次强对流过程个例。从实况观测上看, 4月15日11:00, 在天水雷达北部地区有分散对流发展, 12:00 -14:00在秦安、 张家川、 庄浪及华亭等地出现冰雹天气[图7(a)]。从12:00开始, 利用SCIT产品和随机森林模型结果对未来15~60 min的强对流天气进行了预报。从12:00 -14:00的预报结果[图7(b)]来看, 随机森林模型对秦安的冰雹有漏报[图7(a)], 对秦州区有空报[图7(b)], 其余三个地方的冰雹则预报正确。6月12日17:00 -19:00, 在华亭中西部地区出现冰雹短强和冰雹短强大风等强对流天气, 陇县出现冰雹天气[图7(c)], 从该时段的预报效果来看, 除对清水地区空报了冰雹外[图7(d)], 其余地方的强对流天气不论是类型还是落区均预报准确。
图7 2019年4月15日(a, b)和6月12日(c, d)强对流天气实况和随机森林模型预报结果对比

三角形、 圆点和星形分别代表短时强降水、 冰雹和大风; 色斑为时段内的CR

Fig.7 Example of severe convective weather for observations and the forecasting results of random forest model on 15 April (a, b) and 12 June (c, d) 2019.Triangle, round point and square mean the occurrence of short-time strong precipitation, hail and strong wind, respectively, and colorful shadow is the radar product of CR

5 结论与讨论

基于C波段雷达回波产品以及随机森林算法, 对冰雹灾害性天气及其伴随强对流天气进行了分类预警以及预报。得到了以下主要结论:
(1) 利用2008 -2017年的强对流天气站点观测资料以及对应的C波段雷达产品为样本组成训练集, 构建并训练了随机森林模型。结果表明模型对四类冰雹天气(冰雹、 冰雹大风、 冰雹短强、 冰雹大风短强)的平均POD为90.2%, 平均FAR为11.1%。其中, 冰雹和冰雹大风的POD较高(93%左右), FAR也较低(6%左右)。因此, 随机森林的分类模型效果比较理想, 能够正确分类识别四类冰雹天气。
(2) 将随机森林模型应用于2018-2019年的独立样本测试集, 检验其分类判识能力。结果表明, 随机森林模型对四类冰雹天气的平均POD为72.8%, 平均FAR为34.7%。其中, 冰雹大风的POD最高, 为83.3%, 其次为冰雹天气(77.8%)。而冰雹短强的FAR最低, 为12.5%。总体来说, 测试期的平均POD较训练期有降低, FAR有增加, 这可能是由于测试期的总样本量比训练期的偏少。
(3) 利用随机森林模型和SCIT产品能较好地分类预报未来15~60 min的冰雹灾害性天气。模型对四类冰雹天气的平均POD为74.8%, 平均CSI为60.8%, 平均FAR为24.4%。其中, PODCSI最高的为冰雹大风, 分别为84.3%和65.0%, FAR最小的为冰雹短强, 为12.5%。
本文利用随机森林算法和C波段雷达产品, 实现了对冰雹强对流天气的高效、 自动化地分类预警和预报, 并取得了较高的准确率。其训练集90.2%的POD与应用新冰雹指数的SWAN系统90%的POD马洪波等, 2016)相当。此外, 虽然模型独立测试和预报结果的POD略低, 但其FAR(平均FAR<35%)仍显著低于SWAN系统超过90%的虚报率。因此, 本文基于C波段雷达产品构建的随机森林模型在强对流天气的预警及预报业务工作中有较为广阔的应用前景。
本文应用的随机森林算法虽然比气象领域以往常用的神经网络、 多元线性回归等方法更先进, 比SVM、 Logistic等机器学习方法也更有优势, 但其需要以大量的观测以及雷达资料为基础进行前期训练, 这也是随机森林模型表现优劣的关键。因此, 本文采用了地面加密站点长时间段的大量观测数据以及相应的雷达产品, 从而对冰雹、 冰雹短强等强对流天气取得了较好的分类预警及预报效果, 这是本文的主要难点。但是, 现有的模型仍有一定的不足, 比如强对流天气样本量仍比较有限、 雷达产品的质量控制不足等。在未来工作中, 可以通过增加样本量、 提升雷达产品的质量等, 进一步改善模型性能, 提高其预警和预报能力。
Doswell C A2015.Severe convective storms in the European societal context[J].Atmospheric Research158/159: 210-215.DOI: 10.1016/j.atmosres.2014.08.007.

Bernard S Heutte L Adam S al et2007.Using random forests for handwritten digit recognition[C].International Conference on Document Analysis and Recognition, 2007: 1043-1047.DOI: 10.1109/ICDAR.2007.4377074.

Geurts P Ernst D Wehenkel L al et2006.Extremely randomized trees[J].Machine Learning63(1): 33-42.DOI: 10.1007/s10994-006-6226-1.

Mecikalski J R Williams J K Jewett C P al et2015.Probabilistic 0-1-h convective initiation nowcasts that combine geostationary satellite observations and numerical weather prediction model data[J].Journal of Applied Meteorology and Climatology54(5): 1039-1059.DOI: 10.1175/JAMC-D-14-0129.1.

白琳, 徐永明, 何苗, 等, 2017.基于随机森林算法的近地表气温遥感反演研究[J].地球信息科学学报19(3): 390-397.DOI: 10.3724/SP.J.1047.2017.00390.

曾智琳, 谌芸, 朱克云, 等, 2019.广东省大冰雹事件的层结特征与融化效应[J].大气科学43(3): 598-617.DOI: 10.3878/j.issn.1006-9895.1808.18152.

董师师, 黄哲学, 2013.随机森林理论浅析[J].集成技术2(1): 1-7.

方匡南, 吴见彬, 朱建平, 等, 2011.随机森林方法研究综述[J].统计与信息论坛26(3): 32-38.

黄衍, 查伟雄, 2012.随机森林与支持向量机分类性能比较[J].软件33(6): 107-110.DOI: 10.3969/j.issn.1003-6970.2012.06.038.

李丰, 刘黎平, 王红艳, 等, 2014.C波段多普勒天气雷达地物识别方法[J].应用气象学报25(2): 158-167.

李国翠, 刘黎平, 连志鸾, 等, 2014.利用雷达回波三维拼图资料识别雷暴大风统计研究[J].气象学报72(1): 161-181.DOI: 10.11676/qxxb2014.003.

李平, 解以扬, 李英华, 等, 2013.C波段雷达反射率资料的同化与数值模拟[J].气象科技42(3): 506-515.DOI: 10.19517/j.1671-6345.2013.03.016.

李文娟, 赵成, 郦敏杰, 等, 2018.基于数值预报和随机森林算法的强对流天气分类预报技术[J].气象44(12): 1555-1564.DOI: 10.7519/j.issn.1000-0526.2018.12.005.

李毓, 张春霞, 2011.基于out-of-bag样本的随机森林算法的超参数估计[J].系统工程学报26(4): 566-572.

梁慧玲, 林玉蕊, 杨光, 2016.基于气象因子的随机森林算法在塔河地区林火预测中的应用[J].林业科学52(1): 89-98.DOI: 10.11707 /j.1001-7488.20160111.

刘君, 肖秀珠, 张维, 等, 2013.福建西部近10年冰雹雷达资料统计分析[J].气象科技41(2): 339-342.

刘雨佳, 陈洪滨, 朱君鉴, 2014.山东省S波段与C波段天气雷达回波强队的对比分析[J].气象科学34(1): 87-95.DOI: 10.3969 /2012jms.0176.

路亚奇, 曹彦超, 张峰, 等, 2016.陇东冰雹天气特征分析及预报预警[J].高原气象35(6): 1565-1576.DOI: 10.7522/j.issn. 1000-0534.2015.00116.

路志英, 任一墨, 孙晓磊, 等, 2018.基于深度学习的短时强降水天气识别[J].天津大学学报(自然科学与工程技术版)51(2): 111-119.DOI: 10.11784/tdxbz201703106.

马洪波, 陈长胜, 牛立强, 等, 2016.基于SWAN系统的新冰雹指数应用及检验[J].气象灾害防御23(2): 20-25.

唐亘, 2018.精通数据科学//从线性回归到深度学习[M].北京: 中国工信出版集团, 238-239.

唐文苑, 周庆亮, 刘鑫华, 等, 2017.国家级强对流天气分类预报检验分析[J].气象43(1): 67-76.DOI: 10.7519/j.issn.1000-0526.2017.01.007.

王红艳, 2015.新一代天气雷达组网估算降水的覆盖能力分析法研究[D].北京: 中国气象科学研究院, 1-140.

王坚红, 肖雯, 曹正, 等, 2019.华南前汛期暴雨C波段雷达特征应用研究[J].南京信息工程大学学报(自然科学版)11(1): 91-100.DOI: 10.13878 /j.cnki.jnuist.2019.01.016.

王令, 康玉霞, 焦热光, 等, 2004.北京地区强对流天气雷达回波特征[J].气象30(7): 31-35.

王萍, 潘跃, 2013.基于显著性特征的大冰雹识别模型[J].物理学报62(6): 515-524.DOI: 10.7498/aps.62.069202.

王莎, 沙勇, 宋金妹, 等, 2019.冀东地区冰雹云多普勒雷达参数特征分析[J].气象45(5): 713-722.DOI: 10.7519/j.issn.1000-0526.2019.05.013.

王研峰, 黄武斌, 王聚杰, 等, 2019.一次甘肃天水强冰雹的雷达回波特征及成因分析[J].高原气象38(2): 368-376.DOI: 10. 7522/j.issn.1000-0534.2018.00077.

吴剑坤, 陈明轩, 秦睿, 等, 2019.变分回波跟踪算法及其在对流临近预报中的应用试验[J].气象学报77(6): 999-1014.DOI: 10.11676/qxxb2019.062.

修媛媛, 韩雷, 冯海磊, 2016.基于机器学习方法的强对流天气识别研究[J].电子设计工程24(9): 4-7.DOI: 10.14022/j.cnki.dzsjgc.2016.09.002.

俞小鼎, 2011.强对流天气的多普勒天气雷达探测和预警[J].气象科技进展1(3): 31-41.

张秉祥, 李国翠, 刘黎平, 等, 2014.基于模糊逻辑的冰雹天气雷达识别算法[J].应用气象学报25(4): 415-426.

张雷, 王琳琳, 张旭东, 等, 2014.随机森林算法基本思想及其在生态学中的应用——以云南松分布模拟为例[J].生态学报34(3): 650-659.DOI: 10.5846/stxb201306031292.

张小玲, 杨波, 盛杰, 等, 2018.中国强对流天气预报业务发展[J].气象科技进展8(3): 8-18.DOI: 10.3969/j.issn.2095-1973. 2018.03.001.

赵海军, 潘玲, 王庆华, 等, 2018.临沂冰雹发生规律及预警技术研究[J].气象与环境科学41(2): 83-90.DOI: 10.16765 /j.cnki.1673-7148.2018.02.012.

郑永光, 林隐静, 朱文剑, 等, 2013.强对流天气综合监测业务系统建设[J].气象39(2): 234-240.DOI: 10.11898/1001-7313. 20150601.

周康辉, 郑永光, 王婷波, 等, 2017.基于模糊逻辑的雷暴大风和非雷暴大风区分方法[J].气象43(7): 781-791.DOI: 10.7519/j.issn.1000-0526.2017.07.002.

Outlines

/