Fill the Gaps of Eddy Covariance Fluxes Using Machine Learning Algorithms

  • Shaoying WANG , 1 ,
  • Yu ZHANG 2 ,
  • Xianhong MENG 1 ,
  • Minhong SONG 2 ,
  • Lunyu SHANG 1 ,
  • Youqi SU 1, 3 ,
  • Zhaoguo LI 1
Expand
  • 1. Northwest Institute of Eco-Environment and Resources,CAS/Key Laboratory of Land Surface Process and Climate Change in Cold and Arid Regions,CAS,Lanzhou 730000,Gansu,China
  • 2. Chengdu University of Information Technology/School of Atmospheric Sciences,Chengdu 610225,Sichuan,China
  • 3. University of Chinese Academy of Sciences,Beijing 100049,China

Received date: 2019-05-18

  Revised date: 2020-10-12

  Online published: 2020-12-28

Highlights

The eddy covariance long-term measurements commonly include data gaps due to system failures, quality control and quality assurance.In this study, the marginal distribution sampling (MDS) algorithm and three machine learning algorithms (random forest RF, support vector machine SVM and artificial neural networks ANN) were applied to fill the gaps of sensible heat flux (H), latent heat flux (LE) and net ecosystem exchange in 2016 over an alpine ecosystem.Results indicate that the performance of RF is better than SVM and ANN.During the nighttime, the periods of sunrise and sunset, and in the winter and spring, the performance of three machine learning algorithms is relatively weak, compared to other periods or seasons.On the monthly and annual scales, the filled NEE budget is significantly influenced by the choice of gap-filling method, compared to H and LE.

Cite this article

Shaoying WANG , Yu ZHANG , Xianhong MENG , Minhong SONG , Lunyu SHANG , Youqi SU , Zhaoguo LI . Fill the Gaps of Eddy Covariance Fluxes Using Machine Learning Algorithms[J]. Plateau Meteorology, 2020 , 39(6) : 1348 -1360 . DOI: 10.7522/j.issn.1000-0534.2019.00142

1 引言

涡动相关系统, 作为一种直接观测陆地生态系统与大气间物质与能量通量地观测技术, 是国际通量网络(FLUXNET)以及大量气象、 生态、 水文等观测站点等的重要观测手段, 在全球变化研究中发挥着极其重要的作用。涡动相关通量数据的长期、 连续积累, 不仅有助于准确量化陆地生态系统与大气间的能量、 物质交换在不同时空尺度上的收支特征和源汇特征, 以及对环境因子的响应, 同时也为各类陆面过程模式和遥感模型等参数化方案发展以及结果验证提供了重要的基础数据支撑(Baldocchi, 2014; 于贵瑞等, 2017)。
涡动相关法通过求解垂直风速脉动与其他物理脉动量的协方差来计算湍流通量。该方法不依赖近地层相似性理论等假设, 但受观测原理与仪器构造等影响, 在得到最终的通量计算结果之前必须对原始数据进行一系列必要等修正、 质量控制与质量保证(Lee et al, 2004)。此外, 由于观测系统故障、 质量控制与质量保证等, 最终的湍流通量资料序列常存在大量缺失数据和舍弃数据, 其占数据总长度的40%~60%, 在进行地气间物质、 能量收支等研究中, 还需对该部分数据进行数据插补(Falge et al, 2001; Moffat et al, 2007)。经近20年的发展, 国内外对于湍流通量资料计算中的修正、 质量控制与质量保证开展了丰富的研究, 各修正项对通量计算的影响已基本明了, 并形成了标准化的处理方法 (Papale et al, 2006; Mauder et al, 2008; 徐自为等, 2008; 王少影等, 2009; 吕少宁等, 2012; 庄金鑫等, 2013; Wutzler et al, 2018), 但关于缺失通量数据的插补, 仍需进一步讨论(Foltýnová et al, 2020)。插补方法的选择是造成陆地生态系统与大气间能量、 物质交换年收支总量不确定性的重要因素之一(Falge et al, 2001)。例如Moffat et al (2007)利用6个森林站点的10套观测资料, 系统性的讨论了15种数据插补方法对净生态系统交换年累积量计算的影响, 其结果表明插补方法的选择对NEE年累积量的计算有较大影响, 其不确定性约为±25 g·C·m-2·y-1; Soloway et al (2017) 利用加拿大NOBS森林站14年的长期观测资料讨论了4种插补方法对净生态系统交换年累积量的影响, 其结果显示插补方法的选择足以显著改变该研究站点多年平均的碳源汇特征。
关于缺失通量数据的插补, 较为常用的插补方法有数十种, 主要分为三类: 一是基于平均值的插补方法; 二是基于环境驱动因子的非线性回归方法; 三是基于人工神经网络的插补方法(Falge et al, 2001; Hui et al, 2004; Ooba et al, 2006; Moffat et al, 2007; Soloway et al, 2017)。缺失通量数据插补方法的统一, 是台站间以及通量观测网络间进行数据融合和提高资料可比性的重要基础。然而迄今为止, 国际上各通量网络间, 关于缺失通量数据的插补方法还尚未统一, 且大多数方法都是针对净生态系统交换量的插补。目前, FLUXNET和欧洲通量网CarboEurope采用平均值插补方法当中的边缘分布抽样法(Marginal Distribution Sampling, MDS)进行缺失通量数据的插补(Reichstein et al, 2005), 并将其应用到了 FLUXNET2015数据集(Pastorello et al, 2020)。中国通量网ChinaFLUX和日本通量网采用非线性回归方法进行净生态系统交换量的插补, 感热、 潜热通量则采用平均昼夜变换法和查表法进行(李春等, 2008)。澳大利亚国家生态系统研究网络OzFlux采用人工神经网络算法进行缺失通量数据的插补(Beringer et al, 2017)。美国通量网AmeriFlux则采用MDS和人工神经网络两种方法分别对缺失的通量数据进行插补(Agarwal et al, 2014)。
近年来, 随着人工智能的兴起, 机器学习算法也被逐渐应用到了缺失通量资料插补当中(Moffat et al, 2007; Dengel et al, 2013; Knox et al, 2015; Beringer et al, 2017)。相比于平均值方法和非线性回归方法, 机器学习算法的显著优点在于其可以纳入更多的影响通量交换的潜在环境驱动变量作为输入变量对模型进行训练, 且不需要输入变量与输出变量间明确的生物物理学规律作为解释。但是, 利用机器学习算法进行缺失通量资料的插补尚处于探索阶段, 还存在如下问题: (1)以往研究多是基于人工神经网络算法, 其他机器学习算法是否可以应用到缺失通量资料插补当中?(2)基于机器学习算法进行缺失通量资料的插补, 插补效果具有怎样的时间分布特征?(3)机器学习算法可以尽可能多的选取潜在环境驱动变量进行模型训练, 环境变量的相对重要性在各算法中和对各插补量的相对重要性是否一致?基于以上问题, 本文利用中国科学院西北生态环境资源研究院若尔盖高原湿地生态系统研究站(简称若尔盖站)观测资料, 采用三种常用的机器学习算法(人工神经网络、 随机森林、 支持向量机)对缺失的通量数据进行插补, 检查三种机器学习算法在不同时间尺度上对缺失通量数据进行插补的性能, 结合主成分分析方法给出环境驱动变量的相对重要性, 探讨经典的MDS方法和三种机器学习算法插补后的年累积量的差异性。本工作的开展, 可为通量观测站/通量网络的数据处理标准化以及高质量有代表性的数据库建立提供科学依据。

2 资料来源与方法介绍

2.1 资料来源

所用资料来自若尔盖站高寒草原观测场, 该观测场位于甘肃省甘南藏族玛曲县河曲马场(33.92°N, 102.10°E, 海拔3440 m), 观测场周围地形开阔、 平坦。测站所属地区为典型的高寒湿润区, 多年平均降水量和气温分别为595 mm和1.2 ℃(王少影等, 2012)。该站点现有观测系统两套, 分别为开路涡动相关观测系统(表1)和微气象观测系统(表2)。
表1 涡动相关系统各观测仪器和架设高度或埋设深度

Table 1 Height or depth of the instruments related to eddy covariance system

观测项目 观测仪器, 型号 高度或埋深/m
三维风速 CSAT3, Campbell 2.7
H2O/CO2浓度 EC150, Campbell 2.7
辐射计 CNR1, Kipp & Zonen 1.5
土壤温度 109SS, Campbell 0.05, 0.10, 0.20, 0.40
土壤体积含水量 CS650, Campbell 0.05, 0.10, 0.20, 0.40
土壤热通量 HFP01, Hukseflux 0.025, 0.075
空气温湿度 HMP155A, Vaisala 2.7
表2 微气象观测系统各观测仪器及架设高度或埋设深度

Table 2 Height or depth of the instruments related to micrometeorological measurement system

观测项目 观测仪器, 型号 高度或埋深/m
风向风速 WindSonic, Gill 1, 2, 5, 10
空气温湿度 HMP45C, Campbell 1, 2, 5, 10
辐射四分量 CNR4, Kipp & Zonen 1.5
土壤温度 109SS, Campbell 0.05, 0.10, 0.20, 0.40, 0.80, 1.60
土壤体积含水量 CS616, Campbell 0.05, 0.10, 0.20, 0.40, 0.80, 1.60
土壤热通量 HFP01, Hukseflux 0.025, 0.075, 0.15, 0.30
降水量 T200B-3, Geonor 0.75
本文选取玛曲观测场2016年1月1日至12月31日的观测资料进行分析, 具体变量包括: 感热通量H、 潜热通量LE、 净生态系统交换量NEE、 空气温度Tair、 相对湿度RH、 饱和水汽压差VPD、 风速WS、 向下太阳短波辐射Rg、 四层土壤温度Tsoil(5, 10, 20和40 cm)和四层土壤体积含水量SWC(5, 10, 20和40 cm)。30 min的H, LE和NEE由涡动相关通量计算软件EddyPro 6.1 (https: //www.licor.com) 对10 Hz的湍流原始资料进行处理得到, 其主要步骤包括: 野点剔除、 时间延迟校正、 坐标旋转、 超声虚温修正、 空气密度效应修正和频率响应修正。对计算得到的30 min通量资料, 进一步根据质量等级标志剔除低质量的数据, 并剔除由于红外气体分析仪镜面污染所造成的不可信数据。进一步对NEE资料进行夜间摩擦速度修正, 即剔除以及夜间摩擦速度小于0.1的NEE数据。此外, 由于NEE在非生长季的日间存在与实际不符的碳吸收(NEE<0), 对该部分数据剔除时首先利用该站点MODIS 250 m分辨率的16天合成的NDVI数据, 通过物候计算工具TIMESET 3.3 (Jönsson et al, 2004) 计算其生长季开始和结束的时间点, 然后再剔除非生长季NEE<0的数据。2016年观测站点H、 LE和NEE的缺失率gap_H, gap_LE和gap_NEE在年尺度上分别为10.7%, 20.4%和32.6%(表3)。
表3 感热通量、 潜热通量和净生态系统交换量缺失率

Table 3 Missing rate of sensible heat flux, latent heat flux and net ecosystem exchange

项目 1月 2月 3月 4月 5月 6月 7月 8月 9月 10月 11月 12月 全年
gap_H 14.5% 16.6% 10.3% 10.2% 13.9% 9.0% 6.9% 8.3% 9.8% 9.7% 9.9% 12.5% 10.7%
gap_LE 18.0% 25.2% 15.9% 21.4% 28.0% 19.4% 18.2% 19.1% 28.3% 20.5% 14.4% 16.2% 20.3%
gap_NEE 46.3% 52.0% 46.5% 31.7% 29.0% 22.5% 22.5% 21.8% 31.6% 22.7% 20.1% 44.4% 32.6%
利用机器学习算法进行缺失通量数据插补, 需保证环境驱动变量的完整性, 故做如下处理: (1)若涡动相关观测系统中的Tsoil、 SWC和Rg存在缺失, 则用微气象观测系统中同层次观测进行插补。(2)若涡动相关观测系统中的Tair、 RH、 VPD、 和WS存在缺失, 则用微气象观测系统中2 m和5 m观测的平均值代替。

2.2 方法介绍

本文采用平均值算法中的MDS方法, 和机器学习算法中的人工神经网络、 随机森林以及支持向量机共4种方法对缺失的通量数据进行插补。MDS方法是可看作是查表法和平均昼夜变换法的一种集合应用。该方法以Tair、 Rg和VPD作为环境驱动变量, 利用一定时间窗口内相似环境条件下的通量资料均值进行缺失资料的插补。在的一定时间窗口内, 当环境驱动变量无缺失时, 缺失的通量数据由相似环境条件下的平均通量代替, 而当环境驱动变量全部缺失时, 则采用通量资料的平均日变化对缺失数据进行插补(Reichstein et al, 2005)。
人工神经网络(ANN)算法, 是目前通量资料插补较为常用的机器学习方法。在结构上, 人工神经网络由输入层、 输出层和隐藏层三部分组成, 输入层的每个节点对应预测变量即环境驱动变量, 输出层节点对应目标变量即湍流通量, 隐含层的层数和每层节点的个数决定了人工神经网络的复杂度(Moffat et al, 2007; Dengel et al, 2013; Knox et al, 2015; Beringer et al, 2017)。
随机森林算法(RF)由Breiman (2001)提出, 本质为决策数方法的集成, 该方法通过自助重采样技术(bootstrap), 从原始训练样本中有放回的重复随机抽取样本以生成新的训练样本集合, 进而训练决策树。进行回归时, 随机的建立由回归树组成的森林, 且任意两棵回归树间无关联, 在森林建立之后, 当有新的样本输入时, 森林中的每棵回归树会分别进行判断。该方法在涡动相关通量观测的升尺度研究中应用较广(Xu et al, 2018)。
支持向量机(SVM)算法的基本原理是将输入向量通过预先选取的非线性关系映射到一个高维的特征空间, 并在此空间寻找一个最佳分类超平面, 使得样本被分割在超平面的两侧, 并且两侧距离超平面最近的样本点到超平面的距离最大化。该方法进行回归的本质是利用核心函数将输入矢量转换到高维的特征空间, 从而将复杂的非线性问题转换为线性问题 (Cortes et al, 1995)。
在利用上述三种机器学习算法进行缺失通量资料的插补时, 首先选取无缺失数据的75%作为训练数据集, 对三种算法分别进行训练; 然后将剩余25%无缺失数据作为检验数据集对模型模拟性能进行检验; 最后将模型应用到整个数据集进行模拟, 缺失通量数据用模拟值代替。
为能与经典的MDS方法插补后的年累积量进行比较, 在进行模型训练时, 感热通量、 潜热通量和净生态系统交换量三个目标变量的输入层一致, 分别为方案S1和方案S2。方案S1: RF, SVM和 ANN三种机器学习算法的输入层与MDS方法一致, 即采用Tair、 Rg和VPD进行模型训练, 模拟得到的感热通量分别记为H_RF_S1、 H_SVM_S1、 H_ANN_S1, 潜热通量分别记为LE_RF_S1、 LE_SVM_S1、 LE_ANN_S1, 净生态系统交换量分别记为NEE_RF_S1、 NEE_SVM_S1、 NEE_ANN_S1。方案S2: 鉴于机器学习算法可纳入更多的变量进行模型训练, 并考虑环境驱动变量的可获得性与完整性, 选取Tair、 Rg、 VPD、 WS、 RH以及4层的Tsoil和SWC(5, 10, 20和40 cm)作为输入层对模型进行训练, 模拟得到的感热通量分别记为H_RF_S2、 H_SVM_S2、 H_ANN_S2, 潜热通量分别记为LE_RF_S2、 LE_SVM_S2、 LE_ANN_S2, 净生态系统交换量分别记为NEE_RF_S2、 NEE_SVM_S2、 NEE_ANN_S2。此外, MDS方法插补后的感热、 潜热通量和净生态系统交换量分别记为H_MDS、 LE_MDS和NEE_MDS。

3 结果分析

3.1 三种机器学习算法的整体性能评估

如图1所示, 同实际的观测结果进行比较可以看到, S1方案下RF算法模拟的H、 LE和NEE与实际观测更为接近, 其复相关系数R 2达到了0.9以上, 且回归后的斜率更趋近于1。当H<50 W·m-2·s-1或LE<50 W·m-2·s-1时, SVM和ANN算法的模拟值较实际观测存在较大偏差。当NEE<0和NEE>0时, 三种算法的模拟均存在较大偏差。为进一步提高三种机器学习算法的模拟性能并考虑环境驱动变量的可获得性与完整性, 除Tair、 Rg和VPD外, 进一步选择WS、 RH以及4层(5, 10, 20和40 cm)的Tsoil和SWC作为环境驱动变量(方案S2)重新对模型进行训练。如图2所示, 更多环境驱动变量的引入使得三种算法对H、 LE和NEE的整体模拟效果均有一定程度的提升, RF算法对H<50 W·m-2·s-1、 LE<50 W·m-2·s-1以及NEE<0 μmol·m-2·s-1时的模拟改善更为明显。此外, 在非生长季, S1方案下的三种算法以及S2方案下的ANN算法, 模拟的日间NEE仍表现出与实际不符的碳吸收 (图略)。
图1 S1方案下不同机器学习算法模拟的感热通量、 潜热通量和净生态系统交换量与其对应的实际观测值(M)的线性回归分析

Fig.1 Linear regression analysis of observed sensible heat flux, latent heat flux and net ecosystem exchange against different machine learning algorithms simulated sensible heat flux, latent heat flux and net ecosystem exchange using gap-filling strategy S1

图2 S2方案下不同机器学习算法模拟的感热通量、 潜热通量和净生态系统交换量与其对应的实际观测值(M)的线性回归分析

Fig.2 Linear regression analysis of observed sensible heat flux, latent heat flux and net ecosystem exchange against different machine learning algorithms simulated sensible heat flux, latent heat flux and net ecosystem exchange using gap-filling strategy S2

3.2 插补效果的时间变化特征

从时间分布的泰勒图(图3)可以看到, 三种机器学习算法模拟较差的时段均主要集中在夜间和日出、 日落时段。引入更多环境变量后, 可以显著提高H和LE在各时段的模拟效果。对于NEE, 其正午前后[10:00 -16:00(北京时, 下同)]模拟效果的改善更为显著, 而夜间和日出、 日落时段模拟效果的改善则相对较小。进一步分析在小时尺度上H、 LE和NEE模拟效果与H、 LE和NEE波动性的关系, 以RF算法S1方案为例(图4), H、 LE和NEE实测值与模拟值的相关系数随着H、 LE和NEE归一化标准差的减小而减小, 也随着摩擦速度归一化标准差的减小而减小。从模拟效果随季节的变化来看(图5), 三种机器学习算法对H的模拟效果在各季节无明显差异; 对于LE, 其冬、 春季节的模拟效果略低于夏、 秋两季; 对于NEE其春季的模拟能力则相对较差。更多环境变量的引入, 可以显著提高LE在冬、 春季节以及NEE在春季的模拟, 并且RF算法的模拟性能优于SVM算法和ANN算法。
图3 两种方案下机器学习算法对感热通量、 潜热通量和净生态系统交换量模拟的泰勒图

橙色虚线为均方根误差; 黑色实线为相关系数; 黑色虚线为标准差; 箭头起点(终点)位置对应S1(S2)方案模拟得到的均方根误差、 相关系数和标准差, 箭头指向观测点, 表示模拟效果提高

Fig.3 Taylor diagram showing change in machine learning algorithm performances when changing input variables.The orange dashed line is the root mean square error; the black solid line is the correlation coefficient; the black dashed line is the standard deviation.The starting (end) points position of the arrows represent root mean square error, correlation, and standard deviation for S1 (S2).If an arrow points toward observed values, it means model performance was improved.The colored line indicates each hour

图4 小时尺度上机器学习算法模拟的感热通量、 潜热通量和净生态系统交换量与实测值的相关系数R随感热通量、 潜热通量、 净生态系统交换量(a~c)和摩擦速度(d~f)的归一化标准差的变化

R代表相关系数; NSD代表归一化的标准差; ustar代表摩擦速度

Fig.4 Scatter plots of the correlation coefficient R between the sensible heat flux, latent heat flux and net ecosystem exchange volume simulated by the machine learning algorithm against the normalized sensible heat flux, latent heat flux, net ecosystem exchange volume (a~c) and the friction speed (d~f) on the hour scale. The R represents correlation coefficient. NSD represents normalized standard deviation; The ustar represent friction velocity

图5 两种方案下机器学习算法对感热通量、 潜热通量和净生态系统交换量模拟的泰勒图

橙色虚线为均方根误差; 黑色实线为相关系数; 黑色虚线为标准差; 箭头起点(终点)位置对应S1(S2)方案模拟得到的均方根误差、 相关系数和标准差, 箭头指向观测点, 表示模拟效果提高

Fig.5 Taylor diagram showing change in machine learning algorithm performances when changing input variables.The orange dashed line is the root mean square error; the black solid line is the correlation coefficient; the black dashed line is the standard deviation.The starting (end) points position of the arrows represent root mean square error, correlation, and standard deviation for S1 (S2).If an arrow points toward observed values, it means model performance was improved.The colored line indicates each hour

3.3 环境变量的依赖性和重要性

地气间的物质与能量交换受到多重环境变量的共同作用, 即多驱动因子的依赖性。模拟与观测的残差同环境驱动变量相关系数可用来检验机器学习算法对这种多因子依赖性的把握程度。若机器学习算法可以正确解释多驱动因子的依赖性, 那么其观测与模拟的绝对偏差同环境驱动变量相关性则不显著(Kim et al, 2020)。如图6所示, 对于方案S1, 三种机器学习算法得到的H、 LE和NEE的残差仍然与大多数环境变量具有显著的相关性, 当采用S2后, 三种机器学习算法得到的H、 LE和NEE的残差只与少数几个变量具有显著的相关性。从三种机器学习算法对多驱动因子的依赖性的把握程度上来看, RF算法和ANN算法要优于SVM算法。
图6 机器学习算法模拟与实际观测的残差与环境驱动变量的相关系数矩阵

RSD代表残差; 图中 “×”代表相关性不显著(p<0.05)

Fig.6 Correlation matrix showing the relationship between residuals (modeled - observed) and input variables.The RSD represents residual."×" in the figure means that the correlation is not significant (p<0.05)

主成分分析是机器学习算法中解决输入变量的多重共线性问题和变量过多问题的重要手段, 因此可用来评估环境驱动变量对模型模拟的重要性。从图7中可以发现, 对RF算法, Rg对H、 LE和NEE模拟的重要性显著高于其他变量; 对SVM算法, 除Rg以外, Tair、 VPD和 RH对H、 LE和NEE模拟的重要性显著高于其他变量; 对于ANN算法, Tair、 Tsoil、 Rg和VPD对H、 LE和NEE模拟的重要性显著高于其他变量。
图7 S2方案下环境变量的重要性

Fig.7 The importance of input variables for S2 strategy

3.4 插补方法的选择对年累积量的影响

从感热通量(H)、 蒸散发(ET)、 和净生态系统交换(NEE)累积量的变化(图8)以及表4中可以看到, MDS方法和三种机器学习算法在两种环境驱动变量方案下插补得到的H和蒸散发ET(由LE进行单位转换得到)均表现出很好的一致性, H年累积量介于955~961 MJ·m-2, ET年累积量介于440~446 mm。对于NEE, 其年累积量介于-176~-81 gC·m-2, SVM_S1插补方法得到的玛曲草原的碳汇能力是RF_S2方法的2.17倍。其中, 生长季和非生长季NEE的累积量分别介于-212.2~-171.3 gC·m-2, 和36~90.3 gC·m-2, 非生长季NEE累积量的差异占年总差异的57%。需要指出的是, 在非生长季节, S1方案下的三种机器学习算法以及S2方案下的ANN算法, 模拟的NEE仍表现出与实际不符的碳吸收。鉴于此, 仅比较MDS算法和S2方案下RF算法和SVM算法对NEE插补后的累积量, 其值介于-124~-82 gC·m-2, MDS算法与S2方案下的SVM算法得到的年累积量基本相当。
图8 2016年感热通量、 蒸散发、 和净生态系统交换累积量的变化

Fig.8 Cumulative sensible heat flux, evapotranspiration and net ecosystem exchange over the course of 2016

表4 感热通量、 蒸散发和净生态系统交换插补后的累积量

Table 4 The cumulative amount of sensible heat flux, evapotranspiration and net ecosystem exchange after interpolation

项目 1月 2月 3月 4月 5月 6月 7月 8月 9月 10月 11月 12月 全年
H_MDS/MJ 63.9 95.8 114.2 121.7 96.0 66.2 56.9 84.0 56.6 65.5 67.7 64.2 952.6
H_RF_S1/MJ 64.0 96.2 114.6 121.1 99.0 66.2 57.3 84.5 56.9 65.7 68.2 64.0 957.9
H_SVM_S1/MJ 64.0 96.0 114.4 121.0 97.7 66.0 57.0 84.3 56.8 65.5 68.2 64.2 955.2
H_ANN_S1/MJ 63.9 95.8 114.3 121.2 99.4 66.9 57.4 84.6 57.4 65.9 67.9 64.2 958.9
H_RF_S2/MJ 64.5 96.3 115.2 121.8 96.3 66.6 57.4 84.7 57.2 66.2 68.7 65.0 959.9
H_SVM_S2/MJ 64.5 96.7 114.9 122.0 95.5 66.5 57.2 84.5 57.0 65.9 68.7 64.9 958.3
H_ANN_S2/MJ 64.3 97.7 114.5 121.7 96.9 67.1 56.6 84.4 57.8 66.4 68.9 64.9 961.2
ET_MDS/mm 5.9 7.1 14.5 28.5 53.2 74.2 84.8 76.4 46.3 34.7 13.0 7.5 446.1
ET_RF_S1/mm 5.9 7.5 14.4 28.0 52.2 73.8 84.2 76.6 45.5 33.8 13.0 7.5 442.4
ET_SVM_S1/mm 5.8 7.5 14.6 28.2 51.6 73.4 83.8 76.4 45.0 33.8 13.1 7.6 441.0
ET_ANN_S1/mm 6.1 7.2 14.6 28.3 51.9 73.6 84.2 76.8 45.4 34.0 12.9 7.4 442.5
ET_RF_S2/mm 5.9 7.1 14.2 28.1 53.7 74.1 85.1 76.6 46.4 34.3 12.9 7.5 445.9
ET_SVM_S2/mm 5.8 7.3 14.1 28.2 53.5 74.3 84.7 76.5 46.1 34.1 12.9 7.5 445.0
ET_ANN_S2/mm 5.9 7.2 14.2 28.5 53.8 74.5 84.9 76.3 46.2 34.5 12.8 7.3 446.1
NEE_MDS/(gC·m-2) 13.8 11.7 16.5 4.0 -16.1 -52.3 -90.9 -31.9 -25.8 4.2 21.6 21.2 -124.2
NEE_RF_S1/(gC·m-2) 13.4 5.9 1.7 1.8 -9.9 -50.3 -92.2 -33.4 -24.1 6.2 19.5 15.5 -146.2
NEE_SVM_S1/(gC·m-2) 11.9 3.9 3.4 0.4 -14.3 -53.9 -95.7 -36.8 -30.9 2.5 18.8 14.5 -176.4
NEE_ANN_S1/(gC·m-2) 9.3 7.6 8.1 2.2 -11.6 -51.3 -91.7 -32.6 -26.8 4.4 20.0 15.8 -146.6
NEE_RF_S2/(gC·m-2) 15.7 13.7 20.8 8.1 -7.9 -50.9 -86.8 -30.5 -20.0 7.0 23.0 26.8 -81.2
NEE_SVM_S2/(gC·m-2) 16.5 14.5 17.6 5.3 -13.4 -54.7 -91.7 -35.3 -27.9 2.0 21.3 26.1 -120.0
NEE_ANN_S2/(gC·m-2) 2.4 3.5 13.9 7.5 -10.2 -54.4 -89.7 -30.5 -26.5 3.9 20.5 10.1 -149.7

4 讨论与结论

4.1 讨论

整体而言, 无论是采用方案S1还是采用方案S2, H、 LE和NEE的模拟效果均表现为RF算法优于SVM和ANN算法。Kim et al (2020) 利用FLUXNET多个湿地观测站点资料评估了机器学习算法对甲烷通量(CH4)缺失数据插补的影响, 其结果同样显示RF方法效果最佳, 并指出RF方法相比其他机器学习算法具有更强的处理非线性问题的能力, 其能同时兼顾连续、 非连续、 和分类变量的变化特征, 并能避免过拟合问题的产生。另外, 三种算法对H和LE的模拟效果要优于对NEE的模拟, 其原因一方面在于模型训练时H和LE的可利用数据量相比NEE更高; 另一方面则是影响地气间碳交换的因素相比热量和水分更加复杂, 例如光合作用在低温或高饱和水气压差条件下会受到明显的抑制(Wang et al, 2016), 生态系统呼吸由植物根系呼吸、 土壤微生物呼吸以及土壤动物呼吸等多个过程控制(刘绍辉等, 1997; 刘立新等, 2004)。
在小时尺度上, 机器学习算法对H、 LE和NEE的模拟存在一定的高值低估和低值高估的情况。从缺测数据的插补方法上而言, 无论是平均值方法, 还是非线性回归方法, 亦或是机器学习算法等其它方法, 其核心都是在把握输入变量与输出量间的主要统计特征的基础上进行, 其势必出现对高值和低值的变化特征把握不准确的情况, 因此出现高值拟合过低, 低值拟合过高的情况也就显得合理。从影响地气间H、 LE和NEE的交换因子而言, 其不仅包含环境气象因子, 也与湍流输送特征密切相关, 从本文中可以看到, 机器学习算法的模拟能力随着H、 LE和NEE自身波动性的增强而减弱, 这与Knox et al (2019)和Kim et al (2020) 利用机器学习算法进行CH4通量插补时的结果相一致。Foltýnová et al (2020) 在探讨MDS方法对LE插补的影响时发现其夜间的模拟能力要明显低于白天, 这与本文的研究结果相一致。此外, 在本文中, 机器学习算法对H、 LE和NEE的模拟能力也随着表征湍流动力输送作用的摩擦速度的波动性的增大而减弱。而摩擦速度在夜间稳定层结状态下以及日出、 日落的层结转换期常具有较大的波动性, 也就是说, 机器学习算法对夜间湍流输送机制把握的不准确, 是造成其夜间和日出、 日落时段模拟效果较差的主要原因。在本研究中, 考虑到模型训练对环境驱动变量完整性的要求, 本文并未引入表征湍流输送机制的变量进行训练, 而这也是今后利用机器学习算法进行缺失通量数据插补提高其模拟能力的难点和突破点。对于玛曲草原而言, 冬春季节无长期连续积雪, 短期的降雪事件以及土壤消融过程使得下垫面状况发生显著改变, 进而引起地气间的能量、 物质交换特征以及环境驱动变量发生显著改变。机器学习算法对这些短期过程的发生并不能很好的把握, 可能是其冬春季节模拟效果相对较差的主要原因。
MDS方法和三种机器学习算法在两种环境驱动变量方案下插补得到的H和ET累积量在月尺度和年尺度上基本一致。但是对于NEE, MDS方法和机器学习算法插补后玛曲草原的碳汇能力相差-42 gC·m-2。因此, 在基于涡动相关观测的碳收支研究中, 利用多种插补方法对缺失数据进行插补的基础上, 评估其碳源汇特征十分必要。此外, 本文仅选用一年的观测资料进行研究, 因此未对不同缺测情景下MDS算法和机器学习算法的插补效果进行评估, 也未分季节进行模型的训练和评估, 而这将是本文后续工作的重点。

4.2 结论

(1) 三种机器学习算法对H和LE的模拟效果优于NEE, RF算法对H、 LE和NEE的模拟效果优于SVM和ANN算法, 纳入更多的环境驱动变量, 可以显著提高机器学习算法的模拟能力。
(2) 三种机器学习算法在日间模拟能力优于夜间和日出日落前后, 在夏、 秋季节的模拟效果优于冬、 春季节。三种机器学习算法的模拟效果随着H、 LE和NEE的波动性以及摩擦速度波动性的增强而减弱。
(3) 环境变量的重要性在模拟量间以及算法间, 具有明显的差异性。RF算法和SVM算法可以更好把握模拟量对多驱动因子的依赖性。
(4) MDS方法和三种机器学习算法在两种环境驱动变量方案下插补得到的H和ET累积量在月尺度和年尺度上基本一致。NEE累积量显著受到插补方法的影响, MDS方法和机器学习算法插补后玛曲草原的年碳汇能力相差-42 gC·m-2。

感谢中国科学院若尔盖高原湿地生态系统研究站为本文研究提供的数据支持, 以及该站各位工作人员在野外台站建设和维护中付出的辛苦劳动!同时, 本研究得到中国科学院西北生态资源环境研究院中国科学院超级计算兰州分中心为本工作开展提供的计算资源, 特此感谢。关于本文所用数据和机器学习算法进行数据插补的程序, 可与作者联系。

Agarwal D, Pastorello G, Poindexter C, et al, 2014.The data post-processing pipeline for AmeriFlux data products[C].AGU Fall Meeting Abstracts.

Baldocchi D, 2014.Measuring fluxes of trace gases and energy between ecosystems and the atmosphere-the state and future of the eddy covariance method[J].Global Change Biology, 20(12): 3600-3609.

Beringer J, McHugh I, Hutley L B, et al, 2017.Technical note: Dynamic integrated gap-filling and partitioning for OzFlux (DINGO)[J].Biogeosciences, 14(6): 1457-1460.

Breiman L, 2001.Random forests[J].Machine Learning, 45(1): 5-32.

Cortes C, Vapnik V, 1995.Support-vector networks[J].Machine Learning, 20(3): 273-297.

Dengel S, Zona D, Sachs T, et al, 2013.Testing the applicability of neural networks as a gap-filling method using CH4 flux data from high latitude wetlands[J].Biogeosciences, 10(12): 8185-8200.

Falge E, Baldocchi D, Olson R, et al, 2001.Gap filling strategies for defensible annual sums of net ecosystem exchange[J].Agricultural and Forest Meteorology, 107(1): 43-69.

Foltýnová L, Fischer M, McGloin R P, 2020.Recommendations for gap-filling eddy covariance latent heat flux measurements using marginal distribution sampling[J].Theoretical and Applied Climatology, 139(1): 677-688.

Jönsson P, Eklundh L, 2004.TIMESAT—a program for analyzing time-series of satellite sensor data[J].Computers & Geosciences, 30(8): 833-845.

Hui D, Wan S, Su B, et al, 2004.Gap-filling missing data in eddy covariance measurements using multiple imputation (MI) for annual estimations[J].Agricultural and Forest Meteorology, 121(1/2): 93-111.

Kim Y, Johnson M S, Knox S H, et al, 2020.Gap-filling approaches for eddy covariance methane fluxes: A comparison of three machine learning algorithms and a traditional method with principal component analysis[J].Global Change Biology, 26(3): 1499-1518.

Knox S H, Jackson R B, Poulter B, et al, 2019.FLUXNET-CH4 synthesis activity: objectives, observations, and future directions[J].Bulletin of the American Meteorological Society, 100(12): 2607-2632.

Knox S H, Sturtevant C, Matthes J H, et al, 2015.Agricultural peatland restoration: Effects of land-use change on greenhouse gas (CO2 and CH4) fluxes in the Sacramento-San Joaquin Delta[J].Global Change Biology, 21(2): 750-765.

Lee X, Massman W, Law B, 2004.Handbook of micrometeorology: A guide for surface flux measurement and analysis[M].Boston: Springer Science & Business Media.

Mauder M, Foken T, Clement R, et al, 2008.Quality control of CarboEurope flux data-Part 2: Inter-comparison of eddy-covariance software[J].Biogeosciences, 5: 451-462.

Moffat A M, Papale D, Reichstein M, et al, 2007.Comprehensive comparison of gap-filling techniques for eddy covariance net carbon fluxes[J].Agricultural and Forest Meteorology, 147(3-4): 209-232.

Ooba M, Hirano T, Mogami J, et al, 2006.Comparisons of gap-filling methods for carbon flux dataset: A combination of a genetic algorithm and an artificial neural network[J].Ecological Modelling, 198(3/4): 473-486.

Papale D, Reichstein M, Aubinet M, et al, 2006.Towards a standardized processing of Net Ecosystem Exchange measured with eddy covariance technique: algorithms and uncertainty estimation[J].Biogeosciences, 3: 571-583.

Pastorello G, Trotta C, Canfora E, et al, 2020.The FLUXNET2015 dataset and the ONEFlux processing pipeline for eddy covariance data[J].Scientific Data, 7: 225.

Reichstein M, Falge E, Baldocchi D, et al, 2005.On the separation of net ecosystem exchange into assimilation and ecosystem respiration: review and improved algorithm[J].Global Change Biology, 11(9): 1424-1439.

Soloway A D, Amiro B D, Dunn A L, et al, 2017.Carbon neutral or a sink?Uncertainty caused by gap-filling long-term flux measurements for an old-growth boreal black spruce forest[J].Agricultural and Forest Meteorology, 233: 110-121.

Wang S Y, Zhang Y, Lü S H, et al, 2016.Biophysical regulation of carbon fluxes over an alpine meadow ecosystem in the eastern Tibetan Plateau[J].International Journal of Biometeorology, 60(6): 801-812.

Wutzler T, Lucas-Moffat A, Migliavacca M, et al, 2018.Basic and extensible post-processing of eddy covariance flux data with REddyProc[J].Biogeosciences, 15(16): 5015-5030.

Xu T, Guo Z, Liu S, et al, 2018.Evaluating Different Machine Learning Methods for Upscaling Evapotranspiration from Flux Towers to the Regional Scale[J].Journal of Geophysical Research: Atmospheres, 123(16): 8674-8690.

李春, 何洪林, 刘敏, 等, 2008.ChinaFLUX CO2 通量数据处理系统与应用[J].地球信息科学, 10(5): 557-565.

刘立新, 董云社, 齐玉春, 2004.草地生态系统土壤呼吸研究进展[J].地理科学进展, 23(7): 35-42.

刘绍辉, 方精云, 1997.土壤呼吸的影响因素及全球尺度下温度的影响[J].生态学报, 17(5): 469-476.

吕少宁, 文军, 张宇, 等, 2012.不同平均时间对 LOPEX10 资料涡动相关湍流通量计算结果影响的探讨[J].高原气象, 31(6): 1530-1538.

王少影, 张宇, 吕世华, 等, 2009.金塔绿洲湍流资料的质量控制研究[J].高原气象, 28(6): 1260-1273.

王少影, 张宇, 吕世华, 等, 2012.玛曲高寒草甸地表辐射与能量收支的季节变化[J].高原气象, 31(3): 605-614.

徐自为, 刘绍民, 宫丽娟, 等, 2008.涡动相关仪观测数据的处理与质量评价研究[J].地球科学进展, 23(4): 357-370.

于贵瑞, 陈智, 张雷明, 等, 2017.通量观测事业的科学使命再认知——为解决全球可持续发展的生态学问题奠定坚实的数据基础[J].资源与生态学报, 8(2): 115-120.

庄金鑫, 王维真, 王介民, 2013.涡动相关通量计算及三种主要软件的比较分析[J].高原气象, 32(1): 78-87.DOI: 10.7522/j.issn.1000-0534.2012.00009.

Outlines

/

〈 〉