Forest Index · 全球森林价格指数
先把"够格"定下来,再谈指数
指数要有意义,前提是有足够多可核验的真实样本。现在的样本量是 0——登记入口还没开。这种情况下发布任何"指数数值"都是编的。所以这一页先做规则:什么数据才够格进入指数,以及现在还缺什么。
0
三条底线
- 核验等级不够的样本不进入计算。"经营者自称"和"第三方核验过"不能混在一起取平均——混了之后,指数反映的是填写意愿,不是森林价值。
- 口径不统一的样本不进入计算。站山价与到厂价可以差一倍;年平均生长量(MAI)与连年生长量(PAI)也可以差很多。同一个指数里只能有一种口径。
- 样本不足的分组不发布。宁可空着,也不发一个"仅供参考"的数——那种数一旦被引用,就再也追不回来了。
准入门槛
下面的阈值是可执行的判定条件,不是形容。任何一条不满足,该分组就不发布。
| 门槛 | 要求 | 为什么这样定 |
|---|---|---|
| 核验等级 | 只接受「有调查数据」与「第三方核验」两级;「自称」样本单独统计但不进入指数计算 | 把不同可信度的数据平均,等于让数据质量最差的那部分决定结论 |
| 最小样本量 | 每个发布分组至少 30 个独立样本,且至少 10 个达到「第三方核验」 | 样本太少时,一两笔异常交易就能左右整个数 |
| 时效 | 只采用最近 24 个月内的价格与成本样本;生长量样本可放宽到 60 个月(生长本来就慢) | 木材价格波动大,混入几年前的数会把"当前水平"算歪 |
| 单位口径 | 同一分组内单位必须统一(亩/公顷、元/立方米、美元/立方米),换算过的样本须保留原始值 | 换算系数用错是这类数据最常见的污染来源,而且很难事后发现 |
| 价格口径 | 站山价与到厂价分开发布,不合成一个数 | 两者差额本身就是重要信息,合并等于把它抹掉 |
| 生长量口径 | 标明 MAI 或 PAI;未标明的样本不采用 | 口径不明时,数值大小无法解释 |
分组维度
指数不能只给一个"全球均价"——那对任何人都没有用。发布时必须同时给出分组,否则不可比。
- 国家 / 地区至少到国家,主要生产国再分大区
- 树种 / 无性系树种必须分列;桉树等无性系差异大的要注明品种代际
- 培育目标小径材 / 中径材 / 大径材、浆纸材 / 人造板——轮伐期与价格都跟着变
- 林龄段按龄组分段,不混龄平均
- 权属与经营强度集体粗放经营与国有集约经营要分开(同产区实测可差 60% 以上)
- 核验等级作为单独维度标注,不合并
异常值处理
不做这一步,指数会被个别极端样本带跑。规则要事先写死,不能事后挑数据。
- 以分位数裁剪:取 5%–95% 区间,超出部分剔除并记录剔除条数与原因,随指数一并公布。
- 剔除日志必须公开:谁被剔了、为什么——否则"异常值处理"很容易变成"挑好看的数据"。
- 不使用均值作为主指标:同时公布中位数与四分位区间,均值只作参考。
- 样本量少于门槛时不做任何统计,包括不公布中位数。
当前样本状况
如实列出——这一栏全是 0,而这个 0 本身就是最重要的信息。
| 项目 | 当前 | 发布所需 |
|---|---|---|
| 已登记的 Forest ID | 0 | 每个分组 ≥ 30 个 |
| 其中达到「第三方核验」 | 0 | 每个分组 ≥ 10 个 |
| 可用的真实成交样本 | 0 | ≥ 30 笔且可追溯 |
| 覆盖的国家 / 地区 | 0 | 至少 3 个主要产区 |
| 已发布的指数数值 | 0(本站不发布) | 样本达标后再谈 |
每次发布必须附带的元数据
一个指数能不能被引用,取决于它有没有把"怎么算出来的"交代清楚。下列信息缺一不可。
- 样本量、核验等级构成、覆盖地区与时间窗;
- 本次采用的单位与价格口径(站山价/到厂价、MAI/PAI);
- 被剔除样本的条数与原因;
- 中位数与四分位区间,以及样本量变化的说明;
- 计算方法与任何一次规则变更的日期——规则只能事先改,不能事后改。
口径说明
- 本站目前不发布任何指数数值。这一页是准入规则,不是指数本身;样本量为 0 时公布任何数都是编的。
- 规则一旦发布就先于数据存在:发布后修改必须标注日期与原因,避免"为了得到某个结论而调规则"。
- 指数是统计描述,不是估值意见,也不能直接作为抵押、交易或征收补偿的定价依据。
- 样本的采集与使用须遵守个人信息与数据跨境规则;涉密与涉个人隐私的林地信息不进入指数样本。