每类数据先保留自己的时间

链上数据跟着区块前进,交易场所使用各自的撮合与报告时间,监管或发行人资料则有统计截止日。统一成一列日期很方便,也最容易丢掉先后关系。

我的做法是先保存原始时间、时区、采样频率和修订状态。只有确认口径后,才把数据放进共同窗口。

  • 原始时区与时间戳
  • 采样和聚合频率
  • 统计截止日
  • 数据是否会被回补或修订

区分事件发生、市场吸收和资料可见

一笔链上转移被记录,不代表市场已经知道它的目的,也不代表资产已经进入可交易状态。托管、跨链、交易场所入账和内部归集会拉开时间。

同样,公开资料的发布日期不等于其中经济活动发生的日期。研究笔记需要同时写出事件时间和信息可见时间,避免使用未来信息。

让冲突数据和时点进入复核

现货成交、衍生品仓位和链上流向没有对齐时,最省事的做法是挑一张图当主线。我不太喜欢这种处理。差异可能来自参与者、场所覆盖或结算时差,本身就是研究对象。

先列出每组数据能观察什么、漏掉什么,再判断冲突是噪声、口径问题,还是市场结构变化。解释可以晚一点。

结论页应注明数据截至何时、下一次更新等待哪类资料,以及哪些判断会受回补影响。这样,后来出现的新记录不会被误当作当时已经知道的证据。

时间对齐听起来像数据清理,却直接决定情境分析和组合判断能否复核。三只钟没有对上,模型越精致,故事可能离事实越远。