最后更新:
链上数据(On-chain data)是直接记录在区块链上的信息,包括网络验证并永久存储的每一笔交易、区块、智能合约交互、代币转账和钱包余额。
它是公开且不可篡改的,这意味着任何人都可以读取它,且在最终确认后,任何单一各方都无法悄悄对其进行更改。由于链上数据存在于区块链本身,任何运行节点的人都可以对其进行验证,这使其区别于存储在仅持有方可确认的私人公司数据库中的数据。[1]
链上数据是假名的而非匿名的:地址是其完整历史记录公开的字符串,但账本不会自动揭示钱包归属于谁或交易背后的意图。[2][3]
一笔交易可能显示地址 A 向地址 B 发送了代币,但原始记录并不会表明地址 A 是否为交易所的热钱包,或者该转账是否代表工资支付。这种“发生了什么”与“这意味着什么”之间的差距,是原始链上记录虽然完整且可验证,但在没有额外处理的情况下难以使用的核心原因。[1][2] 这些可验证的记录构成了新兴应用的基础,例如代币化现实世界资产、机构级稳定币结算仪表板、消耗区块链上下文的 AI 代理,以及链上治理和安全分析,所有这些最终都依赖于相同的底层账本条目。
链上数据包含几类不同的记录,每一类都捕捉了网络活动的不同方面。区块是容器,每个区块都带有时间戳并与前一个区块相连,形成了这项技术以此命名的“链”。交易是价值从一个地址转移到另一个地址的记录。
智能合约事件(也称为日志)捕捉了程序内部发生的事情,例如代币交换或抵押品存款。余额反映了每个地址在特定时刻持有的资产。这些记录共同记录了整个网络的交易、代币转移、合约日志和余额。[1] 协议层面的指标,如总锁仓价值 (TVL)、可用流动性或验证者参与度,是通过汇总这些原始记录得出的,但它们仍然是基于底层账本状态构建的二级视图,而不是新的数据类别。
链上数据与链下数据形成对比,后者存在于私有系统中,只能由持有方进行验证。链下数据的例子包括来自中心化交易所的价格、身份记录(如了解您的客户 (KYC) 信息)以及任何在区块链之外计算的内容。
其核心区别在于可验证性:链上数据存在于账本上,可以由任何节点检查,而链下数据存在于私有数据库中,超出了独立验证的范围。[1]
链上数据从交易创建到成为可读分析结果,遵循一个明确的生命周期。
交易首先由用户或应用程序提交。验证者或矿工随后根据网络的共识规则对交易进行验证、排序并将其包含在区块中。一旦区块被添加并确认,其内容就成为永久账本的一部分,网络上的每个全节点都会存储该记录的副本。[1]
存储的记录以低级格式编码,无法直接被人类读取。要使其可用,需要解码智能合约调用、转换十六进制值,并将代币地址映射到可识别的名称。在交易量较高的第一层链和 Rollup 上,专门的索引网络和数据提供商会持续摄取新区块和事件,以便在无需每个机构都运行自己的完整索引栈的情况下,近乎实时地查询这些原始记录。
除了单一链之外,来自不同区块链的记录必须通过规范化架构、标记已知地址以及将活动组织成转账、交换或贷款等类别来进行标准化和丰富。这一处理流程将永久但晦涩的账本转化为公司和研究人员可以利用的信息。[5][6][1]
区块链的若干特性使得其数据在实践中难以处理。不同的区块链以不同的方式组织数据,因此在跨链比较活动之前,必须对格式进行标准化。
随着活动转移到许多第一层(layer-one)链、第二层(layer-two)网络和回滚(rollups)中,数据被碎片化为不同的格式和执行环境。索引器必须协调不同的事件模式、地址格式和桥接语义,以呈现连贯的跨链视图。新兴的数据可用性层和技术(如 以太坊 的 EIP-4844 数据 blob)改变了交易数据的存储位置和时长,这反过来又影响了历史记录的访问、重构和归档。[5][6]
智能合约隐藏了含义,因为它们的输出是经过编码的;解码去中心化交易所 (DEX) 上的交换或借贷清算需要了解所涉及合约的具体结构。地址是伪匿名字符串而非名称,因此确定哪些地址属于哪些实体需要持续的研究和判断。[1][2]
另一个复杂因素是某些区块链会重组最近的区块。由于这些重组以及达成最终性的方式,数据管道必须考虑到最近的区块可能会发生变化的可能性,从而避免将瞬时数据作为最终数据进行报告。
将最近的、未确认的数据视为已结算可能会产生随后发生变化的数字,这对于结算或报告目的来说是危险的。这些最终性假设,结合编码的合约输出和伪匿名寻址,是原始链上数据难以直接使用的主要原因。[1]
准确的链上数据实现了依赖于可验证、共享记录的多种功能。它允许更快的对账,因为结算 稳定币 支付的公司可以直接根据账本确认收款,而无需等待中间机构。
它支持实时风险监控,让参与者能够实时观察 抵押品 比率的变化。它提供了可审计的报告,因为持有代币化资产的基金可以指向区块链作为其持仓的证明。它还允许进行可验证的研究,因为当基础数据公开时,学者可以重现研究结果。[1] 例如,在 去中心化金融 (DeFi) 中,跟踪流动性、杠杆 和 清算 级联的仪表板是直接根据合约事件和资金池余额构建的。代币化国债和其他现实世界资产平台依靠同样独立可验证的记录来显示哪些钱包持有特定工具,以及这些持仓随时间的变化。合规和取证团队通过追踪原始转账和合约交互来重建资金流向、监控制裁风险并调查黑客攻击,而新兴的 人工智能代理 (AI agents) 和自动化应用程序则利用这些链上背景信息,根据账本状态而非私有数据源来触发再平衡、支付或治理投票等操作。
链上数据的用户涵盖了金融、技术和公共机构。银行和支付公司使用它来跟踪 稳定币 结算并证明资金去向。资产管理公司使用它来报告代币化持仓。钱包和金融科技产品使用它来丰富用户体验。研究人员使用它来对市场进行基准测试,监管机构则使用它来监控整个金融系统的系统性风险。[4] 合规提供商和执法机构将链上记录视为调查的核心输入,而开发 AI 增强型钱包或交易系统的开发人员则将链上状态作为可信信号与其他数据源结合使用。
一些钱包和分析产品提供了涵盖数千万个钱包的链上背景信息。[1]
链上数据的价值受到若干局限性的制约。
首先是解释风险:账本记录的是已发生的事实,而非意图,且地址标签是一种主观判断,不同的服务商可能会有不同的见解。
其次是隐私冲突,因为完全的透明度意味着交易历史是永久公开的,这对于期望财务隐私的人来说可能感到不安。新的隐私保护设计,包括零知识证明和选择性披露方案,旨在隐藏敏感细节的同时仍允许验证,但其长期有效性、可用性以及监管待遇仍是开放性问题。[7]
第三是链下盲点,因为在链下结算或依赖中心化中介的活动不会出现在链上数据中,即使这些活动会影响市场。[1] 利用零知识证明和预言机将链下状态摘要提交至账本的实验可以缩小这一差距,但无法完全消除。
另外两个问题涉及完整性和时效性。
碎片化问题的产生是因为活动分散在许多区块链和二层网络中,因此单链视角可能会误导市场的真实规模。最终性假设则带来了相关的危险:将近期、未确认的数据视为最终结果可能会产生随后发生变化的数据,这对于结算或报告来说是一个特别的风险。
总而言之,链上数据是公共区块链上共享且可验证的活动记录,其价值取决于原始记录能否被准确读取、跨链标准化并以可操作的形式交付。调查人员、法院和监管机构越来越多地将底层链上记录视为治理纠纷和执法行动的主要证据,但他们必须将这些原始条目与叠加在其上的第三方标签和解释区分开来。[4]
2026年9月12日。20:49 UTC
编辑摘要:
Expand and summarize On-Chain Data wiki (+401 words)