数据不是石油(系列四篇)

science

左边是抽油机和输油管,管口飘出的光点汇成一个发光的圆环,环上有培养皿、DNA 双螺旋和网络节点

第一篇|数据不是石油

2006年,英国数学家克莱夫·亨比(Clive Humby)说了一句后来被反复引用的话:数据是新的石油。亨比是英国超市乐购会员卡体系的设计者。这句话后来常被接上一段补充:数据和原油一样有价值,但不经过提炼就派不上用场。十一年后,《经济学人》在2017年5月以“世界上最有价值的资源不再是石油,而是数据”为题做了一期专题,这个比喻从此成了科技行业的常识。

这个比喻说对了一半。说对的那一半,是数据确实值钱,确实需要加工,掌握数据的公司也确实像当年的石油巨头一样引来了反垄断的目光。有可能说错的那一半更要紧:如果按照石油的逻辑来做数据生意,开采、精炼、按量出售,就会选错商业模式。这个系列想讨论的,正是这被说错的一半。

七个差别

把数据和石油放在一起逐项比较,差别之处很多。

维度 石油 数据 对商业模式的含义
消耗性 烧掉就没了,一桶油只能卖给一个人 可以复制、反复使用,同一份数据可以同时给很多人用 按量卖不划算,买方复制的成本几乎为零
同质性 标准化,可以按桶定价 千差万别,价值取决于和什么数据组合、用来回答什么问题 没有统一价格,很难形成流动的市场
验货 看过、化验过,油还在 要判断数据值多少钱就得先看到它,看到了价值也就被拿走了 交易前的验证机制比报价更重要
用完之后 燃烧后变成能量和废气 训练进模型后,价值沉淀在参数里,数据方收不回来 一次性授权等于把长期价值打包贱卖
产权 矿权清楚 牵涉患者、医院、平台等多方,隐私和合规边界模糊 需要“数据不动、模型动”的技术和合约安排
稀缺性 地质储量有限 公开的高质量文本正在被用完,但数据可以被主动制造出来 最有价值的数据越来越多是按需生成的
时效 放多久都是油 会过时,分布会漂移 需要持续供给,而不是一次交割

头一条差别最根本。经济学家查尔斯·琼斯(Charles Jones)和克里斯托弗·托内蒂(Christopher Tonetti)在2020年的一篇论文里专门讨论过数据的非竞争性:一个人的位置记录、病历或驾驶数据,可以同时被很多家公司使用而不会损耗。他们的结论是,即使把隐私成本考虑进去,数据被更广泛地使用往往也能带来可观的社会收益;而企业担心被竞争对手超越,可能会把数据囤在自己手里,造成低效。石油恰恰相反,一桶油给了你就不能再给别人,“占有”本身就是价值所在。

第三条和第四条合在一起,是数据交易最尴尬的地方。买方想先看看数据好不好,卖方担心一看价值就没了;成交之后,数据被训练进模型,卖方再也收不回来。这两个问题决定了数据很难像石油那样一手交钱一手交货,下一篇会专门展开。

石油越采越少,数据可以造出来

第六条差别最有意思,也最容易被忽略。

就公开数据而言,“新石油”这个比喻似乎越来越贴切了。研究机构Epoch AI估计,互联网上可用于训练的高质量人类文本大约有300万亿个词元,按目前的趋势,大模型会在2026年到2032年之间把它们用完。有人寄希望于用模型生成的合成数据来填补缺口,但2024年发表在《自然》上的一项研究发现,如果不加甄别地用上一代模型生成的内容来训练下一代模型,模型会出现不可逆的缺陷,原始数据中那些少见的信息最先消失。也有研究指出,只要持续保留并累积真实数据,而不是用合成数据替换它们,这种退化可以得到控制。无论哪种结论,真实数据的稀缺都在加剧,公开数据确实像一口正在见底的油井。

可是在科学领域,情况完全不同。生物医药里最有价值的数据,大多不是躺在哪里等人去采的存量,而是做实验做出来的:给细胞加一种化合物、敲掉一个基因、换一种培养条件,就会产生一批新数据。而且,这些数据的价值高度依赖于“问了什么问题”。随机做一万个实验,得到的信息可能不如模型挑出来的一百个关键实验多。

这就引出了数据和石油之间最深的一道分界线。石油的价值在地下就已经确定了,开采只是把它拿出来。数据的价值很大一部分是在使用过程中被创造出来的:模型提出问题,实验生成数据,数据修正模型,模型再提出更好的问题。谁掌握了这个循环,谁就掌握了价值。

比喻错在哪里

如果只用一句话概括这个系列的判断,那就是:石油的价值在开采和销售时一次性兑现,数据的价值要在反复使用和持续回流中才能兑现。

按石油的逻辑设计的数据生意,天然有一个天花板。卖方只能在交割那一刻拿到钱,此后数据在买方手里创造的所有价值都与他无关,所以他一定会在交割时要高价;买方在交割时还不知道这份数据能带来什么,所以一定会压价。双方的担心都很合理,结果就是很多本该发生的交易没有发生,发生了的交易也往往让一方觉得吃了亏。

接下来三篇依次讨论三件事:为什么数据在一开始几乎无法定价;石油业自己是怎样走出类似困境的;以及有哪些现成的商业模式,可以借来打破今天数据交易的僵局。

第二篇|数据为什么在一开始无法定价

在数据交易的谈判桌上,常见的场面是这样的:数据方开出一个高价,理由是这批数据花了多年时间和大量资金才攒起来;模型公司拿不出那么多钱,也说不清这批数据到底能带来多少提升,只能压价;来回几轮,要么不欢而散,要么签一个双方都不太满意的固定价格。一个怕买亏,一个怕卖亏。

我的看法是,这种僵局不是谈判技巧的问题。在签约的那一刻,数据的“正确价格”本来就不存在。原因至少有四个。

价值要走很长的路才能兑现

以生物医药为例。一批数据要先训练模型,模型给出预测,预测变成假说,假说经过实验筛出候选分子,候选分子再走完临床前研究和三期临床,最后才可能变成一款上市的药,产生收入。这条路通常要走十年以上,而且进入临床的项目最终只有约一成能获批。

换句话说,数据在签约时的价值,是一张兑奖日期远在十年之后、中奖概率很低、奖金大小也不确定的彩票。更麻烦的是,就算最后中了奖,也很难说清这张彩票里有多少是这批数据的功劳,有多少是模型、实验团队、临床设计和运气的功劳。

双方各握着一半信息

卖方最清楚数据的底细:样本怎么来的,质量如何,哪里有缺陷。买方最清楚这批数据对自己有多大用:这取决于他手里已经有哪些数据,模型缺的是哪一块,要解决的又是什么问题。双方都掌握着对方看不到的关键信息,而且都有动机不完全说实话,卖方会夸大数据质量,买方会低估数据对自己的用处。

经济学里有一个经典结论专门讨论这种局面。1983年,罗杰·迈尔森(Roger Myerson)和马克·萨特思韦特(Mark Satterthwaite)证明:当买卖双方各自私下知道自己的估值,而且谁的估值更高事先无法确定时,不存在一种交易机制能同时做到四件事:双方都愿意参与,双方都有动机说真话,不需要外部补贴,以及所有对双方都有利的交易都能成交。这意味着,只要不引入外部资金,无论怎么设计谈判规则,总会有一部分本该成交的交易谈不成。

所以“一个怕买亏、一个怕卖亏”不只是心态问题,更是结构问题。只要双方必须在信息不对称的情况下一次性敲定价格,就总会有一部分交易流产。

看了就不必买,买了就收不回

1962年,肯尼斯·阿罗(Kenneth Arrow)指出了信息商品的一个根本矛盾:买方要评估信息值多少钱,就得先知道信息的内容,而一旦知道了内容,他就不必再付钱了。数据完全符合这个描述。卖方不可能把数据全部交给买方先试用,买方也不愿意为一批没见过的数据付高价。

到了大模型时代,这个矛盾又多了一层。数据一旦被训练进模型,它的价值就沉淀在了模型参数里,卖方无法收回,也很难证明买方用了多少。卖方于是更倾向于在交割时一次性要高价,因为这可能是他唯一一次拿到钱的机会。

价值不能简单相加

同一批数据,对不同的买方价值可能相差几个数量级。如果买方手里已经有类似的数据,新数据的增量几乎为零;如果买方恰好缺这一块,它可能就是模型从不能用到能用的关键。数据的价值还会随组合变化,两批各自平平无奇的数据放在一起,可能产生单独看都没有的信息。

这意味着数据很难有统一的市场价格。石油可以在交易所里按桶挂牌,是因为每一桶油对每个买家都一样。数据做不到。

市场的现实

这四个困难在今天的市场上都有清晰的投影。

目前公开的大额数据交易,几乎都采用固定费用。OpenAI与新闻集团签下的五年协议据报道价值超过2.5亿美元,Reddit与谷歌的协议约为每年6000万美元。固定费用是买方封顶风险的办法:不管数据最后带来多少价值,我付的就是这么多。但这种安排已经开始松动,据报道,Reddit高管希望在与谷歌续约时改为按使用量收费。

国内的情况也差不多。据国家数据局的数据,2024年全国数据市场交易规模预计超过1600亿元,其中场内交易(含备案交易)超过300亿元,大部分交易仍是场外一对一谈判的结果。2024年起实施的数据资产入表规定,要求把符合条件的数据资源按无形资产或存货入账,初始计量采用的是历史成本,也就是采购价款、加工和登记等有明确依据的支出。收益法、市场法等估值方法只在资产评估中使用,进不了资产负债表。这很能说明问题:会计上能确认的,只是数据花了多少钱,而不是数据值多少钱。

还有一个更直观的例子。2018年,GSK向基因检测公司23andMe投资3亿美元,换取用其用户数据开发新药的合作。23andMe在2021年上市后,估值一度达到约60亿美元。2025年它申请破产,几乎全部资产最终以3.05亿美元被收购,其中最核心的就是1500多万用户的基因数据,成交价不到高峰估值的二十分之一。公司估值包含的远不止数据,但这个落差足以说明,同一批数据资产在不同时间、不同处境下,价格可以相差多么悬殊。

从“找到价格”到“设计合约”

如果数据在签约时根本没有正确的价格,那么努力寻找这个价格就是徒劳的。更有意义的问题是:能不能设计一种交易结构,让价格随着信息的逐步揭示而逐步确定?

具体来说,就是在数据还看不出价值的时候少付钱,在模型效果得到验证、候选分子进入临床、药物最终上市的时候,再按约定补付。这样,买方不必在一开始拿出一大笔钱,卖方也不必担心把长期价值一次性贱卖。

这种思路并不新鲜。石油业在二十世纪中叶就经历过一次类似的转变,而生物医药的授权交易早已把“按进展付钱”做成了行业惯例。下一篇先讲石油。

第三篇|石油业的五五分成时刻

今天的数据方所处的位置,很像二十世纪上半叶的产油国。手里握着宝贵的资源,却说不清它值多少钱,只能接受一次性或固定的报酬,眼看着资源在别人手里创造出巨大的价值。石油业用了大约半个世纪走出这种局面,这段历史值得数据行业仔细看一看。

特许权时代

二十世纪初到四十年代,中东和拉美的石油大多是在“特许权”制度下开采的。产油国把一大片土地的开采权长期授予外国石油公司,公司负责勘探、开采和销售,产油国主要按产量收取权利金。1933年,沙特把一片广阔区域的开采权授予美国加州标准石油公司,期限长达六十年;负责经营这片租借区的公司,后来更名为阿拉伯美国石油公司,也就是阿美。

这种安排在签约时并非全无道理。勘探风险极高,打了井不一定出油,产油国没有资金和技术,也不知道地下到底有多少油。石油公司承担风险,换取长期的开采权,产油国拿一笔确定的收入,看上去是一桩公平的买卖。

问题出在后来。随着大油田陆续被发现,石油的价值远远超出了签约时的想象,而产油国的收入仍然按照当年的固定标准计算。以伊朗为例,其权利金占石油出口价格的比例,从1933年的33%一路降到了1947年的9%。油田越来越值钱,资源的主人分到的份额却越来越小。

这和今天的数据交易何其相似:数据方在签约时不知道数据的价值,按固定价格授权出去,此后模型创造的全部价值都与他无关。

五五分成

转折发生在1948年。委内瑞拉率先确立了一条原则:石油公司在本国获得的利润,由公司与政府对半分。1950年12月30日,沙特与阿美公司签订了新协议,把同样的五五分成引入中东。协议的设计很巧妙:阿美原来缴纳的权利金照旧支付,但被当作一种预付款,抵扣新设立的50%所得税。靠着这个安排,沙特的石油收入几乎翻了两番。

之后的变化像多米诺骨牌一样展开。

年份 事件
1933 沙特向美国加州标准石油公司授予为期六十年的特许权
1948 委内瑞拉确立石油利润五五分成原则
1950 沙特与阿美签订五五分成协议
1951 伊朗长期要求英伊石油公司接受类似条件未果,议会通过法案将石油工业国有化;科威特、伊拉克也在前后一两年采纳了五五分成
1960 石油公司单方面下调标价后,委内瑞拉、沙特、伊朗、伊拉克、科威特在巴格达成立欧佩克
1971 德黑兰、的黎波里等协议把产油国的利润分成提高到约55%
1970年代 产油国通过参股逐步取得石油公司的所有权,沙特最终完全拥有了阿美

从固定权利金,到利润分成,再到参股乃至完全拥有,资源方一步步从出售原料的卖家,变成了分享利润、参与经营的合伙人。

是什么让分成成为可能

回头看,推动这场转变的有几股力量,每一股在数据行业里都能找到对应。

第一是信息的揭示。签约时没人知道地下有多少油,等到大油田陆续被发现,资源的价值变得清清楚楚,原有的固定报酬就显得越来越不合理。1950年沙特要求重新谈判时,理由之一就是阿美租借区里的石油资源远超预期。数据行业正在经历同样的过程:大模型的成功让所有人都看到了高质量数据的价值,一次性授权的价格开始显得太低。

第二是先例的传播。委内瑞拉的五五分成一旦成立,就成了所有产油国谈判时的参照。沙特签约后,美国国务院的内部文件就提到,这让伊朗觉得自己要求“委内瑞拉式”分成并非漫天要价。在数据领域,按使用分成的先例也在出现。美国新闻媒体联盟的2200多家会员可以选择加入与ProRata的协议,按照内容对AI回答的贡献分走平台一半的收入。

第三是账目的透明。伊朗与英伊石油公司的争执中,一个核心诉求是要求公司公开账目,否则分成无从谈起。数据分成同样依赖可审计的使用记录,谁用了多少、带来了什么结果,必须能够核查。

第四点最容易被忽略:分成能谈成,一个重要原因是有人帮忙分担了成本。沙特的五五分成被设计成所得税的形式,阿美可以用这笔税款抵扣它在美国应缴的税,公司实际多付的并不多,相当一部分成本由美国财政承担了。数据交易也需要这样的第三方:如果有金融机构愿意提前买下数据方未来的分成权,买方就不必在一开始拿出一大笔钱。上一篇提到的迈尔森-萨特思韦特定理,恰好也为此提供了理论注脚:外部资金的介入,正是让更多交易得以成交的条件之一。

数据和石油,在这里分道扬镳

不过,这段历史也有一处和数据截然不同,而且恰恰是最要紧的一处。

国际商务学者雷蒙德·弗农(Raymond Vernon)提出过“议价能力递减”的说法:外国公司一旦在东道国投下巨额的固定资产,就再也搬不走了,谈判筹码会逐渐从公司转向东道国。石油正是如此,油田、管道和炼厂都留在产油国的土地上,产油国随时可以要求重新谈判,甚至直接收归国有。

数据的情况正好反过来。数据一旦被训练进模型,就被带走了,数据方无法收回,也无法通过“关掉油井”来施压。签约之前,数据方的筹码最大;签约并交付之后,筹码几乎归零。

这意味着数据方不能指望像产油国那样,先签一个吃亏的合同,等价值显现后再回头重谈。所有关于分成、里程碑和使用计费的条款,都必须在数据交付之前谈定。从这个角度说,数据方需要的是一步到位的“五五分成”,而不是再走一遍从特许权到参股的五十年。

另一个不同是资源方的分散程度。石油资源集中在少数几个国家手里,它们可以联合起来组建欧佩克。数据则分散在成千上万家医院、研究机构和平台手里,单个数据方的议价能力很弱。新闻出版业的做法提供了一个方向:通过行业联盟集体谈判,统一接入分成协议。医疗和生物数据领域也许需要类似的联合体。

我们正站在哪一步

对照石油业的历史,今天的数据交易大体还处在特许权时代:固定费用、一次性授权,数据交付后价值全归买方。但五五分成时刻的迹象已经出现,有按使用分成的内容平台,有提供数据的医疗系统以股东身份参与分配的健康数据公司,也有希望在续约时改为按使用计费的社交平台。

石油业从特许权走到分成,靠的是信息揭示、先例传播、账目透明和第三方分担成本。数据行业要走出固定费用时代,这四样东西一样都少不了,而且因为数据交付后筹码归零,必须在交易设计的一开始就把它们装进合同里。下一篇讨论具体该怎么装。

第四篇|九种可以借来的商业模式

前三篇的结论可以归结为一句话:数据在交易时没有正确的价格,所以出路不是算出一个价格,而是设计一种让价格随信息逐步确定的合约。好消息是,这样的合约不需要从零发明。生物医药授权、并购、金融、媒体和音乐产业,早就在处理“价值不确定、兑现又很慢”的资产,积累了一整套成熟的工具。

数据交易的僵局,可以拆成三个具体的问题:买方现在拿不出那么多钱;双方都不敢先定价;数据的价值要在很长时间里持续产生,一次性结算注定不公平。九种可借鉴的模式,正好分别对应这三个问题。

第一类:买方现在拿不出钱

首付款、里程碑付款加销售分成。这是生物医药授权交易的标准结构,天生适合价值兑现慢的资产。以AI制药为例,Isomorphic与礼来的合作中,首付款4500万美元,按研发进展支付的里程碑款最高17亿美元,此外还有最高到两位数低段的销售分成。首付款不到潜在总额的3%,绝大部分价值押在了未来。这套结构目前主要用于AI平台和候选分子的交易,在公开披露的数据授权交易中还很少见到,但道理完全相通:小额首付,按模型效果、管线进展和最终销售分期付款。

数据换股权。数据方不收现金,而是成为股东。2018年GSK向23andMe投资3亿美元,双方同时约定平摊药物研发的成本和利润,数据方既拿到了股权,也拿到了产品层面的分成。Truveta走得更远:17家医疗系统与Illumina、Regeneron共同出资3.2亿美元认购其优先股,估值超过10亿美元。提供数据的医疗系统本身就是股东,数据方、研究者和药企的利益因此被绑在了一起。

第三方提前买断未来收益。药物领域有专门收购特许权使用费的基金,矿业有“流量融资”:金融机构先付一笔钱,换取未来一定比例的产出或收入。这套办法可以直接移植到数据上。数据方把未来的里程碑款和分成权卖给金融机构,提前拿到现金;买方则不必在一开始支付高额首付。上一篇提到,沙特的五五分成能谈成,一个重要原因是美国财政实际上分担了一部分成本,第三方资金在数据交易里可以扮演类似的角色。这种“数据特许权基金”目前还没有成型的先例,是我认为值得有人去做的一件事。

第二类:双方都不敢先定价

期权式授权。买方先付一笔小额期权费,换取一段时间的独家评估权,同时提前约定行权时的价格和条款。评估期内,数据的价值逐渐清楚,买方再决定是否行权。这在生物技术授权中很常见,用在数据上,可以把“先定价”变成“先评估”。

先测增益,再按效果付费。在隐私计算环境里,让买方的模型在不接触原始数据的情况下训练,实测加入这批数据后模型提升了多少,再按提升幅度付费。这和广告业从按展示付费转向按点击、按转化付费是同一个逻辑:不为可能的价值付钱,只为测得到的效果付钱。技术上已经有过大规模验证。2019年到2022年的MELLODDY项目中,十家互为竞争对手的药企在不共享数据的前提下联合训练模型,动用了超过26亿个保密的实验数据点,每一家的预测模型在整体上都获得了提升。

对赌和或有价值权。并购中,买卖双方对估值谈不拢时,常用对赌条款或者或有价值权:先按保守价格成交,未来达到约定目标再补付。数据交易可以照此约定:如果基于这批数据的项目进入某个临床阶段,买方补付一笔钱。

第三类:价值要持续分配

按使用分成。ProRata的做法是用归因技术计算每家出版商的内容对某个AI回答的贡献,按次把平台一半的收入分给内容方。Truveta的思路也类似,据其创始人介绍,这个模式得以持续的关键,是每当去标识化的数据被他人使用时,就向医疗系统和测序方支付报酬。音乐版权的集体管理和流媒体的收入池分配,是这类模式更早、更成熟的前辈。

按时间窗口定价。UK Biobank的外显子测序联合体是一个很好的例子。2018年,在Regeneron牵头下,首批五家药企各出资1000万美元,让50万名参与者的测序提前三年完成;作为回报,出资方享有6到12个月的独家使用期,之后数据回归数据库,向全球研究者开放。这相当于影视业的窗口期:首映期卖高价,之后逐步扩大发行。它巧妙地绕开了“数据值多少钱”这个难题,改为给“比别人早用一段时间”定价。

数据换模型。Tempus与阿斯利康、Pathos在2025年签下的三年期协议是非独家的,模型建成后三方各得一份副本,大部分算力成本由后两家承担,Tempus还获得了2亿美元的数据授权和模型开发费。数据方拿到的不只是现金,还有一个能反哺自身业务的模型,并保留了继续把数据授权给他人的权利。

把九种模式拼起来

这些模式并不互斥。组合起来,可以得到一个适合生物医药数据交易的分层结构,每一层对应价值链上的一个信息揭示点。

层级 触发条件 付款形式 解决的问题 借鉴自
评估 在隐私计算环境中实测模型增益 小额评估费 看了就不必买 按效果付费的广告
期权 买方要求独家评估期 期权费,锁定后续条款 双方都不敢先定价 生物技术期权授权
模型里程碑 模型达到约定的基准提升 分期付款 买方首付能力有限 药物授权里程碑
管线里程碑 靶点验证、确定候选分子、申报临床、进入二期 分期付款 价值兑现慢 药物授权里程碑、对赌
长期分成 产品上市或模型产生商业收入 销售分成或收入分成,多个数据源按归因池分配 价值持续产生 特许权使用费、按使用分成

在这个结构上还可以叠加两个选项:一是部分对价用股权支付,让数据方成为长期利益相关者;二是数据方可以把管线里程碑和长期分成的权利卖给金融机构,提前变现。

回到开头那个谈判桌上的僵局。在这个结构下,买方在最不确定的阶段只需要付评估费和期权费,不必一开始就押上一大笔钱;卖方虽然前期拿得少,但保留了分享后续全部价值的权利,不用担心把长期价值一次性贱卖。价格没有在签约时被确定,而是随着模型效果、临床进展和上市销售,一层一层地兑现。

让它跑起来的条件

这个方案要真正落地,有四个前提。

第一,所有条款必须在数据交付之前谈定。上一篇讲过,数据一旦训练进模型就收不回来,数据方的议价能力在交付那一刻几乎归零,事后补谈基本没有筹码。

第二,使用必须可以审计。按使用分成和按里程碑付款,都依赖对数据使用情况和项目进展的可靠记录。就像产油国要求石油公司公开账目一样,数据方也需要一套可以核查的使用和溯源机制。

第三,归因方法要务实。精确计算每一份数据对模型贡献的方法,比如基于博弈论的Shapley值,理论上最公平,但精确计算量随数据方数量呈指数增长,实际只能近似,也有研究指出这类估值可能被策略性地操纵。早期不如采用简单透明的规则,比如按数据量和质量等级加权,放进收益池里统一分配,等方法成熟了再逐步细化。

第四,要防范对手方风险。十年的回报周期里,任何一方都可能出变故。23andMe就是一个例子:与GSK的独家研究期在2023年7月结束后,其研究服务收入随之下降,两年后公司申请破产,数据最终在拍卖中易主。长期付款安排需要托管、担保或权利质押来保障,否则“分享未来价值”的承诺可能落空。

最后

“数据是新石油”这个比喻流行了快二十年,它最大的误导,是让人以为数据生意就是开采和出售。石油业自己用了半个世纪才明白,资源方真正的出路是分享利润、参与经营,而不是卖得更贵。数据行业不需要再花五十年,所需的工具早已在生物医药授权、并购、金融和版权产业里各自成熟,缺的只是把它们拼在一起,并且在数据交付之前就写进合同。

对于正在谈数据合作的双方来说,也许可以换一个问题来开场:与其争论这批数据值多少钱,不如先商量,当它的价值一点点显现出来的时候,我们打算怎么分。

参考文献

第一篇

  1. Clive Humby,关于2006年“数据是新石油”一语;“不经提炼就无法使用”的补充常被认为出自后来的引申.
  2. The Economist. The world’s most valuable resource is no longer oil, but data. May 2017.
  3. Charles I. Jones & Christopher Tonetti. Nonrivalry and the Economics of Data. American Economic Review, 110(9), 2020.
  4. Pablo Villalobos et al. Will we run out of data? Limits of LLM scaling based on human-generated data. ICML 2024(报道见 AP / VOA;估算数据见 Epoch AI 分析摘要).
  5. Ilia Shumailov et al. AI models collapse when trained on recursively generated data. Nature, 631, 2024;不同观点见 Matthias Gerstgrasser et al. Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data. arXiv:2404.01413, 2024.

第二篇

  1. Eric Vallabh Minikel et al. Refining the impact of genetic evidence on clinical success. Nature, 629, 2024.
  2. Roger B. Myerson & Mark A. Satterthwaite. Efficient mechanisms for bilateral trading. Journal of Economic Theory, 29(2), 1983.
  3. Kenneth J. Arrow. Economic Welfare and the Allocation of Resources for Invention. In The Rate and Direction of Inventive Activity, Princeton University Press, 1962.
  4. AI训练数据授权交易价格汇总,Quartz,2026.
  5. Reddit Weighs Cutting Google AI Access as $60M Deal Expires,据《华尔街日报》报道.
  6. 2024年全国数据市场交易规模超1600亿元,国家数据局在全国数据工作会议上的数据.
  7. 财政部.《企业数据资源相关会计处理暂行规定》,2024年1月1日起施行;关于初始计量采用历史成本,见中伦律师事务所解读.
  8. 23andMe;23andMe 破产案梳理.

第三篇

  1. International Petroleum Agreements: Politics, oil prices steer evolution of deal forms,Oil & Gas Journal.
  2. Foreign Relations of the United States, 1951, Vol. V,关于1950年沙特与阿美的新协议.
  3. The Anglo-Iranian Oil Company, 1951: Britain vs. Iran,Seven Pillars Institute.
  4. Saudi Arabian Oil: The Obsolescing Bargaining Model,Becker,2018.
  5. The History of Saudi Arabian Oil,关于五五分成的税收抵扣安排.
  6. Posted oil price,关于欧佩克成立与1971年分成比例调整.
  7. Raymond Vernon. Sovereignty at Bay: The Multinational Spread of U.S. Enterprises. Basic Books, 1971.
  8. News/Media Alliance, ProRata AI Sign Content Licensing Deal,MediaPost.

第四篇

  1. Lilly, Novartis sign AI partnership with Alphabet’s Isomorphic,PharmaLive,2024.
  2. 23andMe Gets $300 Million Boost From GlaxoSmithKline,Bio-IT World,2018.
  3. Leading US health systems launch the Truveta Genome Project,2025;GeekWire 报道.
  4. Wouter Heyndrickx et al. MELLODDY: Cross-pharma Federated Learning at Unprecedented Scale Unlocks Benefits in QSAR without Compromising Proprietary Information. Journal of Chemical Information and Modeling, 2024.
  5. ProRata Invents Generative AI Attribution Technology,Business Wire,2024.
  6. Regeneron announces major collaboration to exome sequence UK Biobank,UK Biobank,2018;独家期限见 GenomeWeb.
  7. Tempus Signs Expanded Strategic Agreements with AstraZeneca and Pathos,2025;协议细节见 Benzinga.
  8. Anne Wojcicki will acquire 23andMe for $305M following bankruptcy,MobiHealthNews,2025.
  9. Amirata Ghorbani & James Zou. Data Shapley: Equitable Valuation of Data for Machine Learning. ICML 2019.