数据不是石油(系列四篇)
science
第一篇|数据不是石油
2006年,英国数学家克莱夫·亨比(Clive Humby)说了一句后来被反复引用的话:数据是新的石油。亨比是英国超市乐购会员卡体系的设计者。这句话后来常被接上一段补充:数据和原油一样有价值,但不经过提炼就派不上用场。十一年后,《经济学人》在2017年5月以“世界上最有价值的资源不再是石油,而是数据”为题做了一期专题,这个比喻从此成了科技行业的常识。
这个比喻说对了一半。说对的那一半,是数据确实值钱,确实需要加工,掌握数据的公司也确实像当年的石油巨头一样引来了反垄断的目光。有可能说错的那一半更要紧:如果按照石油的逻辑来做数据生意,开采、精炼、按量出售,就会选错商业模式。这个系列想讨论的,正是这被说错的一半。
七个差别
把数据和石油放在一起逐项比较,差别之处很多。
| 维度 | 石油 | 数据 | 对商业模式的含义 |
|---|---|---|---|
| 消耗性 | 烧掉就没了,一桶油只能卖给一个人 | 可以复制、反复使用,同一份数据可以同时给很多人用 | 按量卖不划算,买方复制的成本几乎为零 |
| 同质性 | 标准化,可以按桶定价 | 千差万别,价值取决于和什么数据组合、用来回答什么问题 | 没有统一价格,很难形成流动的市场 |
| 验货 | 看过、化验过,油还在 | 要判断数据值多少钱就得先看到它,看到了价值也就被拿走了 | 交易前的验证机制比报价更重要 |
| 用完之后 | 燃烧后变成能量和废气 | 训练进模型后,价值沉淀在参数里,数据方收不回来 | 一次性授权等于把长期价值打包贱卖 |
| 产权 | 矿权清楚 | 牵涉患者、医院、平台等多方,隐私和合规边界模糊 | 需要“数据不动、模型动”的技术和合约安排 |
| 稀缺性 | 地质储量有限 | 公开的高质量文本正在被用完,但数据可以被主动制造出来 | 最有价值的数据越来越多是按需生成的 |
| 时效 | 放多久都是油 | 会过时,分布会漂移 | 需要持续供给,而不是一次交割 |
头一条差别最根本。经济学家查尔斯·琼斯(Charles Jones)和克里斯托弗·托内蒂(Christopher Tonetti)在2020年的一篇论文里专门讨论过数据的非竞争性:一个人的位置记录、病历或驾驶数据,可以同时被很多家公司使用而不会损耗。他们的结论是,即使把隐私成本考虑进去,数据被更广泛地使用往往也能带来可观的社会收益;而企业担心被竞争对手超越,可能会把数据囤在自己手里,造成低效。石油恰恰相反,一桶油给了你就不能再给别人,“占有”本身就是价值所在。
第三条和第四条合在一起,是数据交易最尴尬的地方。买方想先看看数据好不好,卖方担心一看价值就没了;成交之后,数据被训练进模型,卖方再也收不回来。这两个问题决定了数据很难像石油那样一手交钱一手交货,下一篇会专门展开。
石油越采越少,数据可以造出来
第六条差别最有意思,也最容易被忽略。
就公开数据而言,“新石油”这个比喻似乎越来越贴切了。研究机构Epoch AI估计,互联网上可用于训练的高质量人类文本大约有300万亿个词元,按目前的趋势,大模型会在2026年到2032年之间把它们用完。有人寄希望于用模型生成的合成数据来填补缺口,但2024年发表在《自然》上的一项研究发现,如果不加甄别地用上一代模型生成的内容来训练下一代模型,模型会出现不可逆的缺陷,原始数据中那些少见的信息最先消失。也有研究指出,只要持续保留并累积真实数据,而不是用合成数据替换它们,这种退化可以得到控制。无论哪种结论,真实数据的稀缺都在加剧,公开数据确实像一口正在见底的油井。
可是在科学领域,情况完全不同。生物医药里最有价值的数据,大多不是躺在哪里等人去采的存量,而是做实验做出来的:给细胞加一种化合物、敲掉一个基因、换一种培养条件,就会产生一批新数据。而且,这些数据的价值高度依赖于“问了什么问题”。随机做一万个实验,得到的信息可能不如模型挑出来的一百个关键实验多。
这就引出了数据和石油之间最深的一道分界线。石油的价值在地下就已经确定了,开采只是把它拿出来。数据的价值很大一部分是在使用过程中被创造出来的:模型提出问题,实验生成数据,数据修正模型,模型再提出更好的问题。谁掌握了这个循环,谁就掌握了价值。
比喻错在哪里
如果只用一句话概括这个系列的判断,那就是:石油的价值在开采和销售时一次性兑现,数据的价值要在反复使用和持续回流中才能兑现。
按石油的逻辑设计的数据生意,天然有一个天花板。卖方只能在交割那一刻拿到钱,此后数据在买方手里创造的所有价值都与他无关,所以他一定会在交割时要高价;买方在交割时还不知道这份数据能带来什么,所以一定会压价。双方的担心都很合理,结果就是很多本该发生的交易没有发生,发生了的交易也往往让一方觉得吃了亏。
接下来三篇依次讨论三件事:为什么数据在一开始几乎无法定价;石油业自己是怎样走出类似困境的;以及有哪些现成的商业模式,可以借来打破今天数据交易的僵局。
第二篇|数据为什么在一开始无法定价
在数据交易的谈判桌上,常见的场面是这样的:数据方开出一个高价,理由是这批数据花了多年时间和大量资金才攒起来;模型公司拿不出那么多钱,也说不清这批数据到底能带来多少提升,只能压价;来回几轮,要么不欢而散,要么签一个双方都不太满意的固定价格。一个怕买亏,一个怕卖亏。
我的看法是,这种僵局不是谈判技巧的问题。在签约的那一刻,数据的“正确价格”本来就不存在。原因至少有四个。
价值要走很长的路才能兑现
以生物医药为例。一批数据要先训练模型,模型给出预测,预测变成假说,假说经过实验筛出候选分子,候选分子再走完临床前研究和三期临床,最后才可能变成一款上市的药,产生收入。这条路通常要走十年以上,而且进入临床的项目最终只有约一成能获批。
换句话说,数据在签约时的价值,是一张兑奖日期远在十年之后、中奖概率很低、奖金大小也不确定的彩票。更麻烦的是,就算最后中了奖,也很难说清这张彩票里有多少是这批数据的功劳,有多少是模型、实验团队、临床设计和运气的功劳。
双方各握着一半信息
卖方最清楚数据的底细:样本怎么来的,质量如何,哪里有缺陷。买方最清楚这批数据对自己有多大用:这取决于他手里已经有哪些数据,模型缺的是哪一块,要解决的又是什么问题。双方都掌握着对方看不到的关键信息,而且都有动机不完全说实话,卖方会夸大数据质量,买方会低估数据对自己的用处。
经济学里有一个经典结论专门讨论这种局面。1983年,罗杰·迈尔森(Roger Myerson)和马克·萨特思韦特(Mark Satterthwaite)证明:当买卖双方各自私下知道自己的估值,而且谁的估值更高事先无法确定时,不存在一种交易机制能同时做到四件事:双方都愿意参与,双方都有动机说真话,不需要外部补贴,以及所有对双方都有利的交易都能成交。这意味着,只要不引入外部资金,无论怎么设计谈判规则,总会有一部分本该成交的交易谈不成。
所以“一个怕买亏、一个怕卖亏”不只是心态问题,更是结构问题。只要双方必须在信息不对称的情况下一次性敲定价格,就总会有一部分交易流产。
看了就不必买,买了就收不回
1962年,肯尼斯·阿罗(Kenneth Arrow)指出了信息商品的一个根本矛盾:买方要评估信息值多少钱,就得先知道信息的内容,而一旦知道了内容,他就不必再付钱了。数据完全符合这个描述。卖方不可能把数据全部交给买方先试用,买方也不愿意为一批没见过的数据付高价。
到了大模型时代,这个矛盾又多了一层。数据一旦被训练进模型,它的价值就沉淀在了模型参数里,卖方无法收回,也很难证明买方用了多少。卖方于是更倾向于在交割时一次性要高价,因为这可能是他唯一一次拿到钱的机会。
价值不能简单相加
同一批数据,对不同的买方价值可能相差几个数量级。如果买方手里已经有类似的数据,新数据的增量几乎为零;如果买方恰好缺这一块,它可能就是模型从不能用到能用的关键。数据的价值还会随组合变化,两批各自平平无奇的数据放在一起,可能产生单独看都没有的信息。
这意味着数据很难有统一的市场价格。石油可以在交易所里按桶挂牌,是因为每一桶油对每个买家都一样。数据做不到。
市场的现实
这四个困难在今天的市场上都有清晰的投影。
目前公开的大额数据交易,几乎都采用固定费用。OpenAI与新闻集团签下的五年协议据报道价值超过2.5亿美元,Reddit与谷歌的协议约为每年6000万美元。固定费用是买方封顶风险的办法:不管数据最后带来多少价值,我付的就是这么多。但这种安排已经开始松动,据报道,Reddit高管希望在与谷歌续约时改为按使用量收费。
国内的情况也差不多。据国家数据局的数据,2024年全国数据市场交易规模预计超过1600亿元,其中场内交易(含备案交易)超过300亿元,大部分交易仍是场外一对一谈判的结果。2024年起实施的数据资产入表规定,要求把符合条件的数据资源按无形资产或存货入账,初始计量采用的是历史成本,也就是采购价款、加工和登记等有明确依据的支出。收益法、市场法等估值方法只在资产评估中使用,进不了资产负债表。这很能说明问题:会计上能确认的,只是数据花了多少钱,而不是数据值多少钱。
还有一个更直观的例子。2018年,GSK向基因检测公司23andMe投资3亿美元,换取用其用户数据开发新药的合作。23andMe在2021年上市后,估值一度达到约60亿美元。2025年它申请破产,几乎全部资产最终以3.05亿美元被收购,其中最核心的就是1500多万用户的基因数据,成交价不到高峰估值的二十分之一。公司估值包含的远不止数据,但这个落差足以说明,同一批数据资产在不同时间、不同处境下,价格可以相差多么悬殊。
从“找到价格”到“设计合约”
如果数据在签约时根本没有正确的价格,那么努力寻找这个价格就是徒劳的。更有意义的问题是:能不能设计一种交易结构,让价格随着信息的逐步揭示而逐步确定?
具体来说,就是在数据还看不出价值的时候少付钱,在模型效果得到验证、候选分子进入临床、药物最终上市的时候,再按约定补付。这样,买方不必在一开始拿出一大笔钱,卖方也不必担心把长期价值一次性贱卖。
这种思路并不新鲜。石油业在二十世纪中叶就经历过一次类似的转变,而生物医药的授权交易早已把“按进展付钱”做成了行业惯例。下一篇先讲石油。
第三篇|石油业的五五分成时刻
今天的数据方所处的位置,很像二十世纪上半叶的产油国。手里握着宝贵的资源,却说不清它值多少钱,只能接受一次性或固定的报酬,眼看着资源在别人手里创造出巨大的价值。石油业用了大约半个世纪走出这种局面,这段历史值得数据行业仔细看一看。
特许权时代
二十世纪初到四十年代,中东和拉美的石油大多是在“特许权”制度下开采的。产油国把一大片土地的开采权长期授予外国石油公司,公司负责勘探、开采和销售,产油国主要按产量收取权利金。1933年,沙特把一片广阔区域的开采权授予美国加州标准石油公司,期限长达六十年;负责经营这片租借区的公司,后来更名为阿拉伯美国石油公司,也就是阿美。
这种安排在签约时并非全无道理。勘探风险极高,打了井不一定出油,产油国没有资金和技术,也不知道地下到底有多少油。石油公司承担风险,换取长期的开采权,产油国拿一笔确定的收入,看上去是一桩公平的买卖。
问题出在后来。随着大油田陆续被发现,石油的价值远远超出了签约时的想象,而产油国的收入仍然按照当年的固定标准计算。以伊朗为例,其权利金占石油出口价格的比例,从1933年的33%一路降到了1947年的9%。油田越来越值钱,资源的主人分到的份额却越来越小。
这和今天的数据交易何其相似:数据方在签约时不知道数据的价值,按固定价格授权出去,此后模型创造的全部价值都与他无关。
五五分成
转折发生在1948年。委内瑞拉率先确立了一条原则:石油公司在本国获得的利润,由公司与政府对半分。1950年12月30日,沙特与阿美公司签订了新协议,把同样的五五分成引入中东。协议的设计很巧妙:阿美原来缴纳的权利金照旧支付,但被当作一种预付款,抵扣新设立的50%所得税。靠着这个安排,沙特的石油收入几乎翻了两番。
之后的变化像多米诺骨牌一样展开。
| 年份 | 事件 |
|---|---|
| 1933 | 沙特向美国加州标准石油公司授予为期六十年的特许权 |
| 1948 | 委内瑞拉确立石油利润五五分成原则 |
| 1950 | 沙特与阿美签订五五分成协议 |
| 1951 | 伊朗长期要求英伊石油公司接受类似条件未果,议会通过法案将石油工业国有化;科威特、伊拉克也在前后一两年采纳了五五分成 |
| 1960 | 石油公司单方面下调标价后,委内瑞拉、沙特、伊朗、伊拉克、科威特在巴格达成立欧佩克 |
| 1971 | 德黑兰、的黎波里等协议把产油国的利润分成提高到约55% |
| 1970年代 | 产油国通过参股逐步取得石油公司的所有权,沙特最终完全拥有了阿美 |
从固定权利金,到利润分成,再到参股乃至完全拥有,资源方一步步从出售原料的卖家,变成了分享利润、参与经营的合伙人。
是什么让分成成为可能
回头看,推动这场转变的有几股力量,每一股在数据行业里都能找到对应。
第一是信息的揭示。签约时没人知道地下有多少油,等到大油田陆续被发现,资源的价值变得清清楚楚,原有的固定报酬就显得越来越不合理。1950年沙特要求重新谈判时,理由之一就是阿美租借区里的石油资源远超预期。数据行业正在经历同样的过程:大模型的成功让所有人都看到了高质量数据的价值,一次性授权的价格开始显得太低。
第二是先例的传播。委内瑞拉的五五分成一旦成立,就成了所有产油国谈判时的参照。沙特签约后,美国国务院的内部文件就提到,这让伊朗觉得自己要求“委内瑞拉式”分成并非漫天要价。在数据领域,按使用分成的先例也在出现。美国新闻媒体联盟的2200多家会员可以选择加入与ProRata的协议,按照内容对AI回答的贡献分走平台一半的收入。
第三是账目的透明。伊朗与英伊石油公司的争执中,一个核心诉求是要求公司公开账目,否则分成无从谈起。数据分成同样依赖可审计的使用记录,谁用了多少、带来了什么结果,必须能够核查。
第四点最容易被忽略:分成能谈成,一个重要原因是有人帮忙分担了成本。沙特的五五分成被设计成所得税的形式,阿美可以用这笔税款抵扣它在美国应缴的税,公司实际多付的并不多,相当一部分成本由美国财政承担了。数据交易也需要这样的第三方:如果有金融机构愿意提前买下数据方未来的分成权,买方就不必在一开始拿出一大笔钱。上一篇提到的迈尔森-萨特思韦特定理,恰好也为此提供了理论注脚:外部资金的介入,正是让更多交易得以成交的条件之一。
数据和石油,在这里分道扬镳
不过,这段历史也有一处和数据截然不同,而且恰恰是最要紧的一处。
国际商务学者雷蒙德·弗农(Raymond Vernon)提出过“议价能力递减”的说法:外国公司一旦在东道国投下巨额的固定资产,就再也搬不走了,谈判筹码会逐渐从公司转向东道国。石油正是如此,油田、管道和炼厂都留在产油国的土地上,产油国随时可以要求重新谈判,甚至直接收归国有。
数据的情况正好反过来。数据一旦被训练进模型,就被带走了,数据方无法收回,也无法通过“关掉油井”来施压。签约之前,数据方的筹码最大;签约并交付之后,筹码几乎归零。
这意味着数据方不能指望像产油国那样,先签一个吃亏的合同,等价值显现后再回头重谈。所有关于分成、里程碑和使用计费的条款,都必须在数据交付之前谈定。从这个角度说,数据方需要的是一步到位的“五五分成”,而不是再走一遍从特许权到参股的五十年。
另一个不同是资源方的分散程度。石油资源集中在少数几个国家手里,它们可以联合起来组建欧佩克。数据则分散在成千上万家医院、研究机构和平台手里,单个数据方的议价能力很弱。新闻出版业的做法提供了一个方向:通过行业联盟集体谈判,统一接入分成协议。医疗和生物数据领域也许需要类似的联合体。
我们正站在哪一步
对照石油业的历史,今天的数据交易大体还处在特许权时代:固定费用、一次性授权,数据交付后价值全归买方。但五五分成时刻的迹象已经出现,有按使用分成的内容平台,有提供数据的医疗系统以股东身份参与分配的健康数据公司,也有希望在续约时改为按使用计费的社交平台。
石油业从特许权走到分成,靠的是信息揭示、先例传播、账目透明和第三方分担成本。数据行业要走出固定费用时代,这四样东西一样都少不了,而且因为数据交付后筹码归零,必须在交易设计的一开始就把它们装进合同里。下一篇讨论具体该怎么装。
第四篇|九种可以借来的商业模式
前三篇的结论可以归结为一句话:数据在交易时没有正确的价格,所以出路不是算出一个价格,而是设计一种让价格随信息逐步确定的合约。好消息是,这样的合约不需要从零发明。生物医药授权、并购、金融、媒体和音乐产业,早就在处理“价值不确定、兑现又很慢”的资产,积累了一整套成熟的工具。
数据交易的僵局,可以拆成三个具体的问题:买方现在拿不出那么多钱;双方都不敢先定价;数据的价值要在很长时间里持续产生,一次性结算注定不公平。九种可借鉴的模式,正好分别对应这三个问题。
第一类:买方现在拿不出钱
首付款、里程碑付款加销售分成。这是生物医药授权交易的标准结构,天生适合价值兑现慢的资产。以AI制药为例,Isomorphic与礼来的合作中,首付款4500万美元,按研发进展支付的里程碑款最高17亿美元,此外还有最高到两位数低段的销售分成。首付款不到潜在总额的3%,绝大部分价值押在了未来。这套结构目前主要用于AI平台和候选分子的交易,在公开披露的数据授权交易中还很少见到,但道理完全相通:小额首付,按模型效果、管线进展和最终销售分期付款。
数据换股权。数据方不收现金,而是成为股东。2018年GSK向23andMe投资3亿美元,双方同时约定平摊药物研发的成本和利润,数据方既拿到了股权,也拿到了产品层面的分成。Truveta走得更远:17家医疗系统与Illumina、Regeneron共同出资3.2亿美元认购其优先股,估值超过10亿美元。提供数据的医疗系统本身就是股东,数据方、研究者和药企的利益因此被绑在了一起。
第三方提前买断未来收益。药物领域有专门收购特许权使用费的基金,矿业有“流量融资”:金融机构先付一笔钱,换取未来一定比例的产出或收入。这套办法可以直接移植到数据上。数据方把未来的里程碑款和分成权卖给金融机构,提前拿到现金;买方则不必在一开始支付高额首付。上一篇提到,沙特的五五分成能谈成,一个重要原因是美国财政实际上分担了一部分成本,第三方资金在数据交易里可以扮演类似的角色。这种“数据特许权基金”目前还没有成型的先例,是我认为值得有人去做的一件事。
第二类:双方都不敢先定价
期权式授权。买方先付一笔小额期权费,换取一段时间的独家评估权,同时提前约定行权时的价格和条款。评估期内,数据的价值逐渐清楚,买方再决定是否行权。这在生物技术授权中很常见,用在数据上,可以把“先定价”变成“先评估”。
先测增益,再按效果付费。在隐私计算环境里,让买方的模型在不接触原始数据的情况下训练,实测加入这批数据后模型提升了多少,再按提升幅度付费。这和广告业从按展示付费转向按点击、按转化付费是同一个逻辑:不为可能的价值付钱,只为测得到的效果付钱。技术上已经有过大规模验证。2019年到2022年的MELLODDY项目中,十家互为竞争对手的药企在不共享数据的前提下联合训练模型,动用了超过26亿个保密的实验数据点,每一家的预测模型在整体上都获得了提升。
对赌和或有价值权。并购中,买卖双方对估值谈不拢时,常用对赌条款或者或有价值权:先按保守价格成交,未来达到约定目标再补付。数据交易可以照此约定:如果基于这批数据的项目进入某个临床阶段,买方补付一笔钱。
第三类:价值要持续分配
按使用分成。ProRata的做法是用归因技术计算每家出版商的内容对某个AI回答的贡献,按次把平台一半的收入分给内容方。Truveta的思路也类似,据其创始人介绍,这个模式得以持续的关键,是每当去标识化的数据被他人使用时,就向医疗系统和测序方支付报酬。音乐版权的集体管理和流媒体的收入池分配,是这类模式更早、更成熟的前辈。
按时间窗口定价。UK Biobank的外显子测序联合体是一个很好的例子。2018年,在Regeneron牵头下,首批五家药企各出资1000万美元,让50万名参与者的测序提前三年完成;作为回报,出资方享有6到12个月的独家使用期,之后数据回归数据库,向全球研究者开放。这相当于影视业的窗口期:首映期卖高价,之后逐步扩大发行。它巧妙地绕开了“数据值多少钱”这个难题,改为给“比别人早用一段时间”定价。
数据换模型。Tempus与阿斯利康、Pathos在2025年签下的三年期协议是非独家的,模型建成后三方各得一份副本,大部分算力成本由后两家承担,Tempus还获得了2亿美元的数据授权和模型开发费。数据方拿到的不只是现金,还有一个能反哺自身业务的模型,并保留了继续把数据授权给他人的权利。
把九种模式拼起来
这些模式并不互斥。组合起来,可以得到一个适合生物医药数据交易的分层结构,每一层对应价值链上的一个信息揭示点。
| 层级 | 触发条件 | 付款形式 | 解决的问题 | 借鉴自 |
|---|---|---|---|---|
| 评估 | 在隐私计算环境中实测模型增益 | 小额评估费 | 看了就不必买 | 按效果付费的广告 |
| 期权 | 买方要求独家评估期 | 期权费,锁定后续条款 | 双方都不敢先定价 | 生物技术期权授权 |
| 模型里程碑 | 模型达到约定的基准提升 | 分期付款 | 买方首付能力有限 | 药物授权里程碑 |
| 管线里程碑 | 靶点验证、确定候选分子、申报临床、进入二期 | 分期付款 | 价值兑现慢 | 药物授权里程碑、对赌 |
| 长期分成 | 产品上市或模型产生商业收入 | 销售分成或收入分成,多个数据源按归因池分配 | 价值持续产生 | 特许权使用费、按使用分成 |
在这个结构上还可以叠加两个选项:一是部分对价用股权支付,让数据方成为长期利益相关者;二是数据方可以把管线里程碑和长期分成的权利卖给金融机构,提前变现。
回到开头那个谈判桌上的僵局。在这个结构下,买方在最不确定的阶段只需要付评估费和期权费,不必一开始就押上一大笔钱;卖方虽然前期拿得少,但保留了分享后续全部价值的权利,不用担心把长期价值一次性贱卖。价格没有在签约时被确定,而是随着模型效果、临床进展和上市销售,一层一层地兑现。
让它跑起来的条件
这个方案要真正落地,有四个前提。
第一,所有条款必须在数据交付之前谈定。上一篇讲过,数据一旦训练进模型就收不回来,数据方的议价能力在交付那一刻几乎归零,事后补谈基本没有筹码。
第二,使用必须可以审计。按使用分成和按里程碑付款,都依赖对数据使用情况和项目进展的可靠记录。就像产油国要求石油公司公开账目一样,数据方也需要一套可以核查的使用和溯源机制。
第三,归因方法要务实。精确计算每一份数据对模型贡献的方法,比如基于博弈论的Shapley值,理论上最公平,但精确计算量随数据方数量呈指数增长,实际只能近似,也有研究指出这类估值可能被策略性地操纵。早期不如采用简单透明的规则,比如按数据量和质量等级加权,放进收益池里统一分配,等方法成熟了再逐步细化。
第四,要防范对手方风险。十年的回报周期里,任何一方都可能出变故。23andMe就是一个例子:与GSK的独家研究期在2023年7月结束后,其研究服务收入随之下降,两年后公司申请破产,数据最终在拍卖中易主。长期付款安排需要托管、担保或权利质押来保障,否则“分享未来价值”的承诺可能落空。
最后
“数据是新石油”这个比喻流行了快二十年,它最大的误导,是让人以为数据生意就是开采和出售。石油业自己用了半个世纪才明白,资源方真正的出路是分享利润、参与经营,而不是卖得更贵。数据行业不需要再花五十年,所需的工具早已在生物医药授权、并购、金融和版权产业里各自成熟,缺的只是把它们拼在一起,并且在数据交付之前就写进合同。
对于正在谈数据合作的双方来说,也许可以换一个问题来开场:与其争论这批数据值多少钱,不如先商量,当它的价值一点点显现出来的时候,我们打算怎么分。
参考文献
第一篇
- Clive Humby,关于2006年“数据是新石油”一语;“不经提炼就无法使用”的补充常被认为出自后来的引申.
- The Economist. The world’s most valuable resource is no longer oil, but data. May 2017.
- Charles I. Jones & Christopher Tonetti. Nonrivalry and the Economics of Data. American Economic Review, 110(9), 2020.
- Pablo Villalobos et al. Will we run out of data? Limits of LLM scaling based on human-generated data. ICML 2024(报道见 AP / VOA;估算数据见 Epoch AI 分析摘要).
- Ilia Shumailov et al. AI models collapse when trained on recursively generated data. Nature, 631, 2024;不同观点见 Matthias Gerstgrasser et al. Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data. arXiv:2404.01413, 2024.
第二篇
- Eric Vallabh Minikel et al. Refining the impact of genetic evidence on clinical success. Nature, 629, 2024.
- Roger B. Myerson & Mark A. Satterthwaite. Efficient mechanisms for bilateral trading. Journal of Economic Theory, 29(2), 1983.
- Kenneth J. Arrow. Economic Welfare and the Allocation of Resources for Invention. In The Rate and Direction of Inventive Activity, Princeton University Press, 1962.
- AI训练数据授权交易价格汇总,Quartz,2026.
- Reddit Weighs Cutting Google AI Access as $60M Deal Expires,据《华尔街日报》报道.
- 2024年全国数据市场交易规模超1600亿元,国家数据局在全国数据工作会议上的数据.
- 财政部.《企业数据资源相关会计处理暂行规定》,2024年1月1日起施行;关于初始计量采用历史成本,见中伦律师事务所解读.
- 23andMe;23andMe 破产案梳理.
第三篇
- International Petroleum Agreements: Politics, oil prices steer evolution of deal forms,Oil & Gas Journal.
- Foreign Relations of the United States, 1951, Vol. V,关于1950年沙特与阿美的新协议.
- The Anglo-Iranian Oil Company, 1951: Britain vs. Iran,Seven Pillars Institute.
- Saudi Arabian Oil: The Obsolescing Bargaining Model,Becker,2018.
- The History of Saudi Arabian Oil,关于五五分成的税收抵扣安排.
- Posted oil price,关于欧佩克成立与1971年分成比例调整.
- Raymond Vernon. Sovereignty at Bay: The Multinational Spread of U.S. Enterprises. Basic Books, 1971.
- News/Media Alliance, ProRata AI Sign Content Licensing Deal,MediaPost.
第四篇
- Lilly, Novartis sign AI partnership with Alphabet’s Isomorphic,PharmaLive,2024.
- 23andMe Gets $300 Million Boost From GlaxoSmithKline,Bio-IT World,2018.
- Leading US health systems launch the Truveta Genome Project,2025;GeekWire 报道.
- Wouter Heyndrickx et al. MELLODDY: Cross-pharma Federated Learning at Unprecedented Scale Unlocks Benefits in QSAR without Compromising Proprietary Information. Journal of Chemical Information and Modeling, 2024.
- ProRata Invents Generative AI Attribution Technology,Business Wire,2024.
- Regeneron announces major collaboration to exome sequence UK Biobank,UK Biobank,2018;独家期限见 GenomeWeb.
- Tempus Signs Expanded Strategic Agreements with AstraZeneca and Pathos,2025;协议细节见 Benzinga.
- Anne Wojcicki will acquire 23andMe for $305M following bankruptcy,MobiHealthNews,2025.
- Amirata Ghorbani & James Zou. Data Shapley: Equitable Valuation of Data for Machine Learning. ICML 2019.