投资于数据,是个人在AI时代的最佳选择

· 2026-08-28 08:17 · 6 阅读

原创 辉哥奇谭 2026-08-28 08:17 北京

先说结论:对长期用 AI 读书、写作、做研究的人来说,最值得持续投资的,不是频繁追逐模型,而是可迁移的个人数据资产。

为什么这么说?看看过去一年大家的行为就知道了。模型一发新版,就有人换工具;今天还在用 DeepSeek-V4-Flash,明天听说 GLM-5.3-Flash 强了,又切过去。我理解这种心情,我自己也换。但换了一整年下来,我越来越确定一件事:模型是变量,你的数据才是常量。把注意力全押在变量上,很累,而且攒不下东西。

先讲讲我自己的经历,再展开讲道理。

今年五一期间,我在整理自己的知识库,突然想通了一件事:我用 Karpathy 的方法搭的那套 llm-wiki,本质不是服务于我本人的基础设施,而是服务于 Agent 的基础设施。说白了,我不是在「整理文件」,我是在给我的数字团队建「大脑」。这件事想通之后,做数据基础设施建设就有了动力和定力。之前也整理,但总有点三天打鱼两天晒网。动力和定力不一样——动力让你开始,定力让你持续。

后来我花了一个周末、约 15 亿 Token、大概 1000 块钱,把自己过去十年的 3000 多篇公众号文章和 1 万多条 Flomo 笔记,炼成了一个活的知识系统。从那以后,AI 回答我的问题质量明显不一样了。为什么?因为它读过我。一个没读过我的文章的模型,只能给我泛泛的答案;读过之后,它能接着我已有的思考往下走。

给你看一个具体的对照。我有条 2024 年 6 月的随手笔记,50 个字,记的是跟朋友聊天:他写公众号三年,每次都要花四五个小时找素材和构思;我当时想,如果每次写作的思考都能沉淀下来,下次是不是就不用从零开始?这条笔记记完就沉底了。但进入知识库之后,它激活了三个概念页,系统还反馈了两条跨时间关联——跟 2023 年 11 月一条关于碎片化时间管理的笔记有关联,跟 2025 年 8 月一条关于 AI 辅助写作的笔记形成递进。一条 50 字的笔记,串起了横跨两年的思考脉络。如果没做这个系统,它会永远躺在笔记软件里,再也不会被打开。

同一个问题,整理前后答案差多少?有一个很直观的例子,比如同样一个主题,你发给最强大的AI工具写作,如果它没有你的上下文,它写出来的内容与你的个人经历无关,也不会深刻地理解你的思想。但如果在你个人的llm-wiki环境中,任何一个合格的AI工具都能写出「像你写的」的文章 —— 这就是最大的区别。

那为什么数据能让 AI 变得「更懂你」?这就要说一点技术原理,不复杂。

可以把模型理解为对公开知识的一种压缩:它把互联网上公开的海量信息,压缩进了几千亿个参数。这意味着,公开的数据,所有人共享同一个压缩版本——你问它「怎么写作」「怎么看财报」,缺少个人上下文时,模型的回答很容易趋同。而模型没见过的、只属于你的那部分——你的经历、你的判断、你踩过的坑——它压缩不了,只能由你来提供。同一份模型能力,配上不同的个人数据,产出就是天差地别。

我在文章里打过比方:公开数据是石油,私有数据是稀土。石油人人可得,稀土需要亲身积累,且无法复制。未来大家都会有 AI,但不是每个人都有「你的十年」。

再说回「常量」这个词。梁文锋 2023 年接受《暗涌》采访时说过一句被引用很多的话:具体的技术方向一直在变,但「模型、数据和算力」这三者的组合是不变的。他是在解释为什么要提前储备算力。我读到时想的是:这三样东西,算力是云厂商的事,模型是公司的事,个人真正能抓在手里的,只有数据。贝索斯也讲过同一个意思:在不变的事物上加大投资,才是战略。对个人而言,数据就是那个不变量——可导出、经过整理的数据,不会因为更换模型而失效。今天喂给 DeepSeek,明年换成别的模型,照样有用。这和投资的逻辑是一致的:长期收益来自基本面稳定的资产,而不是追热点。

有人可能会说,道理我懂,但翻译、编程、数学这类任务,模型能力本身才是决定性的。这个反驳成立,我同意。但这类任务的收益是「模型进步自动带给你」的,你躺着就能享受;而写作、研究这类知识工作的产出质量,取决于模型对你个人的理解程度,这部分进步不会自动发生——它来自你自己的数据。所以结论不是「数据比模型重要」,而是:在模型能力自动增长的部分之外,你能主动拉开差距的,恰恰是数据。

这里还差一座桥。前面讲的都是个人文章和笔记,但最强的 AI 公司们重视的似乎是另一种数据——训练数据和标注数据。两者确实不是一回事:公司通过训练数据提升模型的通用能力;个人则通过私有数据,为现成模型补充长期上下文。它们不是同一种数据工程,但遵循同一个规律:模型的能力,最终要通过数据才能落到具体任务上。

这个规律,公司层面已经做得很重了。据公开报道,今年 8 月,字节跳动成立「AI 数据与安全」一级部门,与大模型研发部门平级,这在国内大厂里是头一回。再看 DeepSeek,2024 年底发布 V3 技术报告时,贡献者名单里专门列了 31 位数据标注人员,和 150 位研发工程师并列写进论文,这在业内很少见。

最强的公司都在把数据当成一级战略。而讽刺的是,个人恰恰是最容易拥有优质数据、又最容易忽略数据的人。模型你说了不算,算力你说了不算,你的数据本来你说了算——但它散落在十几个 App 里,或者干脆没被记下来。多说一句:其实我特别期待一种工具,能随时收听自己每天的讲话,从中总结出值得记住的内容,因为很多好的想法就出现在日常的对话中。还有一些问题值得跟进,也是出现在日常对话场景中。

如何更好地整理个人数据,给几条具体的建议。

  1. 先把数据从别人手里拿回来。

    选工具时问一句:数据能不能完整导出?不能导出的工具,慎用。我年初把所有笔记迁到了本地知识库,就是出于这个考虑。

  2. 记录阶段先求量,调用阶段再求质。

    随手记没问题,先持续留下,再定期整理。积累少的人有个优势:可以从第一天起就带着 AI 思维去记录,比回头补救老数据效率高得多。

  3. 定期「编译」。

    优质数据的标准就三条:经过整理的、结构化的、语义清晰的。每月花点时间,把碎片整理成结构化的东西。

  4. 让 AI 真正用起来。

    资料要可检索、可引用;定期更新,淘汰过时的信息;做好备份,考虑将来换工具时的格式迁移。

  5. 划清隐私边界。

    普通资料和敏感数据分开管理,想清楚哪些放本地、哪些可以上云端。数据是资产,但主权在你,别为了方便把不该交出去的交出去。

  6. 分清个人数据和公司的信息资产。

    如果你在一家公司工作,要先建立一个默认认知:工作过程中产生的数据,都是公司的信息资产,不属于个人。把这些和你的个人笔记、个人记录严格分开,不要混着存,更不要带出去。这既是职业规范,也是在保护你自己。数据能成为你的资产,前提是它本来就该属于你。个人数据从哪里来?你的阅读、思考、生活观察、业余写作、身体指标——这些才是随时可以积累、谁也拿不走的部分。

最后想说,这件事急不来,但也不用焦虑。数据积累天然是慢变量,它不像追模型那样每天都有新刺激,它的回报藏在几年之后。这恰恰说明它是正确的事——你经历过但没记下来的东西,对 AI 来说等于不存在;你记下来的每一天,都在给未来的自己发股份。

模型还会继续变,明年这时你大概率又换了新工具。没关系。只要数据一直在你手里,怎么换,你都是受益者。

---

如果你想听这篇文章的「底层版本」

我在知识星球「辉哥奇谭」里有一段 30 多分钟的语音《AI时代个人认知飞轮构建讨论》,讲的就是这篇文章的底层逻辑——AI 的能力栈到底分几层、为什么工具和模型都不是你的护城河、以及怎么从今天开始搭建你自己的认知飞轮。今晚散步时可以听一听,趁周末赶紧行动!扫描下图二维码或者点击「阅读原文」,加入辉哥的知识星球。那里有更多关于 AI 实践、知识飞轮和写作系统的深度分享。

阅读原文

跳转微信打开