【读书】本体驱动的AI数据管理(序) ---先随便谈谈
序言的序言
今年三月左右,刚解决完现场某个问题后,主管和我说要派到别的团队支援一下,过去一看是在搞本体项目。 那时候听了pm给我讲解了概念后,觉得蛮有意思,便把电脑搬过去开干,本以为是干顶多一个月就回去了,结果干到现在六月多了还在这个团队干。。。 无言了,本来想着应付应付回原本岗位,现在我都感觉成为这个团队一份子了,然后机缘巧合下看到这本书,所以打算开个新坑。
先讲讲本体是啥吧,想象一下,你要让一台电脑理解"猫是一种动物,动物需要吃东西,所以猫需要吃东西"这件事。对人类来说这是常识,但电脑只认识数字和符号,它并不知道"猫"和"动物"之间有什么关系,更不会自己推出"猫需要吃东西"这个结论。
本体(Ontology)就是为了解决这个问题而发明的东西。它是一套对某个领域里的概念、关系和规则的正式定义。你可以把它理解成一张"概念地图":地图上标注了这个领域里有哪些事物、这些事物有哪些属性、它们之间有什么关联,以及可以从已知信息推出什么新结论。
从一个生活例子讲起
想象你要描述"动物园"这个世界:
- 有老虎、大象、企鹅
- 老虎和大象都是哺乳动物,企鹅是鸟类
- 老虎吃肉,大象吃草
- 大象重于老虎
这些"谁是谁、谁属于谁、谁能干什么"——写成电脑能理解的结构化格式,就是一份本体(Ontology)。

如果有学过Java的朋友,Java的"类"以及"面向对象"的概念或许能辅助你更好理解一点,意思就是给现在的大模型建好类,比如奥迪、奔驰、宝马都可以抽象为"车"这个类,这个类有"品牌"、“颜色”、“最高时速"这些属性。在本体里,我们还能进一步规定关系:车属于某个"品牌”,品牌属于某个"国家",车需要"燃料"才能行驶。有了这套定义,机器就能自己推断出"奥迪需要燃料",而不需要你单独告诉它。
对没学过Java的朋友也不用担心,你只需要记住一件事:本体做的事,就是把人类默认懂的那些常识和规则,用机器能读懂的方式写下来。
其次讲讲本体有啥?本体到底包含什么?
| 组成部分 | 大白话 | 例子 |
|---|---|---|
| 概念/类 | 这个世界里有哪些"种类" | 动物、植物、人 |
| 个体 | 具体的某一个东西 | 旺财(某只狗) |
| 属性 | 东西有什么特征 | 有几条腿、体重多少 |
| 关系 | 东西之间怎么连的 | A属于B、A吃B |
| 规则 | 逻辑推断 | 所有哺乳动物都会呼吸 |
最后讲讲本体能干啥?
很简单——让AI真正懂业务数据。现在的AI是个技术专家,但到了你的具体业务场景里,它其实两眼一抹黑。数据库里有个字段叫"苹果",它不知道这是iPhone手机,还是农产品苹果。有了本体,它就知道了:在这个环境下,“苹果"指的是iPhone手机,单位是"台”,有若干型号,和"订单"、"库存"之间有明确的关联关系——这些都是可以自动推断的,不需要每次靠人解释。
同时,本体还消除了歧义,统一了语言。以后换一个新的AI系统进来,不用从头再把整套业务逻辑重新"喂"一遍,直接读本体就行。
这时候你就发现,我Chovy,这不就是天天说的语义网,什么知识图谱嘛,有啥区别?讲这么抽象这么高深,你给我讲好了啊!
你这么问其实我也有疑惑,于是我去查了查——
说出来可能不信!本体这个概念,比你常听到的知识图谱还要老,在整整46年前,也就是1980年,就已经有学术界提出了。但那个时候,它只活在研究圈子里,没什么人关注。
真正让"让机器理解数据"这件事走向大众视野的,是1998年万维网之父 Tim Berners-Lee。他认为,Web 不应该只是网页之间的互相链接——网页描述的是现实世界里真实的事物和概念,但机器根本看不懂这些链接背后的意思。于是他提出了语义网这个愿景:让机器能够自动理解和处理网络上的数据,而不再只是把它们呈现给人看。
为了实现这个愿景,需要一套机器能读懂的语言。2004年,W3C(就是制定网页标准的那个国际组织)正式发布了 OWL,一种专门用来写本体的语言——你可以把它理解成"本体的格式规范",就像Word文档有.docx格式,本体有OWL格式。
但语义网的愿景很美,现实很骨感。这套东西太学术、太复杂,普通开发者根本用不起来,推了将近十年,大规模落地始终没有实现。
直到2012年,Google提出了知识图谱。它做的事情本质上和语义网一脉相承,但更务实——不追求完美的逻辑推理,先把实体和关系存起来、用起来再说。这一下子就火了,百度、微软跟着做,知识图谱成了AI领域的热词。
然后是现在。大模型来了,人们又发现:大模型很强,但不懂业务数据,幻觉严重,推理不可靠。于是本体这个46年前的老概念,又被人翻出来了。
这条线走下来你会发现,从本体到语义网到OWL到知识图谱再到今天,换了这么多名字、绕了这么多弯路,人类想解决的其实始终是同一件事:让机器真正懂数据。

图 3:老概念一路换皮肤,但核心问题一直没变。
说个题外话,在2026年的六月,好大哥Google又偷摸发了一个博客,讲解了新的知识体系,Open Knowledge Format 连接点我(可能要魔法上网),这里就不详细讲了,粗略说,OKF 是一个开放、厂商中立的规范,用于将组织内部知识存储为一个目录下的 Markdown 文件加 YAML frontmatter,供 AI Agent 读写和交换。
有趣的是就有个老哥评价道原贴连接

翻译过来就是:
我可太喜欢每隔10年就重新关注一下 RDF/OWL 语义网格式了。 迟早有那么一年,它总能火起来的!(笑)
这个调侃不算错。概念确实在轮回,语义网喊了快三十年,真正大规模落地的场景少得可怜。 但这次我有点不一样的感觉。以前是"应该让机器懂数据",现在是"大模型已经很强了,但就差这一口气"——差的恰好就是对业务语义的理解。需求从"理想"变成了"眼前的痛点",这个变化不小。
当然,它会不会这次真的火起来,我也不知道。但说实话,我有点希望它成。(成了我简历有东西写了)
说出来可能不信,某天我某个技术群的群友发了一份文件,打开一看

看到国标那一刻,我也愣了一下。
我擦?原来本体已经录入国家标准吗?为了保持博客的正确不误导人的本质,我还是截图去问了问AI,AI给我严肃回答(本文AI是网页版Claude Sonnet4.6,或者codex)
确认:GB/T 48000.3—2026 是真实的国家标准 这是千真万确的正式国家标准,并非伪造文件。 该标准已收录于国家市场监督管理总局(国家标准化管理委员会)2026年第4号公告,标准编号 GB/T 48000.3—2026,名称《标准数字化 第3部分:本体建模要求》,实施日期为2026年8月1日。 Sdtdata 全国标准信息公共服务平台(国家标准委官网)也明确收录了 GB/T 48000.3-2026《标准数字化 第3部分:本体建模要求》。
如果换做大学的我或许会暗暗激动,“吔?我干这么先进这么符合国家战略的东西吗?” 但是现在身为工作一年的老油子,我还是存疑的,因为啥,扯个小的题外话
当时主播还在大三实习的时候,面试了一家深圳的初创公司,他们的理念叫做数据编织(Data Fabric),那时候主播还是个按着尚硅谷把电商数仓打出来的小萌新,只知道Hadoop,spark,数仓有三层,分别是ODS,DW,ADS。。。。
然后面试我的主管登味很重,说自己是华为出来的,啊然后讲数据孤岛,啊,数据编织,问我听过吗?我肯定没听过啊,数据治理一向都是那种顶级大牛搞得,我就打算做个SQLboy你和我说这些,然后他一派老成的和我说我还年轻,多见识。
其实到这主播没有丝毫意见,因为他说的对啊,我的确年轻,这些东西的确不知道嘛,他让我知道也算扩开知识面了,但是最后有一句莫名其妙触碰到主播逆鳞了,他说原本是不会看我这种普本的学生的,只是现在公司刚起步,所以我才有机会。未来打算和华南理工大学,中山大学达成合作,只招起码暨南大学的学生。这里败坏了主播的所有好感,本来耐心听你讲高大上的理念,后面突然抨击主播学校水平不够。怒而放鸽子。

其实薪资水平真不错,福田区还是龙华区来着,不包吃住但是6000的薪资。但是那时候主播借着这个借口,直接回学校爽玩了一整个大四。
对比他,不禁回想起我实习时的老大,感恩,是个爱吹牛逼的陕西汉子,他有没有真料我不知道了,但是实习时处处关照我,真是成承蒙了。他和我说,数据部门是公司部门里经济效益最差的,说好听点叫数据治理,说难听点叫数据清洁工,再恶心点就是数据里屎里挑金,他不像业务部门可以赚钱,他是要靠业务部门养着的二级部门,数据或许可以提供有效的,支撑判断的信息,但是回报周期很长,前期就是要亏钱养着,很多公司其实等不及的,成立了数据部门很快就会解散,或者压根不成立数据部门。
但是数据从业者可不少,而且加之现在国家讲究数据基建,为了博取投资与关注,就会有很多新的概念,很多听的愿景很美好,但实际要不成本高昂,但是收益低微,或者说学习成本高昂,这样治理并不好用。更多是对着政府社会高谈阔论,博取投资。现在回看,似乎这个数据编织的概念也没火起来,因为实际工作后发现,很多都是概念,的确是“炒起来”博取投资的,真实环境里,老板还是看重,有没有真正价值。

写了堆小故事,我就想先和你泼冷水,冷静看待每一个新的概念。 于是我就问AI,这个值得重视吗?,回答如下

问 AI 不是为了迷信 AI,是为了先把事实边界捋清楚。
本来大众推荐一个概念,应该是极力鼓吹画大饼让你入坑,但写到这里洋洋洒洒写了三千字,和你说本体概念是反复炒,不一定落地的,也不知道有没有劝退你,我是本着==干都干了,那就学精一点?==于是打算开坑!我在群里看到有大佬推荐一本书,就是 《本体驱动的AI数据管理》
正好契合我现在做的项目(虽然我在项目里是打杂的),于是打算写一系列博客来分享我的读书笔记。首先介绍一下这本书,是由机械工业出版社(冲击波出版的,老多人吐槽了)出版,由华为数据专家马运(同时也是《华为数据之道》第一作者)和本体架构专家田璞领衔撰写。
拼多多花了我55大洋购买,正版书籍保证。

图 9:书已经买了,坑也已经挖了。
主播是很讨厌华为的,尤其是华为奇怪的加班文化,华为汽车奇怪的宣传和余大嘴等,但越是讨厌越是要理性批判!但是数据技术不分高低贵贱,保证客观。
不多说!开读!