![]() |
当前位置: | 首页 |
|
有没有认真想过,AI到底是个什么玩意儿?它凭什么能瞬间从互联网上抓到你想要的东西?它又凭什么能跟你聊天、写文章、画画,还能谱曲、作视频,甚至做出你没想到的东西?
说实话,AI没那么玄乎。它既不聪明,也不神秘,甚至可以说有点“笨”。它所有的本事,拆开了看,都不难理解。
为了把这事说透,咱们不讲代码,不讲算法,就讲一个孩子的故事。这个孩子叫小石头,从他出生、上户口、上学、打篮球,到最后学校来了个机器人,从头到尾,看完就明白AI是怎么回事,也就搞清齐鲁文化基因解码利用工程了。
关于孩子的故事
出生
小石头出生了。在医院里,护士给他称了体重、量了身长、记录了出生时间,然后给他办了一张出生医学证明。这张纸上写着:小石头,男,某年某月某日某时出生,身长五十厘米,体重三公斤半,父母是谁。从这一刻起,小石头在世界上有了第一份正式档案。
落户
石头爸拿着出生证明去派出所,给小石头上了户口。户口本上又多了一行:小石头,身份证号110101xxxxxxxx,户籍地址幸福路十八号,户主石头爸。从此,小石头有了唯一的身份证号。这个号就像一根绳子,以后他所有的信息,都串在这根绳子上。
公安找人
小石头五岁那年,有一次在商场走丢了。石头爸急得不行,跑去派出所报警。民警问清楚情况后,在电脑上输入小石头的名字和身份证号,一敲回车,电脑屏幕上瞬间跳出一张卡片:小石头,男,五岁,身高一米一,户籍地址幸福路十八号,爸爸妈妈叫什么,联系电话是多少,甚至之前办护照时录过一张照片。
民警把这张照片打印出来,发给商场广播和巡逻的同事,不到半小时就找到了小石头。
您注意,民警找小石头,靠的不是满大街喊名字、挨家挨户敲门。他就是坐在电脑前,输入那个唯一的身份证号,所有信息一下子全出来了。这就是计算机在“已整理好的档案库”里精准调取信息的样子。
入学登记
小石头七岁了,要上小学。入学第一天,学校发给他一张新生登记表,让他和家长一起填。这张表比出生证明和户口本都大,栏目特别多。
第一栏填姓名,第二栏填身份证号,第三栏填家庭住址,第四栏填父母工作单位,第五栏填紧急联系人电话,第六栏填身高体重,第七栏填有没有过敏史或者特殊疾病,第八栏填有什么兴趣爱好,第九栏填有什么特长。
小石头在爱好那一栏写上“打篮球、跑步”,在特长那一栏写上“篮球打得好、跑得快”。学校把这张表全部录入电脑系统。从此,小石头的档案里除了出生信息、户籍信息,又多了健康信息、爱好信息、特长信息。
不过,学校在录入的时候,先把登记表上的每一个栏目都提前定好了标准和范围,比如“身高”这一栏就规定只能填精确到厘米的数字,“兴趣爱好”这一栏要从一个预先列好的清单里选。这些提前定好的栏目,就是将来计算机识别和归类信息的基本依据。
同时,学校还发现家长们填的格式五花八门,有的把身高写成“1.8”,有的写成“180cm”,有的写成“一米八”。学校只好安排专人把这些乱七八糟的格式全部统一成一种标准写法,再把填错的、漏填的、前后矛盾的、甚至重复的信息一个一个挑出来改好或删掉,全部整理干净之后,才能正式录入系统。
不断填写更多信息
上了三年级,学校统一组织体能测试。体育老师给小石头测了五十米跑、立定跳远、仰卧起坐。测试结果又被录入他的档案:五十米跑七秒二,立定跳远两米一,仰卧起坐一分钟四十五个。
到了四年级,班主任在期末评语里写了一句:“该生性格外向,乐于助人,团队合作能力强。”这句评语也被录进了档案。
不过在录入这条评语时,学校不是直接把“性格外向”四个字敲进去,而是把它翻译成了一个标准数字,比如“性格类型:1”,其中1代表外向,0代表内向。同样,“团队合作能力强”被翻译成了“团队合作评分:85分”,满分一百。
五年级时,小石头参加了一次校内篮球比赛,体育老师给他做了个专项评价:“投篮命中率百分之八十五,弹跳力突出,运球基本功扎实。”同样,这条评价也被翻译成了标准数字:“投篮命中率:85%”,“弹跳力:88分”,“运球基本功:82分”,然后录进了档案。
您看,小石头从出生到现在,他的档案越来越厚。出生时只有一张薄薄的出生证明,现在有了户籍信息、健康信息、体能数据、老师评价、专项测试数据,整整几十项。而且每一项都被整理成了格式统一、标准明确的数据。这就是“数据不断完整”的过程。
组建篮球队
小石头上了六年级,学校要组建一支篮球队,参加全市小学生篮球比赛。体育老师李教练负责选人。
李教练以前带过很多届校队,他心里清楚一支好的篮球队需要什么配置:一个中锋负责抢篮板和篮下进攻,一个大前锋负责协防和冲抢,一个小前锋负责突破和快攻,一个得分后卫负责外线投篮,一个控球后卫负责组织传球和掌控节奏。
李教练打开电脑,调出全校六年级所有学生的档案。他先建了一套筛选规则:中锋看身高和弹跳,后卫看命中率和团队合作,小前锋看速度和弹跳。李教练在电脑里把这些规则全部写进去,形成一个完整的选人系统。这个系统就像一个巨大的容器,把后面各种具体的筛选动作都装在里面统一调度。
接着,他把筛选规则细分成好几道工序,一道负责初筛“有没有篮球兴趣”,一道负责按位置分类,一道负责算综合分,一道负责处理异常数据。这些工序各管一摊、互相配合。
然后,李教练先把档案里那些明显不对的数据挑出来,比如有个学生身高填的是“350cm”,明显是笔误,这种数据不能参与选拔,得先标记为无效并清理掉。然后他才开始正式筛选。
他先把所有学生按“有没有打篮球的兴趣爱好”筛了一遍,去掉那些对篮球没兴趣的。然后他按位置分别挑人。
中锋位置,他重点看身高和弹跳力。他在电脑里设了个条件:身高一米七八以上、弹跳力八十五分以上。电脑一筛,符合条件的只有四个人,再按弹跳力从高到低排,最高的是张小飞,弹跳九十五分、身高一米九,选为中锋。
后卫位置,他重点看投篮命中率和团队合作评分。他设条件:命中率百分之八十五以上、团队合作八十分以上。电脑一筛,符合条件的五个人,按命中率从高到低排,最高的是王小胖,命中率百分之九十、团队合作九十分,选为得分后卫。
小前锋位置,他重点看速度和弹跳力。他设条件:五十米跑七秒五以内、弹跳力八十分以上。电脑一筛,符合条件的六个人,按速度从快到慢排,最快的是小石头,七秒二、弹跳八十五分,选为小前锋。
就这样,李教练一个位置一个位置地筛选、排序、取最高,最后电脑屏幕上一共跳出五个人。这五个人以前从来没有一起打过球,但李教练根据他们各自的档案数据,把他们组合成了一支全新的队伍。
不过,李教练心里清楚,他定的这些分数线,中锋要身高一米七八以上、弹跳八十五分以上,不是他自己拍脑袋瞎猜的。他把自己过去十年带队的经验全翻了出来,哪一届校队赢了球,哪一届输了球,赢了的那届中锋是什么数据,输了的那届中锋是什么数据。他反复对比这些历史案例,最终才把每个位置的具体标准磨准确。
另外,李教练在筛选时还有一个原则:不能光看身体数据。以前有一届,他选了个身体条件特别好的中锋,结果到了场上谁也不服、完全不配合队友,队伍打得一塌糊涂。所以这次他定了一条铁规矩:团队合作评分低于八十分的,身体再好也不要。他要把“人的配合意识”也塞进选拔标准里,不能只盯着冷冰冰的数字。
李教练把这份名单打印出来,交给校长说:“这就是我们能组建的最强五人篮球队。”
机器人
又过了两年,学校引进了更先进的技术。李教练以前做的那套“选人规则”,什么位置看什么条件、每个条件具体要多少分,全部被编程装进了一个机器人的“脑袋”里。
这个机器人被放在体育组办公室。它的身体上有一个读卡器,学生一刷学生卡,它就能自动读取这个学生的全部档案数据。它的“大脑”里装着李教练那套选人规则,数据一进来,它自己就开始算:身高多少、弹跳多少、命中率多少、速度多少,然后自动判断这个学生适合打什么位置。而且它会自动按照之前学校定好的那些栏目(身高、体重、弹跳力、团队合作等)去提取和归类数据,不需要人再动手去翻。它的“嘴巴”是一个喇叭或者一块屏幕,算完之后直接输出结果。
不过在正式投入使用之前,李教练先干了一件事。他把过去三届校队的档案和实际比赛成绩全部翻出来,当作“考题”来考这个机器人。他把那些学生的数据输进去,让机器人自己选,然后看机器人选的名单跟当年实际比赛的名单有多大差距。如果机器人没选上当年打得最好的那个学生,或者选上了当年打得最差的那个学生,他就记下来,拿去调整机器人的规则。反复考了五六遍,直到机器人选出来的结果跟实际比赛结果八九不离十了,李教练才点头说:“行了,可以用了。”
今年学校又要组队参加比赛。体育组老师根本不用动手,让每个报名参加选拔的学生去机器人那儿刷一下卡。机器人自己读数据、自己算分、自己排名,最后屏幕上自动跳出一份完整的五人名单,还附带每个人的位置建议和综合评分。
体育组老师只需要拿着这份名单去通知学生训练就行了。
AI的故事
孩子的故事讲完了。现在咱们把刚才故事里的每一段,对应到AI的原理上,一条一条说清楚。
原理一:抓取数据
故事里,民警找小石头,坐在电脑前输入身份证号,所有信息瞬间跳出来,这是在档案已经整理好的前提下进行精准检索。
但在AI的训练中,抓取数据的方式要“暴力”得多。互联网上的信息不像派出所档案那样整整齐齐,它们散落在全球各地的网页里。所以计算机派出的不是“坐办公室的民警”,而是一群不知疲倦的“网络爬虫”。这些爬虫像快递员一样,满世界挨家挨户地跑,看到网页就复制一份背回来,不管内容好坏、不管格式对不对,先统统塞进一个大仓库再说。搜索引擎(比如百度、谷歌)就是靠这些爬虫,把全网的网页搬回来存好。等你搜“小石头”的时候,它就在这个仓库里翻,而不是现去网上找。
所以,抓取数据分两层:第一层是爬虫满世界复制网页(对应AI训练的数据采集),第二层才是靠唯一ID精准调取(对应日常的数据库查询)。故事里“民警找小石头”讲的是第二层,而AI训练真正依赖的是第一层——先把海量数据搬回家再说。
原理二:数据清理和数据标注
故事里,学校在录入新生登记表的时候,先提前定好了每一个栏目的名称和范围,比如“身高”只能填数字、“兴趣爱好”从清单里选。然后才发现家长们填的格式五花八门,于是安排专人统一格式、挑错改错、删掉重复和没用的信息。同时,班主任的评语、体育老师的专项评价,都不是直接录入原文,而是先翻译成标准数字再录入。
这些动作在AI里对应两个概念:数据清理和数据标注。
数据标注,最关键的一步是“先定标签”。就像学校发登记表之前,先设计好表格上要填哪些栏目,姓名、身高、体重、兴趣爱好、特长,这些提前定好的栏目就是“标签”。标签是人为规定的,告诉计算机:“你要去收集这几类信息。”然后在录入时,把“篮球打得好”填进“篮球爱好程度:85分”,把“性格外向”填进“性格类型:1”,把“跑得快”填进“五十米跑:7.2秒”。标签是框架,填进去的数字是内容。计算机只认数字,不认描述,所以必须把每一条日常信息都翻译成标准化的数字,填入对应的标签下面。
数据清理,就是三道工序合在一起。第一,统一格式(“1.8”“180cm”“一米八”统一成“180cm”);第二,修正错误(填错的、漏改的、前后矛盾的挑出来改好);第三,删除冗余(重复录入的、毫无意义的数据直接删掉)。脏数据不清理干净,后面算出来的东西全是乱的。
这两步缺一不可。清理不干净,标注再准也没用;标注不细,清理得再干净,计算机也只认得一堆没意义的零。
原理三:建模和大模型
故事里,李教练先搭了一个篮球队的框架:五个位置,每个位置看什么数据。这个框架是一个“大容器”,把后续所有的规则和操作都装在里面统一调度。然后他用过去十年带队的经验,反复对比成功和失败的案例,把每个位置的具体分数线磨了出来。而且他在这个“大容器”里细分了多道工序:初筛兴趣的、按位置分类的、算综合分的、处理异常数据的,各自独立又互相配合。
这个“框架+规则”的整体,在AI里就叫“模型”。
那“大模型”是什么呢?故事里李教练搭建的那个能容纳所有规则和操作的“大容器”,就相当于大模型。它不是一个具体的筛选动作,而是一个巨大的、通用的底座。在这个底座之上,可以跑很多具体的任务,既能选篮球队,也能选舞蹈队,还能选器乐队。大模型更像一个“通用的大脑”,它不限定只干一件事,而是具备处理多种任务的能力。大模型不是指一个超级巨大的东西,而是指一个能容纳多种规则、处理多种任务的通用体系。
建模就是两件事:第一,搭一个合理的框架,规定要看哪些东西、怎么配合;第二,用大量历史案例去磨,把每个具体标准磨准确。
原理四:生成
故事里,李教练把全校六年级学生的档案往电脑里一倒,电脑按照他设的那些条件,一个位置一个位置地筛选、排序、取最高,最后自动跳出一份五人名单。
这份名单,以前从来没有存在过。这五个人以前从来没一起打过球。但是电脑根据每个学生的档案数据和模型规则,把他们组合成了一个全新的队伍。
这个过程,在AI里就叫“生成”。
生成不是凭空造出新东西,而是把已有的数据,按照模型的规则重新排列组合,产生一个以前没有过的新组合。AI写文章、画图、作曲,都是这个道理。
原理五:数据完整性的重要性
故事里,如果小石头的档案里只有“姓名”和“身高”两项,那李教练只能按身高选,选出来的全是高个子但不会打球的,比赛必输。如果档案里有身高、弹跳、速度、命中率、团队合作、性格、耐力,整整七项,而且每项都经过了清理和标注,那李教练就能综合评判,选出来的人各司其职,比赛能赢。
同时,如果原始数据里有很多重复的、无用的垃圾信息,就像档案里同一个学生的体检数据录了三遍,那李教练的电脑就会被这些冗余数据拖慢,甚至算出来的结果出现偏差。所以数据清理不只是“改错”,还要“删废”——把没用的东西扔掉,把有用的东西擦亮。
这就是数据的根本作用。数据是原材料,数据全、数据干净、数据标得准,模型才能算得准,生成出来的结果才好。数据缺、数据脏、数据标得乱,模型再厉害也算不准。
原理六:建模的科学性、逻辑严密性和价值对齐
故事里,如果李教练认为“中锋最重要的是长得帅”,那他建的模型就是看颜值,选出来的人上了场够不着篮板,比赛必输。如果他定的规则自己打架,比如要求“中锋必须是全队身高最高的”,又要求“中锋必须是全队跑得最快的”,但全校最高的那个学生恰恰跑得最慢,那模型就卡住了,选不出人来。
另外,李教练特意加了一条“团队合作低于八十分不要”的铁规矩,因为他以前吃过亏,选了个身体条件极好但不配合队友的,队伍打得一团糟。这个动作在AI里叫“价值对齐”,机器的判断标准必须跟人的真实意图对齐。人的真实意图不是“选五个身体最好的”,而是“选五个能赢球的”。能赢球不光看身体,还看配合、看态度。所以建模时必须把“人的价值观”也塞进规则里。
建模是整条链子的中间环节。框架合不合理、逻辑有没有矛盾、价值取向跟人对不对得上,直接决定了结果好不好。
原理七:评估数据集
故事里,李教练在机器人正式投入使用之前,先把过去三届校队的档案和实际比赛成绩翻出来当“考题”考机器人。考完看结果,如果机器人选错了,他就记下来去调整规则。反复考了五六遍,直到机器人选的结果跟实际情况八九不离十了,才正式启用。
这套用来考模型的“历史案例库”,在AI里就叫“评估数据集”。
评估数据集就像期末考试的卷子。模型是用一批“训练数据”练出来的,但练得好不好,不能听它自己说,得拿一套它从来没见过的题目考它。这套考题就是评估数据集。考得好说明真学会了,考得不好说明还有漏洞,得回去继续改。
而且评估数据集必须跟训练数据是两拨不同的例子。如果用来练模型的例子和用来考模型的例子是同一批,那就像让学生拿着平时做过的原题去期末考试,分数是假的,不能说明他真会了。
原理八:智能体
故事里,李教练把整套选人规则编程装进了机器人,放在体育组办公室。学生一刷卡,机器人自己读数据、自己算、自己出结果,不用老师动手。
这个装了模型的机器人,在AI里就叫“智能体”。
智能体就是三样东西的组合:第一,它能自己“看”,通过读卡器获取外部数据。而且它读数据的时候,会自动按照学校提前定好的那些标签(身高、弹跳、团队合作等)去提取和归类,不需要人再去翻档案、对栏目。这个过程就叫“自动标注”。第二,它有个“大脑”,装进去的模型,而且这个大脑里不只有选人规则,还有之前用评估数据集反复检验修正过的所有经验,相当于李教练二十年的带队经验全浓缩在里面了。第三,它有“手脚”,输出和执行的能力,能打印名单、能喊话指挥、能操控机械臂干活。
有了智能体,人只需要做一件事,把模型建好、建科学,用评估数据集反复检验直到过关,把价值对齐的规则嵌进去。剩下的抓数据、清理、标注、计算、执行,机器全包了。
两个故事概括起来说——
(一)给孩子落户建档,就是建设数据集;不断充实档案、统一格式、删错除重,就是数据清理和标注;公安输身份证号瞬间调出档案,就是信息抓取——这是信息化。
(二)教练员设置篮球队规则,就是算法;算得快靠的是算力;拿历年案例反复对比把标准磨准,就是模型训练;多个规则合在一套系统里统一调度,就是大模型;把团队意识等要求嵌进规则,就是价值对齐;往模型里倒入数据自动跳出五人名单,就是生成;用往届成绩反复考机器人直到过关,就是评估数据集;把规则装进机器人让它自己选人,就是智能体——这是数智化。
(三)文化数据,就是给小石头的人文特质也建档,不只记身高体重。文化大模型,就是那套系统既能组篮球队,也能组舞蹈队、器乐队,同一个底座,干不同的事——这是文化数智化。
(四)弄清这些道理,再看我们山东正在做的一件事。山东是文化大省,儒家文化、齐鲁文化、黄河文化、泰山文化、海洋文化,就像一个个“小石头”,各有各的出身、各有各的特质、各有各的档案。从2023年我们启动了一项工程,就是先把这些文化资源的“身份证”办好(建信息档案),把每一处遗址、每一件文物、每一项非遗、每一个人物故事都标清楚、数字化(数据清理和标注),然后像李教练搭篮球队框架一样,搭起文化资源分类和评价的规则(建模),用海量文化数据反复训练(模型训练),最终建起“齐鲁文化大模型”,既能做智能检索,也能做内容生成,还能做传承决策。这就是山东文化建设的数智化之路:把散落的文化瑰宝变成可查、可算、可生成的数据资产,让齐鲁文化在数字时代活起来、传下去、走出去——这就是齐鲁文化基因解码利用工程。
(王炳春 山东省文化和旅游厅)
鲁公网安备 37001344001号
备案:鲁ICP备09042281号-4
政府网站标识码:2300000084