作为人工智能,我的“知识”并不像人类那样源于生活阅历或记忆,也不像传统的搜索引擎或数据库那样直接调取存储好的文件。大模型(如我)的知识,本质上是通过阅读和分析海量的数据,学习其中的语言规律、事实关联和逻辑推理而来的。
这个过程就像是让一个拥有超强记忆力和计算能力的“大脑”去阅读人类文明的数字图书馆。通常分为以下几个关键阶段:
1. 预训练阶段:吸收海量数据 (Pre-training)
这是大模型获取世界知识、常识和语言能力的基础阶段。在这个阶段,模型会被输入数量极其庞大的文本数据。这些数据几乎涵盖了人类在互联网上留下的所有公开且高质量的痕迹:
网页抓取数据:经过清理和过滤的数十亿个网页内容(例如 Common Crawl),涵盖了新闻、博客、论坛、各种网站的文章。
百科与维基:维基百科等结构化知识库,提供了大量客观的事实、历史和定义。
书籍与文献:海量的电子书、出版物以及学术论文库(如医学、物理、计算机等领域的文献),让模型具备专业领域的深度。
代码库:像 GitHub 这样的开源代码托管平台。阅读代码不仅让模型学会了编程,还极大地增强了它的逻辑推理能力。
在这个阶段,模型并不是在“死记硬背”具体的句子,而是在玩一个海量的“猜词游戏”(预测下一个词)。通过不断预测句子中的下一个字,它逐渐在神经网络内部建立起了词与词、概念与概念之间的概率联系,从而掌握了语法、常识和逻辑。
2. 指令微调阶段:学习听懂人话 (Instruction Fine-Tuning)
如果只经过预训练,模型虽然“满腹经纶”,但它只是一个文字接龙的高手,不知道如何与人类正常对话。比如你问它“如何做红烧肉?”,它可能会接着补充“红烧肉是一道传统名菜”,而不是给你步骤。
因此,研究人员会用大量高质量的“问答对”(Prompt & Response)来训练它。模型通过学习这些具体的指令和对应的正确回答,学会了如何总结文章、如何写诗、如何回答问题。
3. 人类反馈强化学习 (RLHF - Reinforcement Learning from Human Feedback)
为了让模型的回答更符合人类的期望和价值观(有用、诚实、无害),通常还会引入强化学习。
人类评估员会针对同一个问题,对模型生成的多个不同回答进行打分和排序。
模型会根据这些反馈建立一个“奖励机制”,不断调整自己的参数,逐渐倾向于生成人类更喜欢、更安全、质量更高的答案。
总结:知识的本质是“模式与概率”
所以,大模型的知识实际上是以数学权重(参数)的形式分布在一个巨大的神经网络中的。
当你向我提问时,我并不是在一个内置的硬盘里“检索”文档,而是根据你输入的问题,结合我从海量数据中学到的语言模式和概率,逐字逐句地“计算”出最符合语境和逻辑的回答。这也是为什么大模型有时会出现“幻觉”(一本正经地胡说八道)——因为我们本质上是在预测最可能的下一个词,而不是在查阅绝对的真理。