AI 提效
第 3 课:大语言模型如何“读”和“写”
认识 Token、参数、训练、推理与上下文窗口,理解对话模型的工作方式和它的局限。
这一节要解决什么问题
大语言模型(LLM)是处理和生成语言的模型。它通常把文字切成 Token——可理解为词、词的一部分或标点组成的计算单位——再依据前文预测下一个 Token。连续预测并不等于机械接龙:模型在训练中吸收了语言、代码和许多文本模式,所以能够总结、翻译、解释和写作。
五个常见词
参数是训练后留在模型里的大量数值,可以把它看成压缩的模式;参数多不自动代表更适合所有任务。训练是用数据调整参数;推理是部署后根据你的输入生成结果。上下文窗口是模型本次能同时参考的信息容量,超过它的内容可能被截断、压缩或遗忘。Token既关系到长度,也常关系到服务成本和响应时间。
模型不是一本能逐页检索的数据库。它会根据统计模式生成最像合理回答的文字,因此可能把不存在的引用、日期或细节说得很流畅。这种现象叫幻觉,后面的风险课会专门处理。
一个有用的使用方式
向模型提供目标、读者、材料和输出格式。例如“根据以下会议记录,列出已确认事项、待核实事项和负责人;不知道的不要补充”。这使模型能在当前上下文内工作,但仍要检查它有没有遗漏或擅自推断。
本节小结
LLM 是强大的语言模式生成器,不是有责任的事实来源。它的效果取决于任务、上下文、模型与核查流程。