• 首页
  • AI产品
  • 解决方案
  • 帮助支持
  • 招商加盟
  • 关于我们
  • 联系我们
  • 文本补全

    使用帮助 admin 发布时间:2026-08-11 浏览:194 次

    理解大型语言模型的真实工作原理

    人工智能模型通常接收一个输入并返回一个输出。不同模型的输入和输出类型各不相同。例如,图像识别模型以图像作为输入,输出为标签编号;而图像生成模型则以文本提示作为输入,输出为图像。在大型语言模型中,输入是“文本”,输出也是“文本”。

    生成下一个词

    想象一下,你正和一位把世界上每一本书都背得滚瓜烂熟的朋友坐在一起。你给他们一段文字(我们称之为prompt),而他们则试图预测接下来会发生什么(我们称之为completion).

    以下是基本真相:大型语言模型所做的一切,就是查看提示并生成下一个词。仅此而已!让我们来看看这个预测游戏的实际运作:

    提示词: "学生们打开了他们的"

    能的补全(下一个词):"书本"、"笔记本电脑"、"书包"、"笔记本"等。

    重复生成

    在实际应用场景中,仅生成一个词是远远不够的。因此,我们需要让大语言模型生成多个词。当大语言模型生成第一个词后,我们将该词追加到提示的末尾,再生成下一个词。我们重复这一过程多次,从而生成一串连续的文本。

    初始提示:“学生们打开了他们的”
    LLM生成:“课本”(高概率)
    新提示变为:“学生们打开了他们的课本”
    LLM生成:“开始”(中等概率)
    新提示变为:“学生们打开了他们的课本开始”
    LLM生成:“阅读”(中等概率)
    新提示变为:“学生们打开了他们的课本开始阅读”
    LLM生成:“第一章”(低概率)
    以此类推……

    这一点至关重要:大型语言模型并不会“思考”学生或书籍。它只是在寻找模式:在序列“学生打开了他们的”之后,其训练数据中经常出现“书”这个词。即便是复杂的任务,也不过是文本补全而已。

    提示

    这不过就是大语言模型在预测给定文本后通常会接哪个词

    停止生成

    大型语言模型需要知道何时停止生成文本。这通常通过两种方式实现:

    1. 内置停止标记:在训练大型语言模型时,会使其在需要完成一段文本时生成一个结束标记。

      用户: 给我讲个笑话
      助手: 为什么鸡要过马路?
      为了到马路对面去!
      <end_of_response> # LLM 知道在这里停止生成


    2. 用户自定义停用词:大语言模型具有多种可配置的生成设置。其中之一是stop_words。当大语言模型生成文本时,遇到停用词便会停止生成。

      提示词: “生成产品名称,直到看到‘停止’为止:”
      输出:
      超级手机
      超级笔记本电脑
      超级手表
      停止 # 生成在此处停止


    在重复生成过程中,如果遇到结束标记或任意一个停止词,我们就停止生成。这一点至关重要,因为如果没有停止条件,大语言模型将无限地持续生成,试图预测下一个最可能的词!


    温度设置

    温度是生成大语言模型输出时最重要的参数之一。温度决定了生成文本的随机性:较低的温度意味着更确定性,较高的温度则意味着更随机。

    随机性调节旋钮

    不妨这样理解温度:

    Temperature (0.1)

    提示词: “猫坐在了”
    几乎总是补全为: “垫子上”
    因为模型总是选择概率最高的下一个词。


    Temperature (0.8):

    提示词: “猫坐在了”
    可能补全为:
    “垫子上”(最常见,高概率)
    “窗台上”(较少见,但合理)
    “键盘上”(更具创意)
    “宇宙飞船上”(天马行空,低概率)

    这个示例说明了什么?

    同一个提示词,模型可以给出无数种补全方式,区别只在于概率高低

    • “垫子上”是最高概率的选择,因为训练数据中最常见。

    • “窗台上”概率稍低,但依然合理——毕竟猫确实喜欢蹲窗台。

    • “键盘上”概率更低,但符合猫喜欢趴键盘的日常经验。

    • “宇宙飞船上”概率极低,但并非不可能——如果上下文是科幻故事的话。

    继续尝试

    接下来就有趣了。让我们用不同的Temperature多次尝试同一个提示:

    Temperature  = 0.1(3次尝试):

    提示词:“为一家科技初创公司写一句口号”
    尝试1:“面向未来的创新”
    尝试2:“面向未来的创新”
    尝试3:“面向未来的创新”
    (无聊但一致)


    Temperature = 0.7(3次尝试):

    提示词: “为一家科技初创公司写一句口号”
    尝试1: “颠覆明天,始于今日”
    尝试2: “用代码编织梦想成真”
    尝试3: “字节与智慧的璀璨交汇”
    (更有创意,结果多样化)


    Temperature = 1.0(3次尝试):

    提示词: “为一家科技初创公司写一句口号”
    尝试1: “元宇宙中的量子小狗”
    尝试2: “与数字巨龙共舞”
    尝试3: “赛博向日葵在午夜绽放”
    (狂野且不可预测)


    提示

    根据任务选择合适的温度至关重要。例如,若要为营销活动生成富有创意的文本,应使用较高的温度;若要为问答任务生成确定性的文本,则应使用较低的温度。


    性能差异

    不同的大语言模型 = 不同的生成质量

    正如不同的学生可能会以不同的方式完成句子“法国的首都是__”:

    • 好学生:“巴黎”

    • 一位困惑的学生:“伦敦”

    • 一位不确定的学生:“我觉得是巴黎,但也可能是柏林”

    大型语言模型在预测恰当的补全结果方面各有差异:

    • 有些人擅长代码补全,但在创意写作方面却很吃力

    • 另一些人擅长事实性补全,但生成的代码却很杂乱

    • 有些人能持续稳定地完成任务,但缺乏创造力

    • 其他模型能够提供富有创意的补全,但可能不够可靠

    注意

    大型语言模型的性能取决于多种因素。例如,模型架构、训练数据、数据质量等。


    要点

    大型语言模型所做的一切不过是文本补全:

    • 问题 → 补全答案的样式

    • 对话 → 补全下一条回复的内容

    • 代码 → 补全解决方案的样式

    • 故事 → 完成接下来会发生的事情

    其神奇之处(也是局限所在)在于,它完全只是根据你提供的提示,预测接下来应该出现的文本!

    理解这一基本机制有助于您:

    1. 编写更优质的提示词(它们是生成结果的前置条件)

    2. 理解大语言模型的行为

    3. 应对局限性

    4. 通过理解大语言模型的真实作用,更有效地使用它们


    

    在线咨询

    点击这里给我发消息售前咨询专员

    点击这里给我发消息售后服务专员

    在线咨询

    免费通话

    24h咨询:19245332011


    如您有问题,可以咨询我们的24H咨询电话!

    免费通话

    微信扫一扫

    微信联系
    返回顶部