> For the complete documentation index, see [llms.txt](https://coinmetrics.gitbook.io/coinmetrics-bai-pi-shu/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://coinmetrics.gitbook.io/coinmetrics-bai-pi-shu/xiang-mu-bei-jing/2023-nian-shi-ai-llm-yuan-nian.md).

# 2023年是AI LLM元年

人工智能已经进入“数据挖掘”时代。随着各种机器学习算法的提出和应用，特别是深度学习技术的发展，人们希望机器能够通过大量数据分析，从而自动学习出知识并实现智能化水平。随着计算机硬件水平的提升，大数据分析技术的发展，机器采集、存储、处理数据的水平有了大幅提高。

随着计算机技术的不断进步和应用领域的扩大，全球人工智能市场正在快速发展。据估算，到2026年，全球该市场规模将达4840亿美元。

2023 是大语言模型（LLM）之年，OpenAI 的 GPT-4 震惊了世界，与纯文本 GPT-3 及后续版本相比，GPT-4 是多模式的：它接受了文本和图像的训练； 除其他功能外，它还可以根据图像生成文本。 它发布时有 8,192 个代币，在可能的输入大小方面已经超过了之前最好的 GPT-3.5。 它还是使用 RLHF 进行训练的，RLHF 是最先进的LLM成功的核心。

OpenAI 对 GPT-4 进行了全面评估，不仅针对经典 NLP 基准，而且还针对旨在评估人类的考试（例如 Bar 考试、GRE、Leetcode）。

GPT-4解决了一些 GPT-3.5 无法解决的任务，例如统一律师考试，GPT-4 的得分为 90%，而 GPT-3.5 的得分为 10%。 在大多数任务中，增加的视觉组件只会产生很小的影响，但对其他任务却有很大帮助。在对抗性真实性数据集上的事实正确率实际上比之前最好的 ChatGPT 模型高了 40%。

<figure><img src="/files/j3NICxk9SLAlLIAA6Mgt" alt=""><figcaption></figcaption></figure>

2024年2月16日，OpenAI更是推出了文生视频大模型Sora，它能直接以文生图，并将图片转为生动逼真的动态视频。Sora最令人震撼的是制作出了逼真的、符合人们认知常识的内容，这意味着它能深入学习和了解这个世界很多元素之间的互动关系。

有专业机构指出，如果从“理解世界”的角度来审视 Sora，那么某一帧图像的画质、画面关系绝不是模型质量高低的评判标准，甚至官网释出的 60 秒一镜到底视频也不是最核心的部分。真正的重点在于视频存在不同机位，不论远、中、近、特、广，视频中人物和背景的关系都保持着相当的一致性。

<figure><img src="/files/qrTfSPhk4fw9EDqZcU1n" alt=""><figcaption></figcaption></figure>

OpenAI发布的技术报告将Sora强大能力归于以“转换器”为基础架构的扩散模型，以及将视觉数据转化为可利用的统一格式的技术能力。Sora的出现为那些能够理解和模拟真实世界的模型奠定了基础，这种能力将成为实现更高效的通用人工智能的一个重要里程碑。
