神经网络应用
1. 引言 1.1 深度学习基础与应用概览 本章的学习目标是将前一章中获得的神经网络基础知识(如多层感知机的正反向计算过程,以及基础优化方法)应用到实际场景中。通过分析经典深度学习算法,学习如何将基础神经网络应用于实际场景,并逐步优化以实现工业级...
1. 引言 1.1 深度学习基础与应用概览 本章的学习目标是将前一章中获得的神经网络基础知识(如多层感知机的正反向计算过程,以及基础优化方法)应用到实际场景中。通过分析经典深度学习算法,学习如何将基础神经网络应用于实际场景,并逐步优化以实现工业级...
1. 引言:大模型发展的挑战与趋势 本章节旨在介绍当前大模型发展的宏观背景、驱动因素以及所面临的系统性挑战,特别是计算硬件发展与模型规模增长之间的矛盾,从而引出分布式训练系统的重要性。 1.1 Scaling Law:模型性能与规模的关系 核心...
1 智能计算系统基础概述 1.1 概念层次关系 在智能计算领域,人工智能 (AI)、机器学习 (ML)、神经网络 (NN) 和 深度学习 (DL) 之间存在着清晰的层次结构和包含关系。这种关系可以理解为一个由广到深、由抽象到具体的演进过程。 ...
1. DeepSeek 项目概述与版本迭代 DeepSeek 系列模型代表了在大规模语言模型 (LLM) 领域开放研究和技术进步的重要里程碑。该系列模型通过不断迭代,在模型架构、训练策略、并行技术和推理优化等方面取得了显著进展,旨在提供强大、经济且...
1. GPU架构概览 1.1 GPU vs CPU CPU(中央处理器)和GPU(图形处理器)在设计理念和擅长任务上存在显著差异: CPU (Central Processing Unit): 拥有强大的控制单元和高效的上下文切换能力。 设计...
1. 大语言模型(LLM)的部署过程 大语言模型(LLM)从基础的语言能力到能够理解并执行复杂任务,通常会经历一个多阶段的部署过程。这个过程涵盖了从模型学习通用知识到适应特定用户偏好的精细化调整。 1.1 预训练 (Pre-Training) ...
1. LLM基础与生成机制 1.1 语言模型 (LM) 定义 语言模型 (Language Model, LM) 的核心功能是对一系列词元 (token) 序列的概率分布进行建模。 词汇表 (A\mathcal{A}A):这是一个包含所有可能词...
1. 编程框架概述 1.1 为什么需要编程框架? 深度学习编程框架的出现是为了解决深度学习算法开发和应用中的一系列挑战,主要包括: 算法广泛关注与应用需求: 深度学习算法获得了广泛关注,越来越多的公司和程序员需要使用这些算法。 算法理论复杂性与...