一、声音的基本概念

声音是机械振动在介质中的传播,是模拟信号。计算机处理声音需要将其转换为数字信号,这个过程称为音频数字化

1.1 声音的三要素

要素 说明
音调 声音的高低,由频率决定。频率越高,音调越高
音色 声音的特色,由波形决定。不同乐器有不同的音色
音强(响度) 声音的大小,由振幅决定。振幅越大,声音越响

二、音频数字化过程

音频数字化需要经过三个步骤:采样 → 量化 → 编码

2.1 采样(Sampling)

  • 定义:将时间上连续的模拟信号转换为时间上离散的信号
  • 采样频率:每秒钟采样的次数,单位为 Hz
  • 奈奎斯特采样定理:采样频率应大于等于被采样信号最高频率的2倍

常用采样频率

采样频率 应用场景
8 kHz 电话语音
11.025 kHz 语音(低质量)
22.05 kHz FM广播
44.1 kHz CD音质
48 kHz DVD音质、专业音频

2.2 量化(Quantization)

  • 定义:将采样后得到的离散信号的幅度值转换为有限个离散值(数字值)
  • 量化位数(精度):每个采样点使用的二进制位数
量化位数 精度等级
8位 256级(2^8),语音级别
16位 65536级(2^16),CD音质
24位 16777216级(2^24),专业音频
32位 4294967296级(2^32),高精度音频

2.3 编码(Encoding)

  • 定义:将量化后的数字信号按一定格式转换为二进制数据流
  • 编码方式:PCM(脉冲编码调制)、ADPCM(自适应差分脉冲编码调制)等

三、音频数据量计算

3.1 未压缩音频数据量公式

$$
数据量 = 采样频率 \times 量化位数 \times 声道数 \times 时间 / 8
$$

注意:除以8是因为计算结果单位从 bit 转换为 Byte。

参数 说明
采样频率 单位:Hz(次/秒)
量化位数 单位:bit(位)
声道数 单声道=1,双声道(立体声)=2
时间 单位:秒(s)
/8 bit → Byte 转换

3.2 计算示例

例题:采样频率为 44.1kHz,量化位数为 16位,双声道,录制 1 分钟的音频,未压缩的数据量是多少?

$$
数据量 = 44100 \times 16 \times 2 \times 60 / 8 = 10584000 \text{ Byte} \approx 10.09 \text{ MB}
$$


四、常见音频文件格式

格式 全称 特点
WAV Waveform Audio 微软开发,无损,文件较大
MP3 MPEG-1 Audio Layer 3 有损压缩,体积小,音质较好
WMA Windows Media Audio 微软开发,有损/无损均可
AAC Advanced Audio Coding MP3 的后继者,有损压缩,效率更高
OGG Ogg Vorbis 开源格式,有损压缩
FLAC Free Lossless Audio Codec 无损压缩,体积比WAV小
APE Monkey’s Audio 无损压缩,压缩率高
MIDI Musical Instrument Digital Interface 乐器数字接口,记录演奏指令而非声音波形,文件极小

重点区分

  • WAV:无损,未压缩或无损压缩,文件大
  • MP3:有损压缩,文件小
  • MIDI:不是真正的音频,是乐器控制指令

五、音频质量与参数关系

参数 越大/越高 →
采样频率 声音越逼真,数据量越大
量化位数 声音精度越高,数据量越大
声道数 声音空间感越好,数据量越大

记忆:三个参数越大,音质越好,但数据量也越大。


六、重点记忆

  1. 奈奎斯特采样定理:采样频率 >= 2 × 最高信号频率
  2. 音频数字化三步骤:采样 → 量化 → 编码
  3. CD音质标准:44.1kHz / 16bit / 双声道
  4. 数据量公式:采样频率 × 量化位数 × 声道数 × 时间 / 8
  5. MIDI 不是音频信号,是乐器控制指令