一、声音的基本概念
声音是机械振动在介质中的传播,是模拟信号。计算机处理声音需要将其转换为数字信号,这个过程称为音频数字化。
1.1 声音的三要素
| 要素 | 说明 |
|---|---|
| 音调 | 声音的高低,由频率决定。频率越高,音调越高 |
| 音色 | 声音的特色,由波形决定。不同乐器有不同的音色 |
| 音强(响度) | 声音的大小,由振幅决定。振幅越大,声音越响 |
二、音频数字化过程
音频数字化需要经过三个步骤:采样 → 量化 → 编码
2.1 采样(Sampling)
- 定义:将时间上连续的模拟信号转换为时间上离散的信号
- 采样频率:每秒钟采样的次数,单位为 Hz
- 奈奎斯特采样定理:采样频率应大于等于被采样信号最高频率的2倍
常用采样频率:
| 采样频率 | 应用场景 |
|---|---|
| 8 kHz | 电话语音 |
| 11.025 kHz | 语音(低质量) |
| 22.05 kHz | FM广播 |
| 44.1 kHz | CD音质 |
| 48 kHz | DVD音质、专业音频 |
2.2 量化(Quantization)
- 定义:将采样后得到的离散信号的幅度值转换为有限个离散值(数字值)
- 量化位数(精度):每个采样点使用的二进制位数
| 量化位数 | 精度等级 |
|---|---|
| 8位 | 256级(2^8),语音级别 |
| 16位 | 65536级(2^16),CD音质 |
| 24位 | 16777216级(2^24),专业音频 |
| 32位 | 4294967296级(2^32),高精度音频 |
2.3 编码(Encoding)
- 定义:将量化后的数字信号按一定格式转换为二进制数据流
- 编码方式:PCM(脉冲编码调制)、ADPCM(自适应差分脉冲编码调制)等
三、音频数据量计算
3.1 未压缩音频数据量公式
$$
数据量 = 采样频率 \times 量化位数 \times 声道数 \times 时间 / 8
$$
注意:除以8是因为计算结果单位从 bit 转换为 Byte。
| 参数 | 说明 |
|---|---|
| 采样频率 | 单位:Hz(次/秒) |
| 量化位数 | 单位:bit(位) |
| 声道数 | 单声道=1,双声道(立体声)=2 |
| 时间 | 单位:秒(s) |
| /8 | bit → Byte 转换 |
3.2 计算示例
例题:采样频率为 44.1kHz,量化位数为 16位,双声道,录制 1 分钟的音频,未压缩的数据量是多少?
$$
数据量 = 44100 \times 16 \times 2 \times 60 / 8 = 10584000 \text{ Byte} \approx 10.09 \text{ MB}
$$
四、常见音频文件格式
| 格式 | 全称 | 特点 |
|---|---|---|
| WAV | Waveform Audio | 微软开发,无损,文件较大 |
| MP3 | MPEG-1 Audio Layer 3 | 有损压缩,体积小,音质较好 |
| WMA | Windows Media Audio | 微软开发,有损/无损均可 |
| AAC | Advanced Audio Coding | MP3 的后继者,有损压缩,效率更高 |
| OGG | Ogg Vorbis | 开源格式,有损压缩 |
| FLAC | Free Lossless Audio Codec | 无损压缩,体积比WAV小 |
| APE | Monkey’s Audio | 无损压缩,压缩率高 |
| MIDI | Musical Instrument Digital Interface | 乐器数字接口,记录演奏指令而非声音波形,文件极小 |
重点区分:
- WAV:无损,未压缩或无损压缩,文件大
- MP3:有损压缩,文件小
- MIDI:不是真正的音频,是乐器控制指令
五、音频质量与参数关系
| 参数 | 越大/越高 → |
|---|---|
| 采样频率 | 声音越逼真,数据量越大 |
| 量化位数 | 声音精度越高,数据量越大 |
| 声道数 | 声音空间感越好,数据量越大 |
记忆:三个参数越大,音质越好,但数据量也越大。
六、重点记忆
- 奈奎斯特采样定理:采样频率 >= 2 × 最高信号频率
- 音频数字化三步骤:采样 → 量化 → 编码
- CD音质标准:44.1kHz / 16bit / 双声道
- 数据量公式:采样频率 × 量化位数 × 声道数 × 时间 / 8
- MIDI 不是音频信号,是乐器控制指令
评论