← 所有文章
READING PROGRESS
0%

杂谈 · Feb 3, 2026 · ISSUE 0013

听觉注意力、声部写作、压缩、律动…

一些闭门造车的联想和空想。关于Auditory Scene Analysis。

以前自学过一点平面设计,其中版式的几个原则:对齐、重复、对比,在好多教材的一开始就会被提出来。平时我也爱看一些绘画教程和改画视频,画画老师常会强调主体和背景在细节的刻画上要作出对比差异。视觉上的这些原则理解起来倒不是很难,它们都服务于注意力的引导。引导得好,观看者就能按照作者意图中的主次顺序接收到画面内容,方便画面理解、也增加美感。

最近有和朋友讨论过视觉和听觉的差异。当时聊到视网膜是二维的,不同物体在视网膜上的投影天然包含相对位置信息,所以人擅长2D平面上的模式识别。抛开时间维度,仅仅一张2d静帧内部就含有很大量的信息。但听觉的接收器是耳蜗基底膜上得柯蒂氏器,它的不同细胞对不同频率的敏感程度不一样,功能有点像在耳朵内把声音转换到频域上,做了个傅立叶变换。如果抛开时间维度,频域上的一维切面就包含不了太多信息。所以听觉是一定要依赖时序关系的。 (负责视觉和听觉的脑区大小也差了非常多,感兴趣可以查一查…)

所以人对视觉内容的敏感程度和分析能力比听觉高得多。况且美术作品一张纸贴出来,谁来都可以指指点点;相比之下音频的高保真回放和分析技术的历史就短的多,这大概是美术中这些原则被更早地显式总结出来的一部分原因?但困扰我的是,做音乐这么多年,我总是在学习作曲规则、声音设计、怎么用效果器还有各种零碎的制作tips。但我一直不太清楚好听与否的底层原理是什么,下判断究竟基于什么。我总是遇到前一天觉得好听后一天觉得奇怪、感觉难听却不知道怎么改的情况,让我觉得非常不爽😕。

最近一直在琢磨这个问题。我觉得不论视觉作品还是听觉作品,面对接收它们的观众听众,引导注意力的重要性应该是相通的。人对于听觉的注意力本就更加有限和“单通道”,但好像很少有人专门强调这个点。再一琢磨,基于动机的旋律写作、四部和声的声部写作规则、混音的gain staging、压缩、律动,是不是都可以部分归因到这个点上来?

抓了一本书看一看👉

目前只看了个开头,书里提到的一些点和我的设想差不太多。

0013_1

一些基本概念可以阅读一下:

视觉感知的规律和听觉在本质上是相通的。 人的听觉不以“单个声音事件”为单位工作,而是会非常本能地把时间上相近、频率特性相近、onset规律相似、或一同变化的声音归类分组。也就是说人听到的是几条“听觉流”。这些相似的声音在时间维度上的变化,会被感知成一条连续的“流”。而注意力是稀缺的,人不可能一次性感知所有声音事件,只能在不同听觉流之间切换。

于是俺最近有一个猜测,就是所有作编混中的混乱、突兀、不自然,它们的一部分原因都是听觉流的安排不当。

  • 基于动机的写作、旋律的呈示/发展/重复: 新的旋律、新的乐器,对于人耳来说都需要时间去register。如果每个新声部出现,就带着独特的旋律,甚至同时出现多个,那么人耳没有能力把它们识别成多个清晰元素,而是更可能直接合并成一个混乱的整体背景。人没有办法既要又要。所以每次引入新元素,最好保证同时存在的其他听觉流已经被register过,除非你的本意就是混乱的听感。
  • 四部和声规则: 四部和声的织体是作为一个整体被感知的。这个整体对注意力的吸引力应该是平稳可预测的。内声部的跳进、平五平八很容易制造新的听觉流,强行拉走注意力引发混乱。
  • 律动的一致性: Kick+Bass,Snare+Tom+Percussion+吉他扫弦…当不同声部在时值接近、频率特性接近时,天然就会被听作同一条听觉流。很多风格以律动作为骨骼,但律动本身并不是注意力核心。那么它就必须保证稳定、不吸睛、不过度抢注意力。所以在写作时,被认为属于同一组的声部,内部最好有稳定的pattern。
  • Bus Compression: 优秀的写作往往保证同一时间只有一个注意力核心,且其余听觉流稳定、可预测、相互交织。而响度是塑造听觉流的一个重要因素。对一组声音进行整体的动态控制是为了让它们作为一个整体被感知,而不让人的注意力跑来跑去。

写作的时候其实也完全可以把思路放开,直接类比视觉设计的一些原则去设计音乐,大胆一些、大刀阔斧地写。因为音乐人自己在写作时,很容易被单个声音事件吸引注意力。但在实际聆听场景中,这些单一事件往往不会被独立感知。听众听到的会是一个整体的content,所以写作的时候保证当下的设计能服务于整体的听觉流注意力分配就ok。


结合这两天在听在看的一些内容↓

  • 鼓的Linear加花

和群友聊天讨论到鼓的fill、solo该怎么写。群友推荐了 柏倉隆史(toe的鼓手) 的POV:

线性打鼓的时候四肢的击打基本上是完全错开的,这是鼓手的基本功。但从听觉流的角度来看,由于鼓声过于密集,实际上底鼓/军鼓与通鼓/镲因为频率特性的差异,本身会被人耳分离成三条独立的听觉流。而每条听觉流内部具有流动性,所以在编曲层面完全可以把它们当成三条独立的线去和音乐的其他部分打配合,而不是把鼓当成一个不可拆分的整体。这一点在不考虑真实演奏限制、只使用DTM软音源的情况下应该更容易实现。

  • 最近在听井上拓的一些歌

井上拓最近一些比较都市的作品给人的感觉就是很精致。最近在听这首歌的时候,觉得东西很少但是又很丰满。

结合前面听觉流的总结来看,这首歌里的听觉流真的非常非常少。整体上鼓+贝斯+一大坨pad构成了一条非常稳定干净清晰一体化的律动骨骼。 贝斯的短跳、吉他的短pluck和小Percussion,它们虽然来自不同声部,但听感上额外组成了一条独立的装饰律动线。以前我会倾向于分别分析每个声部是怎么写的,但现在反而觉得完全可以把它们当作一个整体去理解,甚至混音阶段也可以作为一个组去加一点额外的shaping。

剩下的就只有vocal了。

井上拓很擅长的一点是把单一的一条听觉流做得足够丰富,又始终保持连贯。我觉得这是精致感的一大来源。