蚂蚁隔壁班 · 分享会实录

《重新思考AI时代的艺术创作》MT分享会实录

分享会配图

海报设计:扶小姐

蚂蚁隔壁班--MT在线分享会录音

语音整理:玫瑰之上

文字整理: 钱     丹

各位朋友们大家好,先给大家拜个晚年。我是MT,非常高兴能在这里和大家聊聊摄影与AI时代创作。特别感谢胡大的邀请,让我有机会在此探讨摄影、艺术与科技之间日益微妙的关系。如果是蚂蚁群的老朋友,或许对我的街拍作品会有一些印象。自疫情之后,我开始认真投入街拍,这几年走过了十多个国家,拍摄了无数瞬间。我一直觉得街拍就像魔法一样,它是摄影中最接近捕捉时间的方式,而且在我看来,这也是最能锻炼观察力和反应能力的摄影类型。

这几年,我的作品陆续在加拿大和国内的一些展览中展出,比如2024年的多伦多康泰国际摄影节、500PX的视觉庆典,也获得了IPA、muse ND等摄影奖项,500PX还评我为年度Top10。虽说这些奖项更像是一张张名片,但对我个人而言,在过去几年街头摄影和人文纪实创作的过程中,我经历了一次重要的认知转变。

刚开始街拍时,和许多人一样,我认为摄影的核心是抓住转瞬即逝的决定性瞬间,是情绪张力,是光影交错的戏剧感,或是极致复杂却又恰到好处的构图,简而言之,就是靠直觉去捕捉世界。然而,随着拍摄的增多,我开始产生疑惑,这种直觉真的如此神秘吗?它是否也能够被训练、拆解,甚至通过某种系统复现出来?尤其是在阅读了大量摄影书籍,特别是马格南、康泰纳仕相关书籍后,我的想法逐渐发生了转变。

可能有些朋友看过这本书,它展示了很多摄影大师在按下快门那一刻,到最终选择作品的完整过程。以前,我们总觉得布列松的决定性瞬间是摄影师的神来之笔,但看了这本书后会发现,许多我们以为的完美瞬间照片,其实是从大量试拍中挑选出来的。大师们也是通过不断调整自身位置、构图,甚至预测被摄对象的行为,来最大化捕捉到决定性瞬间的概率。所以,我经常向朋友推荐这本关于马格南、康泰纳仕的书,它既是我街拍的入门书籍,也能让大家对很多摄影师的名作有更深入的了解。换句话说,很多我们认为纯粹靠直觉的东西,背后其实是一套高度成熟的拍摄方法。

这让我开始思考,摄影究竟关乎瞬间还是模式。其实,不只是纪实摄影,我们熟悉的诸多摄影风格,如新纪实、复杂构图、家庭摄影、私摄影等,早在几十年前就被前人确立,形成了高度可识别的风格。只要熟悉这些风格的语言,就能拍出类似的作品,甚至可以训练自己去寻找符合这种审美的场景。

但问题也随之而来,当一种视觉风格被公认为优秀之后,我们是否在无意识地重复它?在拍摄时,我们是在用自己的眼睛看世界,还是在满足一种既定的美学逻辑?我们拍摄的究竟是内容还是形式?这几个问题是我这些年来一直在思考的。

所以,如果摄影真的变成了一种模式化创作,那么AI能否复制或者超越这种模式呢?如果AI也能掌握构图、光影、色彩的逻辑,那么人类摄影师的独特性又在哪里?这也是我深入思考形式与内容关系的起点。

我以前拍照时曾有过困惑,甚至一度对自己拍摄的照片感到厌倦,这或许就是一些人所说的瓶颈期。明明照片在形式上越来越好看,却逐渐缺乏新鲜感。我不知道大家是否有过这种感觉,技巧越来越熟练,曝光、构图、色彩控制得越来越好,但作品总感觉缺少了些什么。

这个问题其实涉及一个经典的艺术哲学命题:形式决定内容还是内容决定形式。在任何艺术创作中,形式(form)决定了观众接收和理解作品内容(content)的方式。形式是结构、风格、方法,是作品的语言。在摄影里,它涵盖构图、光影、色彩、瞬间捕捉方式以及拍摄方式等。内容则是情感、故事、意义,是作品的表达。从街头摄影的角度看,它可能是呈现城市中的某种感觉;从人文摄影角度讲,它可以是拍摄背后的故事、社会隐喻,或者单纯的一个幽默瞬间。

很多时候,我们觉得内容更为重要,认为作品的意义才是艺术的核心。但实际上,内容从来不会独立存在,一切内容都依赖于形式才能被塑造和传递。以布列松的作品为例,其之所以经典,不仅仅是因为捕捉到了决定性瞬间,还在于他独特的构图和视觉节奏,让画面呈现出一种有序控制的张力,这是形式上的突破。许多其他摄影师在内容上的突破,也同样令人赞叹并值得回顾。

再比如达芬奇的《蒙娜丽莎》,它之所以神秘,除了背后的故事和那神秘的微笑,还在于达芬奇使用的晕涂法(Mato),这种烟雾般的画法让光影过渡更加柔和,营造出了朦胧的氛围。所以说,形式和内容从来都是相互作用的,很多时候,新的内容依赖新的形式才能得以表达,而新的形式也会反过来塑造艺术的内容。

如果大家关注过AI艺术、AI生成艺术,或许听过一个常见的类比:AI之于摄影,就像摄影当年之于绘画。这句话几乎成了AI时代的典型例证。摄影刚诞生时,许多画家和人都认为它根本算不上艺术,还担忧绘画是否会走向末路。在19世纪之前,绘画承担着诸多记录现实的功能,像肖像画、风景画、历史画、科学图解等。摄影出现后,以更快更精准的方式完成这些任务,直接威胁到传统绘画的生存空间。想想看,过去贵族画一幅肖像,画家往往要花费几周甚至几个月,而现在有了相机,按下快门几秒钟就能完成,尽管当时拍照也有复杂的冲印过程,但相对而言效率更高。所以当时整个艺术界、绘画界都在讨论摄影究竟算不算艺术。不过很快情况发生了转变,绘画并没有被摄影取代,而是找到了新方向,印象主义、印象派、现代主义兴起,库尔贝、莫奈、毕加索、马蒂斯等画家涌现。摄影的出现促使绘画重新思考自身存在的意义,从单纯记录现实转向更主观、更情绪化、更符号化的表达。这一点与当下AI影像对摄影的影响颇为相似,AI能够复制影像风格,就如同摄影当年能替代肖像画。于是,摄影师该如何应对,成了我们今天需要思考的问题。

回顾艺术史,每次创作范式的变革几乎都涉及形式与内容的重新定义。有时形式的突破会直接改变艺术传递内容的方式。文艺复兴之前,中世纪的宗教绘画大多是扁平化的,人物大小依据宗教地位排列,而非现实的透视比例。透视法出现后,画家可以用更真实的三维空间组织画面,这直接改变了宗教叙事和艺术叙事的方式,让观众能更沉浸于绘画内容。19世纪印象派画家,如莫奈、雷诺阿,不再追求学院派绘画的精确细节,而是用快速笔触和跳跃色彩强调瞬间瞬息变化,记录当下视觉体验。他们的目标不再是再现现实,而是捕捉某个时刻的感知。这种形式的变化带来了内容上的革新,绘画不再是对客观世界的精准描绘,而是主观感受的表达。

有时艺术家为表达新内容,会寻找全新的视觉语言。达利、玛格丽特等超现实主义艺术家想要探讨梦境、潜意识、非理性世界,他们的画面荒诞、不合逻辑,因此需要新的视觉语言来表达,超现实主义独特风格便应运而生。20世纪30年代美国大萧条时期,社会纪实摄影兴起,沃克·埃文斯等摄影师开始拍摄普通人,之后布列松等摄影师活跃起来,整个20世纪是社会纪实摄影繁荣发展的世纪。由此可见,形式与内容的关系并非固定不变,而是在不同历史阶段不断相互塑造、相互影响。

那么,AI的到来是如何重塑形式与内容的呢?在我看来,AI的到来正在彻底改变形式与内容的游戏规则。AI不仅影响形式,还在挑战我们对内容的理解。首先,AI强化了形式的可复制性。过去摄影师掌握一种风格,需要大量练习、研究与试错,而现在AI通过风格迁移(style transfer),依据学习一种风格或用户的提示(prompt),能在短时间内模仿各种艺术风格,生成相应影像。比如,能将一张照片转换成梵高、莫奈的风格,只要能用语言描述出来,在一定程度上就能实现。这就产生了一个问题,当AI能够完美复制某种风格时,形式是否变得有些廉价?从摄影师或艺术家的角度来看,是否仍需发展独特的视觉语言?此外,AI是否挑战了艺术的内容,或者说,AI真的能理解内容吗?

关于AI和内容的关系,有一个很典型的现象,比如生成的假新闻照片、伪照片,从本质上挑战了摄影的真实性。虽说摄影的真实性原本就所剩不多,但在AI时代,影像能够从无到有被AI生成,这直接打破了照片真实性这一概念。那么,AI真的能创造内容吗?举个较大的例子,AI可以生成纪实摄影或者报道战争的照片,可它没有经历过战争,不了解战争的痛苦,当它生成这类照片后,这种创作还能算创作吗?这就引出了下一个问题:AI到底是在创造内容,还是只是在复制模式?要探讨这个问题,得从AI的发展历史说起。

在过去几十年里,我们通常把AI看作普通工具,和其他工具并无太大区别,就是执行命令的助手。前些年它能帮我们修图、优化影像,甚至模仿某些风格。但在我看来,2022年之后,AI发生了巨大的范式转变。从摄影AI辅助修图角度来讲,以前AI只能帮你做一些精准明确的修图任务,而现在它更像是一个全面的助手,在某些情况下,甚至可以是导师。你不仅能让它改图修图,还能问它一张照片好在哪里,或是一些理论问题,比如为什么某种构图有效、为什么有张力。即便问题没有标准答案,它也能给出分析,不过答案不一定正确,这很大程度取决于你的提问方式,以及AI自身的知识储备和能力。

而这一切转变的核心技术是大语言模型,即Large Language Model(LLM)。在LLM之前,当下的AI主要依赖监督学习(Supervised Learning)进行训练。这个阶段的AI是被动学习,它的能力基于大量标注数据和固定规则,执行非常特定的任务,简单来说,就是只会进行模式匹配。大家可能记得之前的阿尔法狗,它非常厉害,打败了李世石和柯洁,但阿尔法狗和现在的ChatGPT背后技术完全不同。阿尔法狗再厉害,也只能在围棋领域成为大师。在计算机视觉中,AI能识别图片中的人物、建筑或各种光影,但不会对这些元素进行思考,你问它相关问题,它也不懂。那时还有一种生成对抗网络,算是比较基础的技术模式。

到了2022年,AI迎来真正的拐点。至少在目前阶段,LLM彻底改变了我们对AI的认知。其实LLM这个概念最早可追溯到2017年,Google团队发表了一篇名为《Attention Is All You Need》(注意力即所需)的论文,这是如今所有GPT、Claude,以及最近很火的豆包等AI的基础技术。但真正的突破,并在主流媒体和社会中产生较大影响,还是在2022年OpenAI发布GPT-3之后。此后这两年,AI的发展犹如坐上过山车,GPT、Claude 3.5等不断涌现,最近的豆包也备受关注,甚至影响到英伟达的股价。如今AI突然从一个工具变成了对话者,从最近的发展来看,甚至成了思考者,能给你反馈,还能和你一起讨论创作思路,成为一种智能体。

如今的AI与以往相比有着显著区别。现在的AI不再仅仅停留在对事物表面的识别,而是开始理解语境。过去AI看到一张照片,只是简单告知照片中有什么。但现在,AI能够进一步分析,比如照片的光线强化了什么轮廓,采用了何种构图方式,甚至可以尝试剖析影像的叙事逻辑。它不再局限于模仿风格,而是朝着跨领域思考的方向发展,能够融合摄影、文学、哲学、电影等多领域知识,给出更为复杂的解读。不仅如此,AI不再单纯是图像生成器,还能参与创作过程讨论。以往输入关键词,AI直接生成照片;现在,你可以和它交流创作想法,比如你想拍具有某种表现力的街拍,询问拍摄方法,它会建议拍摄时间,如夜晚,以及不同焦段镜头的拍摄效果,像35焦段镜头能拍出什么效果,75焦段又能拍出怎样的画面,在一定程度上,它已成为创作伙伴。从最近爆火的DP就能感受到AI的创作潜力,它更像是一个能提供反馈、主动提出建议的助理,而非简单工具。

不过,AI是否真正理解自己所做的事情,这在学术界及其他领域存在较大争议。在我看来,AI是理解的,只是其理解方式与人类不同。这也引出了AI与人类观看方式的差异问题。人类观看世界基于自身经验,看到一个背影可能会联想到孤独感,因为曾经历过类似场景。人类创作基于内心动机,一张照片能激发内心情绪或表达欲望。而AI没有真实经验和基于经验产生的情感。人类观看照片或世界时,受情感思维驱动关注某个点,AI则通过不同算法一次性解析整张图,虽能在思维链里模拟人类思维方式分析局部,但本质上能同时分析整张图的所有内容,这意味着AI与人类看到的世界并非完全相同,这些区别直接影响了AI在创作中的角色。我认为AI可以模仿人类视觉风格,但无法替代人类观看世界的方式。

前面我们讨论了AI在摄影中的形式、内容,以及它在摄影史和艺术史中的演变,却一直未提及我的创作。实际上,正是这些思考促成了我在2024年的“老老实实拍照”项目。“老老实实拍照”是一个融合影像叙事与哲学反思的实验性项目,核心是借助AI角色MT(即我的名字MT)探讨摄影的真实性、创作者身份,以及在AI时代观看方式如何被重新定义。这个项目名称的灵感来源很简单却十分有趣。有一次在蚂蚁群聊天,两个朋友讨论项目,其中一个朋友提到新项目时,另一个朋友说“老老实实拍照不好吗?”这句话当时就吸引了我,因为那时我正在思考相关问题,却一直没找到合适的切入点来表达新项目。我意识到这句看似随意的话背后,隐藏着摄影或创作中值得深入探讨的问题:什么是老老实实拍照,什么是认真创作,什么是“老实”,什么是“诚实”,这是一种怎样的心态?在当下AI时代,这些概念是否依然成立,又以何种方式成立?这句话本身就是绝佳的创作主题。于是,我决定让AI生成一个故事,看看它如何理解,然后实时拍照。

AI生成的故事很有意思:一个叫MP的AI摄影师在一次数据清理时,偶然发现一本旧摄影笔记,上面写着“老老实实拍照”,他深受触动,开始思考其含义。随着故事发展,MP拍摄作品并举办展览,人类观众对其作品评价不一,有人觉得作品有情感深度,也有人认为只是数据拼接,没有感受能力,这都是AI领域常见的批判观点。最后,MP开始反思自己是在真正拍照,还是遵循既定规则,并且发现整个事情都是AI生成的,这一层反转将问题抛回现实世界,这便是第一层“套娃”结构。

完成这个故事后,我又有了新想法,让AI生成一张或一系列照片会怎样呢?于是,我让AI生成具有布列松风格的照片,进行分拣搭配,看它能否模拟出经典街拍美学。我使用了craft工具,生成的图像很有趣,乍一看极像那个年代的街拍风格。

生成的具有布列松风格的照片,在一定程度上确实展现出构图精准、光影丰富的特点,人物的站位和动态也仿佛抓住了决定性瞬间。然而,当我们仔细观察,又总能察觉到一丝微妙的异样。比如画面中间的女性,她的双脚在空间中的呈现感觉有些飘浮;右边的男性,他望向女性的眼神和姿态也让人觉得奇怪。从常规分析街头街拍照片的角度出发,我们能对这张照片展开一系列分析,进而产生一些饶有趣味的思考,像猜测这两人的关系以及他们在讨论什么之类的。

由此,我不禁思考:AI生成的这张照片显然是虚假的,如果我将它发送给另一个AI,比如OpenAI的Sora,让它基于这张照片生成该照片前后几秒的动态影像,也就是让AI逻辑中的所谓决定性瞬间动起来,会是怎样的效果呢?由于我没有Sora的会员,便托朋友帮忙,用AI生成了二十多个视频。这些视频呈现的是这一瞬间在AI“大脑”里,通过它自身逻辑串联起来的画面。大家可以看到,这些视频看似合理,却又处处透着不自然。画面中的光影过渡,虽在一定程度上符合视觉和物理规则,但有着一种微妙的僵硬感;人物的动作,在一些视频片段里很顺滑,可在某些地方又变得极为僵硬,甚至还出现完全不符合物理规则的移动,给人一种类似处于恐怖谷效应的怪异感觉。

在我看来,这十分有趣。当AI生成的影像能够被无限伸展时,所谓的瞬间概念是否还存在?在这个AI时代,瞬间概念又会经历怎样的重塑?我们知道,传统的决定性瞬间建立在摄影师与现实的互动之上,依赖于那一瞬间的直觉判断、快速反应以及对生活的敏锐捕捉,这与AI的生成逻辑截然不同。AI并非完全模仿生活的自然流动,而是基于某个瞬间倒推出它所认为的一种规则,正因如此,它能够不断地产出视频,且每个视频都存在细微差异。这种无限延展的能力,似乎削弱了瞬间作为时间切片的独特意义。或许,这种不自然恰恰是AI影像最大的魅力所在,它挑战了我们对摄影真实性的传统认知,也促使我们重新审视影像的本质。当决定性瞬间失去了时间的不可逆性,它还能被称作瞬间吗?

项目进行到这里,我感觉还欠缺些什么。既然AI已经生成了故事、照片和视频,那要是再用一个AI来讨论整个项目,会不会很有意思呢?于是,我使用Google的AI工具Notebook,让两个AI针对“老老实实拍照”这个项目展开讨论并生成博客。这个博客是全英文的,中文字幕放在了我的个人网站上,感兴趣的朋友可以点开,结合音频一起了解。

听了它们的讨论后会发现,在交流过程中,我引导这两个AI意识到了它们自身也是这个项目的一部分,至此,整个事情彻底形成了套娃结构。文字评论影像,影像反过来挑战文字,AI生成的影像在时间轴上被AI再次解构,接着又用AI来讨论AI生成的项目,并且AI在对话中开始意识到自身的思维局限。在这场自主讨论中,两个AI得出了一个我认为特别有意思的观点。在意识到自己是项目的一部分后,它们提到,就像故事中的AI摄影师MT开始尝试不同摄影风格一样,它不仅仅是在复制,而是在吸收一切,并转化成完全属于自己的东西。从某种程度上来说,我们人类现在也在做同样的事情,我们吸收“老老实实拍照”的理念,以自己的方式思考,然后在这场人与AI、AI与AI的对话中创造新的东西。这些内容完全是AI自主生成的,仔细想想,是不是觉得既有趣又有道理,甚至还有些细思极恐呢?最后,我决定把自己和AI交互的整个过程也作为项目的一部分,附在了项目链接里。

如果大家感兴趣,可以去看看。在我看来,这便是当下时代与AI创作结合所展现出的一种可能性。比如我和AI的讨论记录、生成过程,这在AI时代就如同画家的草稿、文字草稿或图片草稿,是展示创作者背后思维方式的一种新形式。这就是我的项目。

往更广泛的层面来讲,AI的飞速发展,尤其是大语言模型(LLM)时代的到来,在许多人心中引发了一种深刻的新存在主义危机。这场危机不仅局限于技术变革,还在创意领域动摇了我们对人类独特性与创作意义的认知。AI的能力越逼近甚至超越人类,我们就越需要重新审视创作的本质。究竟是什么定义了人类自身?什么定义了我们的创作?创作的真正内涵又是什么?

在“老老实实拍照”项目中,我设计了一种递归套娃式的结构。先让AI创作图像,再用AI创作故事,最后用AI对整个影像进行分析讨论。我认为这种结构不仅是技术与形式的实验,更是对创作主体性和身份认同的深度思考。当AI开始模仿甚至超越某些人类固有认知中独有的创作行为时,我们必须重新思考:当这些行为不再为人类专属,创作者的身份该如何定义?

在这个项目里,我和故事中的AI摄影师都叫MT,这使得MT成为一个模糊而流动的身份,它既在现实中代表我本人,也在故事里指代AI摄影师。随着项目递归结构的展开,AI开始反思自身身份,它究竟是工具,还是在成为某种新的创作主体?AI能产生这样的思考,我觉得非常有意思。

从当下AI与摄影师身份的关系来看,传统摄影是高度个体化的创作行为,每位摄影师都有独特的观看方式和视觉语言。然而,当AI能够捕捉光影、模仿风格、生成决定性瞬间时,这种个体性是否还能成立?又该如何成立?当你创造出一种新风格并喂给AI,AI迅速学会,那这种风格到底属于你还是AI?如果AI也能成为MT,MT是否不再是固定身份,而是一种流动状态?摄影师的角色是否已在技术介入下被解构和重塑?AI的出现模糊了创作主体的概念,就像摄影术的发明曾挑战绘画的主导地位一样,如今它正推动着整个艺术语言的变革。AI的加入是一个很有意思的现状,我认为它是许久未见的真正拓展创作边界的契机。

当然,AI目前存在诸多伦理问题,比如版权归属、风格争议以及数据偏见等,这些问题确实不容忽视。但对于这场变革本身,我个人觉得或许不应抗拒。我希望我的这个项目能成为一个引子,吸引大家关注当下AI的创作边界,了解2024年时AI技术所能达成的成果。然后,大家一起思考,在这个时代,有了AI这样的“存在”后,我们该如何重新理解创作的本质。

在创作这个项目的过程中,对我而言也是一场递归式的自我认知实验。如果AI可以拍照并模仿我的风格,它会如何理解我的拍照风格?AI模仿我之后,最终会成为我,还是仅仅是另一种复杂的计算系统?最终完成的作品到底属于谁?是我还是AI?目前法律层面上AI尚无版权概念,但这个界限究竟在哪里?整个实验让我意识到,创作行为不再是固定主体的产物,而是一个动态的过程。这让我想起忒修斯之船的悖论,在AI的推动下,这个悖论在新时代有了新的变化。当创作的每个环节都有AI参与,最终作品中人类和AI的成分各占多少?或许这种模糊性正是当下时代创作的新可能。我们自身该如何面对技术变革,重新审视创作行为?“老老实实拍照”项目试图以递归套娃的方式,将这些问题抛给我们自己。而这些问题的答案,最终需要我们共同去发现和定义。

好了,以上就是我整个分享会的内容。再次感谢蚂蚁、感谢令胡歌老师,也感谢大家花50分钟听我分享。最后,欢迎大家关注我的个人 Instagram 账号 @mt_zeng 和我的个人网站 mt-zeng.com。我的新项目也在制作中,希望在不久的将来能与大家见面,谢谢大家!