国际期刊投稿平台
登录 | 注册
当前位置: 首页 > 工程建设与科学管理 > 人机交互过程中用户端的多模态话语分析——以Google Gemini测试视频为例
工程建设与科学管理

工程建设与科学管理

Engineering Construction and Scientific Management

  • 主办单位: 
    未來中國國際出版集團有限公司
  • ISSN: 
    3079-708X(P)
  • ISSN: 
    3080-0781(O)
  • 期刊分类: 
    工程技术
  • 出版周期: 
    月刊
  • 投稿量: 
    1
  • 浏览量: 
    426

相关文章

暂无数据

人机交互过程中用户端的多模态话语分析——以Google Gemini测试视频为例

Multimodal Discourse Analysis from the User’s Side in Human-Computer Interaction: A Case Study of Google Gemini Testing Videos

发布时间:2026-08-25
作者: 仝晓珂 :河南科技大学 河南洛阳; TONG Xiaoke :School of Foreign Languages, Henan University of Science and Technology, Luoyang;
摘要: 多模态人机交互已经成为科技发展的趋势,特别是在提供更自然、高效交流方式的同时,多模态AI模型如Google Gemini的出现,极大地推动了这一领域的发展。本文从张德禄的多模态话语分析理论框架,结合系统功能语言学,分析Gemini测试视频中测试者的多模态话语使用情况,及其如何运用多种模态构建意义与智能体进行互动交流。结果表明为实现用户的整体讲话意义、取得最佳交际效果而采用的各类多模态交际模式中,不同模态的表现和模态之间的关系。在与Gemini的多模态人机交互中,用户多用话语模态和图像模态,不同模态之间存在不同关系。
Abstract: Multimodal human-computer interaction has become a trend in technological development, particularly in providing more natural and efficient means of communication. The emergence of multimodal AI models such as Google Gemini has significantly advanced this field. Drawing on Zhang Delu’s theoretical framework of multimodal discourse analysis, in conjunction with Systemic Functional Linguistics, this study examines the testers’ use of multimodal discourse in the Gemini testing videos, and explores how they employ various modes to construct meaning and interact with the intelligent agent. The findings reveal the manifestations of different modalities and the intermodal relationships within the various multimodal communicative patterns adopted by users to realize their overall speech meaning and achieve optimal communicative effects. In the multimodal human-computer interaction with Gemini, users predominantly employ the linguistic mode and the visual mode, and different relationships are observed among the various modalities.
关键词: 多模态话语;模态;人机交互;Google Gemini
Keywords: multimodal discourse; modality; human-computer interaction; Google Gemini

引言

随着科技的发展,人机交互已成为一个日益重要的研究领域。传统的人机交互方式往往依赖单一的输入和输出模态,例如键盘输入和屏幕显示。而如今,多模态人机交互作为一种新兴的交互方式,强调通过结合多种感知模态(如语音、图像、触觉、手势等)来实现更加自然、灵活和高效的交流方式。人机交互对话越來越多模态化。

Google Gemini 是 Google 于 2023 年推出的下一代人工智能(AI)模型系列,旨在整合多个前沿技术,提供强大的多模态处理能力,它能够理解和生成文本、图像、视频等多种形式的内容。Gemini 支持文本、图像、视频等多种数据形式的处理 and 生成。相比于传统的单一模态模型,Gemini 能够更加全面地理解和交互。例如,用户可以同时输入图片和文字,Gemini 能够通过这些多模态输入产生更为丰富、准确的响应。

在多模态人机交互过程中,模态不仅各自独立地传递信息,还通过复杂的协同与互补作用共同塑造交互体验。这一现象涉及到对多种模态如语言、视觉、听觉等的综合运用。因此,研究多模态话语分析在这一领域中的应用显得尤为重要。多模态话语分析是对不同符号系统(如语言、图像、声音等)如何共同作用以构建意义的研究。虽然多模态话语分析借鉴了皮尔斯等人的符号学理论,尤其是媒介、对象和解释三位一体的概念,但其核心理论基础主要源自韩礼德(Halliday)创立的系统功能语言学。韩礼德的理论强调语言作为社会符号和意义潜势的观点,认为语言不仅仅是沟通工具,其他符号系统(如视觉、音频等)同样是意义的载体。在国内,胡壮麟的“社会符号学研究中的多模态化”讨论了多模态符号学和多媒体符号学的区别,介绍了具有媒体和模态双重特性的计算符号学,并指出人类进入社会符号学多模态化的新世纪,对多模态识读能力的培养应引起重视。李战子用系统功能语言学理论对多模态话语理论的研究。朱永生认为将语言与其他相关符号资源整合,全面、准确才能解读话语意义,多模态话语分析是针对传统话语分析的局限性而兴起的研究领域,该领域强调非语言意义表现形式,如视觉、听觉、触觉等,与语言系统共同构成了话语意义。张德禄提出多模态话语分析综合理论框架,该框架由文化层面、语境层面、意义层面、形式层面和媒体层面五个层面构成。张德禄认为,多模态话语分析不仅关注语言系统,还要关注由听觉、视觉、触觉等多种感官系统形成的交际模式。他提出,在多模态话语分析中,应区分不同模态之间的互补关系 and 非互补关系,并在此基础上建立多模态话语的语法系统。在具体的研究方法上,多模态话语分析采用定性分析 and 定量分析相结合的方法。黄立鹤和张德禄也探讨了多模态研究的范式、路径及领域问题,认为多模态研究是整合多种路径并具有多个领域的整合性研究范式。

目前多模态话语分析理论在广告、教育、新闻传播等领域已取得广泛应用,针对人机交互中的多模态协同 and 语篇构建的研究仍较为匮乏。尤其是在动态 and 复杂的交互场景中,不同模态如何协同作用,以优化用户体验,仍然是一个亟待深入探讨的问题。本文将从多模态话语分析的理论框架出发,探讨多模态话语在现代人机交互中的应用,分析语言、图片、音频等多种模态在交互过程中的协同作用,具体研究以下问题:多模态人机交互过程中用户如何使用使用模态资源构建意义?

理论框架

多模态话语指的是通过多种感觉如视觉、听觉、触觉等 and 符号系统如语言、图像、声音、动作等进行交际的现象。张德禄基于系统功能语言学理论结合 Lim 在研究图画与语言形成的多模态话语时提供的综合性多符号模式框架提出了由文化层面、语境层面、内容层面 and 表达层面四个层面组成的多模态话语分析综合理论框架。张德禄把多模态话语的形式分为语言、声音、图像、感觉等,并把这种多模态话语形式之间的关系归纳为:互补关系(强化 and 非强化)和非互补关系(交叠、内包 and 语境)两大类。

在一定的文化语境中要根据具体的情景语境(语场、语旨、语式)和交际目的选择所表达的意义并以合适的模态及其体裁结构体现出来。所选择的意义可以由图像体现即由视觉模态体现也可由声音体现,即由听觉模态体现。在系统选择中最关键的因素是利用好不同模态之间的关系使不同的模态相互配合从而构建动态多模态话语的整体意义因为不同的模态体现的意义属于同一个交际事件需要整合为一体才具有交际意义。这种模态之间的配合主要是在模态的形式层面,即在词汇语法层面表现出来。张德禄把这种多模态话语形式之间的关系归纳为:互补关系(强化 and 非强化)和非互补关系(交叠、内包 and 语境)两大类。模态之间的关系往往随着时间的变化呈现动态变化过程:有时是话语为主,图像动画为辅。有时图像动画为主,话语为辅。图像当中的文字也与图像形成一定互补关系。两者之间关系的变化是和交际事件的进程密切相关的动态多模态话语分析需要探讨这种动态性的图文以及话语与动画的关系。

2 语料 and 研究工具

语料

本文语料为Google于2023年推出的人工智能(AI)模型Gemini的测试视频,除去片头 and 片尾,总时长为5分钟47秒。语料的转写参照官方网站视频。为了便于分析本文把整段录像进行切分。对录像等动态多模态语篇进行切分参照张德禄的三个标准:语篇结构、经验意义、前景化的事物 and 特征。这段录像的体裁结构包括6个阶段,可再分为17个事件,这19个事件可分为三大类,即提供信息类、决策类 and 互动类。对组成录像的19个事件的具体转写如表1所示。

表1 Gemini测试视频语篇模态划分
多模态话语交际模式 数量 比率 模态
提供信息类事件:2、3、9、10、16、17、19 7 0.37
判断类事件:1、6、8、11、12、13、14、15 8 0.42
互动类事件:4、5、7、18 4 0.21

研究工具 and 研究方法

本文采取定性分析为主辅以量化分析的研究方法,定量分析借助多模态话语分析软件ELAN6.7对测试视频进行转录,从而统计各种符号资源的使用频率,转录结果见表2。具体研究过程如下:基于张德禄多模态话语分析框架从情景语境、多模态话语交际模式 and 多模态话语模态间的协同三个方面对语料进行分析研究。受篇幅所限,无法全方位呈现各集实例,定性分析主要对其多模态话语交际模式 and 测试视频中的典型语料判断类事件1、提供信息类事件3、互动类事件4中多模态协同关系进行深入阐释。

Gemini测试视频中用户使用的多模态话语分析

Gemini测试视频的情景语境分析

根据系统功能语言学理论情景语境是文化语境的具体体现包括三个变项:语场(field)语篇所涉及的社会活动;语旨(tenor)交际双方的社会角色关系;语式(mode)交际的媒介 and 渠道。在Gemini的测试视频中可具体描述为:

  1. 语场:视频展示了 Google Gemini 的技术 and 功能,尤其在多模态(语言、视觉、听觉)感知与交互上的能力。视频中的活动包括用户与系统的互动、任务的完成等。
  2. 语旨:在视频中,系统与用户的关系是典型的“人类—机器”关系,视频中的用户是交互的主动方,代表普通人类与系统的互动。Google Gemini作为回应方,充当智能助手的角色,它回应用户的语言命令,通过视觉识别、反馈等方式响应用户的需求。
  3. 语式:测试视频交互呈现高度互动性,涉及用户与Gemini之间的问答式对话。语言风格简洁明了,语气友好、直接。信息通过多模态(语音、文本、图像)流动 and 反馈,增强了交互的自然性 and 有效性。用户通过语音或文本提出问题,而系统通过多模态反馈(语音、图像、文字等)来回应。这种交互的模式是即时反馈 and 对话式的,属于高互动性的模式。系统使用简洁、清晰 and 有帮助的语言,避免过于复杂的专业术语。

Gemini测试视频中用户使用的多模态交际模式

Gemini 是 Google 推出的一个先进的多模态人工智能系统,旨在融合语言、图像、视频 and 其他模态的信息处理 and 生成能力。它是比传统 AI 更加全面、灵活 and 智能,能够理解 and 生成多种类型的信息,如文字、图像、视频等,能够在多个模态之间进行协调 and 融合,进行复杂的任务处理。

在测试视频中多种模态的协作也是必然的。Gemini作为一款多模态人工智能体,其多模态交互的核心目标通过同时支持语音、文本、图像等多种输入方式,提升用户体验。相应地,用户希望与技术的交互尽可能地自然、直观 and 高效,而多模态交互正好可以满足这些需求。用户可以根据自己的需求选择最方便的方式进行交互,使得操作更为简便 and 人性化。最终,这种多模态交互能够实现更加智能、灵活、富有创造力的 AI 体验,拓宽其应用场景,提供更加个性化 and 高效的服务。

因此只有充分利用多模态人机交互智能体的优势,使语音模态、图像模态、手势模态 and 其他非语言模态系统相互协作、相互补充,通过结合语音、图像、手势等不同模态的输入,提升交流的自然性、精准性 and 多样性。实际上,在这个过程中不同模态之间承担着不同的角色,有着不同的关系。当一种模态不足以表达清楚交际者的意义,从而利用另一者来进行强化、补充、调节、协同,达到更加充分,或者尽量充分表达意义,以达到人机交互的目的。

表2 多模态符号资源标注结果
表2
表3 话语符号资源语式分类标注结果
表3

从表2中的标注比例可以得出,话语资源在用户与Gemini互动的意义建构过程中占据主导地位,其次是图像资源,手势资源最少。因此可以看出话语资源统引领整个人机交互的过程。在标注过程中,本文又对话语进行疑问句、感叹句、祈使句 and 陈述句的分类,分类结果见表3,分析发现疑问句使用频率最高,其次是感叹句。疑问句的使用表明用户在寻求信息、解答疑惑或进行认知探索,需要Gemini提供明确的答案、建议或反馈。感叹句则更多涉及用户的情感需求 and 情绪表达,在多模态的交互中,这些感叹句传达了用户在与Gemini交互时的情绪反应,可能是在对Gemini的回答或行为表示惊讶、钦佩或激动。Gemini在回应时,可以根据这种情感表达调整语气,使互动更具人性化 and 情感化。在多模态人机交互中,陈述句 and 祈使句的使用也各有其特定作用:陈述句主要用于表达信息、传递事实或描述事物,用户通过陈述句向Gemini提供信息或表达情感。祈使句则用于发出请求、给出指令、建议或命令。

而在图像、物品 and 手势符号资源方面,三者所占标注总数量也不少。此外,平均标注时长反映了不同符号资源在用户与Gemini互动的意义建构过程中的影响程度,图像符号资源在整个标注过程中占据了最长平均标注时长8.086秒,这说明图像在多模态人机交互意义构建过程中使用频率高,使用便利。其次是物品,最后分别是手势 and 话语。这说明用户在构建意义的符号资源选择方面更加多元。

Gemini测试视频中用户使用的模态间的协同关系分析

3.3.1 判断类事件1中用户使用的模态间的协同关系分析

事件1图A事件1图B 事件1图C 事件1图D
图1 事件1

事件1属于判断类事件,用户向Gemini展示一张纸,用黑色马克笔在纸上逐步画出鸭子,用波浪线代表河流,暗示鸭子的生存环境,并用蓝色 and 橙色画笔给鸭子填色。这是因为绘画过程中形成的图像模态是线性模态,是根据时间向前推进,这符合信息获取循序渐进的特点。事件1涉及图像资源 and 物品资源的使用。在此过程中,用户通过3句话语资源与Gemini进行对话,分别为:What did you see? What about this? Yes.

由图1所展示的图像资源、物品资源与转录过程中话语资源对比,用户绘画过程中形成的图像模态是主模态,与绘画所运用的物品模态二者缺一不可,互为补充,为语境交互类的互补强化中的扩充关系,共同表达用户的整体意义。用户与Gemini对话过程中形成的话语模态在意义体现上贡献不大,但作为一种模态出现,为图像模态提供语境信息。因此,图像模态 and 物品模态与话语模态是语境交互类的非互补关系。此事件不涉及手势模态。

3.3.2 提供信息类事件3中用户使用的模态间的协同关系分析

事件3图
图2 事件3

事件3属于信息提供类事件,用户向Gemini展示一张地貌类世界地图的平面图,并在地图上放了一只蓝色橡皮鸭。事件3包含图像 and 物品模态资源的使用,在事件3中用户与Gemini无话语交流 and 手势模态的使用,没有参与交际过程。但Gemini仍然基于鸭子禽类的属性与其在地图中海洋上的位置,对其习性、栖息地、族群进行分析,并向用户给出关于鸭子去向的建议。因此,在事件3中物品资源为主模态,为背景的图像模态与物品模态为互补类的强化突出关系。

3.3.3 互动类事件4中用户使用的模态间的协同关系分析

事件4图
图3 事件4

事件4属于互动类事件,事件4是在事件3基础上形成的,因此图像模态不作为新的模态统计。在此事件中用户使用了话语模态 and 手势模态,不涉及物品模态。用户通过指令:“Base on what you see, come up with a game idea. Oh ,use emojis, please.”要求Gemini生成一个使用表情符 and 语言提示的互动游戏。Gemini生成一个根据提示猜国家的游戏。用户通过“Sure,let’s do it ”回应并同意了Gemini的提议。如图3所示,用户通过手势指出答案。

事件4中话语模态是主模态,没有话语模态的使用这个互动游戏就不会产生。在互动过程中,虽然手势模态也能充分表达意义,但是不起关键作用,对整体意义的表达没有新的贡献,而只是给予更加具体的信息属于不互补关系中的内包关系。

Gemini用户所使用的模态之间的协同关系讨论

在Gemini多模态人机交互过程中,涉及了四种模态,即话语模态、图像模态、手势模态 and 物品模态。在不同的事件中,用户会运用不同模态的组合,在这些组合中,有时话语模态占据主导地位,有时图像资源占据主导地位。不同的模态之间也存在者不同的关系。科技的发展是多模态的使用成为可能。让用户在与智能体互动在多元、灵活的构建意义。

模态的选择涉及最佳搭配问题不是完全自由、随意的。不同模态实际上都是为了体现讲话者的整体意义的。多模态模式是一种模态不能充分表达其意义,或者无法表达其全部意义,需要借助另一种来补充,以实现最佳交际效果。从模态配合的角度讲,模态配合要以增加正效应为原则,例如相互协调、相互强化等。如当图像模态或手势模态能够表达用户意图,并占主导地位时,话语模态这类人们日常交际中常使用的模态也可以作为补充,甚至可以不出现。

结论

通过以上分析可见动态多模态话语分析需要按照时间的进程,根据各个阶段的交际目标选择合适的模态或模态组合。本文讨论了在人机多模态交互中,为实现用户的整体讲话意义、取得最佳交际效果而采用的各类多模态话交际模式中,不同模态的表现 and 模态之间的关系。在与Gemini的多模态人机交互中,用户多用话语模态 and 图像模态,它们在不同场景下承担了不同的角色。例如,在判断类事件中,图像模态作为主模态,辅以物品模态,而话语模态则提供语境信息;在提供信息类事件中,物品模态成为主要的模态,图像模态起到补充说明的作用;互动类事件则主要依靠话语模态,手势模态虽参与但不是关键作用。本文初步讨论了人机交互用户端的多模态话语,但仍存在不足之处。综上所述,多模态话语分析理论为我们提供了一个理解 and 分析人机交互中意义构建的理论框架。随着技术的进步,尤其是多模态AI模型的发展,未来的人机交互将更加高效、自然 and 富有创造性。

参考文献:

  1. [1] 张德禄.多模态话语分析综合理论框架探索[J].中国外语,2009,6(01):24-30.
  2. [2] 胡壮麟.社会符号学研究中的多模态化[J].语言教学与研究,2007(01):1-10.
  3. [3] 李战子.多模式话语的社会符号学分析[J].外语研究,2003(05):1-8+80.
  4. [4] 黄立鹤,张德禄.多核并行架构:多模态研究的范式、路径及领域问题之辨[J].外语教学,2019,40(01):21-26.
联系我们
人工客服,稿件咨询
投稿
扫码添加微信
客服
置顶