
中国文学与艺术
Journal of Chinese Literature and Arts
- 主办单位:未來中國國際出版集團有限公司
- ISSN:3079-3688(P)
- ISSN:3079-9104(O)
- 期刊分类:文学艺术
- 出版周期:月刊
- 投稿量:4
- 浏览量:627
相关文章
暂无数据
基于语料库的《狂人日记》人机翻译风格对比研究
A Corpus-Based Comparative Study of Human and Machine Translation Styles in A Madman’s Diary
引言
随着人工智能技术的飞速发展,机器翻译已经逐渐从最初的简单词汇转换走向更为复杂的句子级和语篇级翻译,尤其在文学翻译领域的应用也开始引起广泛关注(葛颂, 王宁,2024)。近年来,基于深度学习的翻译模型,如OpenAI的ChatGPT,已经在翻译质量、流畅度和速度上展现出了显著优势(张文煜,赵璧,2024)。然而,尽管人工智能翻译在多个领域取得了令人瞩目的成果,其在文学翻译中的表现依然存在诸多挑战,特别是在语言风格、文化内涵和修辞技巧的传达上(王宁,2024)。不同于普通的实用性文本,文学翻译不仅仅是词语的转换,更是一种情感、文化和创意的传递(吕俊,2002)。翻译风格的差异,正是文学翻译中译者主体性与翻译策略发挥作用的体现(仲伟合, 周静,2006)。翻译风格是翻译研究中的重要议题,涉及译者的主观意图、翻译策略和译文的语言表现(胡开宝,田绪军,2023)。翻译风格研究不仅关注翻译结果的语言特征,更强调翻译过程中的文化、情感和思想的再现(唐述宗,2002)。传统的翻译风格研究常采用单一的定性方法,围绕译者的翻译策略展开分析,并从语言外部维度观察译文的整体特征(王克非,2011)。Baker(2000)指出,译文中不可避免地会带有“译者的指纹”,并率先运用语料库方法对此展开考察。国内学界相关研究亦逐步推进,不仅研究层次多元,且成果颇为丰硕(黄立波, 石欣玉,2018; 乐明,余潇慧,2022; 王梦瑶,2024; 孔德璐,2025)。鲁迅的短篇小说《狂人日记》是中国现代白话文小说的奠基之作,其叙述与语言风格具有重要研究价值(朱珊,2021),已有众多译本问世,其中杨宪益、戴乃迭合译的英文译本流传甚广。随着机器翻译技术的发展,诸如ChatGPT等人工智能工具开始在文学翻译领域崭露头角,研究人机翻译的差异已成为翻译学界的新热点(李奉栖,2022)。本研究旨在对比分析机器译本与人工译本之间的翻译风格差异,重点探讨两者在词汇、句法、语篇层面的不同表现及其成因,以期为人机翻译在文学翻译中的应用提供新的视角。
一、研究设计
(一)研究问题
本研究旨在探讨人类译者与人工智能模型(ChatGPT)翻译鲁迅《狂人日记》时在风格上的差异及其成因。具体而言,本研究关注以下两个核心问题:其一,两种英文译本在文本特征上存在何种差异?其二,这些译文风格差异的成因有哪些?
(二)语料来源
本研究的语料库由三部分文本组成:中文原文:鲁迅所著短篇小说《狂人日记》全文;人工译本:由杨宪益和戴乃迭合作翻译的英文译本;ChatGPT译本:使用OpenAI的ChatGPT-4模型生成的英文译文。人工译本选取杨宪益、戴乃迭译本是因为其在国内外广为流传并具有代表性,而ChatGPT译本则代表最新的人工智能翻译水平。对于ChatGPT译文的获得过程,需要加以说明:本研究使用ChatGPT-4模型,在对话界面中输入明确的翻译指令“请将鲁迅《狂人日记》全文翻译成英文,完整保留原文的文学风格,不添加额外注释或解释性文字”,模型根据该指令生成了英文译文。为了保持译文的纯粹性与客观性,直接采用ChatGPT的原始输出作为语料,未进行任何人工改动。
(三)研究方法
本研究采用基于语料库的定量对比方法,对两种英文译文的语言特征进行系统分析。研究流程包括语料预处理、语料特征提取与语料指标比较三个环节。
首先是语料预处理。对原文和译文的格式进行清洗,统一编码并去除多余的符号或空行,确保文本内容纯净可比;处理可能出现的乱码字符,使文本内容准确无误;采用平行对齐工具Tmxmall将中文原文与两个英文译本按照段落进行对齐。
接下来是语料特征提取。本研究借助Coh-Metrix3.0文本分析工具对两份英文译文进行文本语言特征分析。Coh-Metrix广泛应用于文本衔接性测量、语体判断、写作特征分析和阅读难度评估等研究领域,具备可靠的多层次文本特征提取能力,能够自动计算文本在词汇、句法、语义、篇章等层面的106项统计指数。在本研究中,我们重点关注Coh-Metrix输出的与译文风格相关的若干维度指标,包括但不限于:词汇多样性、句法复杂度、可读性、连接词使用,以及语篇连贯与衔接性。通过将两种译文在上述各维度的指标数值进行提取,可以定量分析译文在语言特征上的差别。
最后是定量对比。对于两份译文,Coh-Metrix都会给出相应指标的数值结果。本研究将把两译文的指标数据进行对比分析,采用表格形式列出主要特征维度下两译文的数值差异,并结合必要的统计描述进行说明。通过量化比较,直观分析人工翻译与机器翻译在文体风格上的不同。
二、结果分析
(一)词汇层面
在词汇层面比较两种译文的用词丰富程度和其他特点(如表1)。
| 指标 | ChatGPT-4译本 | 杨与戴合译本 |
|---|---|---|
| 总词数 | 3649 | 3949 |
| 内容词多样性 | 0.484 | 0.456 |
| 词汇丰富度 | 102.44 | 93.02 |
| 平均词频(log10) | 2.413 | 2.485 |
| 平均词长 | 4.18 | 4.04 |
| 人称代词密度(‰) | 133.7 | 144.8 |
从总词汇量看,杨与戴合译本的长度略高于ChatGPT译本(3949词vs3649词),说明人工译者在篇幅上稍有增益。词汇多样性方面,ChatGPT译本略胜一筹。其内容词型符比(TTR)为0.484,高于人工译本的0.456;另一个词汇丰富度指标MTLD也显示ChatGPT译本达102.44,而人工译本为93.02。这表明ChatGPT译文用词更加多样,不频繁重复同一词汇,而人工译文在措辞上重复率稍高,词汇丰富度略低。词频指标显示出两者用词常用程度的差异:ChatGPT译本内容词的平均词频(以对数计)为2.413,低于人工译本的2.485。较低的词频意味着ChatGPT译文中使用的词汇稍微偏生僻、书面,人工译本则更多采用常用词汇,用词更通俗易懂。词长方面,ChatGPT译本平均每词4.18个字母,略高于人工译本的4.04个字母,平均音节数也略高(ChatGPT译本1.34音节,人工译本1.30音节),佐证了ChatGPT译本倾向使用字较长的单词,可能包含更多多音节专业词或正式用语。相应地,人工译本用词稍显简洁。人称代词的使用频率也体现出一定差异:ChatGPT译本每千词人称代词约133.7次,而人工译本高达144.8次。这表示人工译者更频繁地使用“I, you, he”等人称代词来指代人物或事物,强化上下文衔接;相比之下,ChatGPT译本则更倾向于直接使用名词重复或其他方式,较少依赖代词指代。这一点从名词使用比例也可得出:ChatGPT译本名词密度略高于人工译本(每千词194.8 vs180.8),说明其用更多名词来替代代词描述。同样,ChatGPT译本的形容词、副词密度也略高于人工译本,表明其倾向于较丰富的修饰。综合来看,ChatGPT译本在词汇层面呈现出用词丰富、较正式的风格:词汇选择多样且偏书面,词长和复杂度略高;而人工译本用词更偏口语化和简明,常用词和代词出现更多,使文本显得自然流畅。
综上所述,ChatGPT译本相对呈现高复杂度和高多样性的特征,用词较为正式生僻,词汇重复率低;人工译本则用词更加平实、直白,倾向于常用词和代词,整体可读性略高。两种译文在用词选择上的差异反映了机器翻译和人工翻译在风格上的不同侧重:前者追求词汇丰富和精确,后者注重通俗易懂和连贯。
(二)句法层面
在句法层面比较句子长度、结构复杂度以及短语构造等指标(如表2)。
| 指标 | ChatGPT-4译本 | 杨与戴合译本 |
|---|---|---|
| 平均句长 | 14.77 | 15.79 |
| 连接词密度(‰) | 88.8 | 100.0 |
| 名词短语密度(‰) | 330.2 | 340.1 |
| 介词短语密度(‰) | 78.7 | 89.1 |
从平均句长看,ChatGPT译本每句约14.8词,略短于人工译本的15.8词,说明人工译者倾向于使用稍长的句子来表达完整意思,而ChatGPT译本可能通过拆分句子使之更短。在句子长度变化方面,人工译本句长的标准差为11.27(词),略高于ChatGPT译本的10.25,表示人工译本中长句和短句的落差更大,句式更加灵活多样。连接词的使用频率差异显著:ChatGPT译本每千词使用约88.8个连接词,而人工译本高达100.0个。尤其在表示因果、转折关系的从属连接词上,人工译本频率远高于ChatGPT译本(因果类连接词每千词30.1个,几乎比ChatGPT译本的20.8个高出近50%)。这表明人工译者更频繁地使用诸如because, so, but, however等连接词将分句连接成复杂句,从而明确表达逻辑关系;反之,ChatGPT译本较少使用此类连接词,可能倾向于拆句或用简洁的标点停顿代替,从而弱化了明示的逻辑关联。短语结构方面,人工译本的名词短语和介词短语密度都略高于ChatGPT译本。尤其是介词短语的密度,人工译本为每千词89.1个,显著高于ChatGPT译本的78.7个。这暗示人工译文更喜欢用介词短语提供背景信息或修饰语,使句子结构更加层次化;ChatGPT译文则相对少用介词短语,句子结构更直接简单。此外,非限定动词的使用也有区别:人工译本中不定式短语的出现频率(约20.8‰)高于ChatGPT译本(16.4‰),而ChatGPT译本的动名词略多于人工译本。这些都反映出句法风格的差异:人工译本句法更复杂繁富,通过从句、介词短语和不定式等手段将信息浓缩在长句中,句际衔接多用连接词;ChatGPT译本句法更简练直接,多拆分为独立短句,少用从属结构和连接词,句际关系更多依赖读者理解隐含关联。
综上所述,句法层面上,人工译本倾向于较长且结构复杂的句子,运用丰富的从句和短语来体现逻辑层次,句与句之间衔接紧密;相比之下,ChatGPT译本句子较短、结构简单,句法更趋于口语化的直接表达,句间连接相对松散但句子独立性强。这种差异体现出人工翻译在句法上更注重连贯和完整表达,而机器翻译输出则更倾向于拆分复杂结构以保证清晰度。
(三)语篇层面
从语篇层面考察两种译文在上下文衔接和整体可读性方面的差异,这里关注指代与重复衔接、语义连贯度和可读性等指标(如表3)。
| 指标 | ChatGPT-4译本 | 杨与戴合译本 |
|---|---|---|
| 邻接句名词重叠率 | 0.134 | 0.159 |
| 邻接句LSA相似度 | 0.097 | 0.117 |
| Flesch阅读容易度 | 78.28 | 80.78 |
从指代衔接看,人工译本具有更高的邻接句名词重叠率(15.9%)和论元重复率,这意味着相邻句子共享更多重复名词或名词短语。ChatGPT译本的邻接句词汇重复率仅13.4%,明显低于人工译本。这与前述代词使用频繁度一致:人工译文常通过重复前文提到的名词或使用指代词来保持连贯,而ChatGPT译文更倾向于用不同表述重新提及,导致显性重复衔接较少。语义连贯性方面,利用LSA计算的句间语义相似度显示出类似趋势。相邻句子的平均LSA相似度,ChatGPT译本为0.097,而人工译本达到0.117。人工译本句子之间在意义上更紧密相关,体现为上下文围绕相近的主题词反复出现;ChatGPT译本由于措辞多变或信息拆分,其句子间语义关联略显松散。此外,从整体可读性来看,人工译本稍易于阅读。Flesch阅读容易度得分显示杨译本为80.78,略高于ChatGPT译本的78.28。Flesch指数越高表示文章越容易阅读,该结果与前述词汇和句法特点吻合:人工译本因使用更常见的词汇和更加口语化、衔接明确的句子,降低了阅读难度;ChatGPT译本用词偏正式且句子独立性强,增加了读者自行联想理解的负担,因而可读性稍逊一筹。不过,两种译文的可读性分数都处于较高水平,差异并不悬殊。
综上所述,人工译本在语篇层面的衔接性更强,通过重复提及和明示关联,使全文主题贯穿一致、逻辑线索清晰,读者可以更顺畅地从前后文获取线索。而ChatGPT译本的语篇衔接相对隐性,由于用词多变和缺少连接词,文本显得碎片化,但也减少了冗余。这种差异体现了人工翻译更注重通过语言形式确保篇章连贯,而机器翻译产出倾向于逐句翻译而欠缺整体协调。从语篇整体效果看,人工译本读来连贯流畅,风格趋于自然;ChatGPT译本虽在局部准确但连贯度稍显不足。
三、讨论
(一)翻译策略差异
从翻译策略角度来看,人工译者与ChatGPT在直译和意译的取舍上存在显著区别。数据显示,人工译文在词汇选用和句法结构上相对更灵活,例如词汇丰富度指标更高,说明人工译者倾向于使用多样化的词汇和同义转换来传达原文意义,而ChatGPT译文的词汇多样性较低,更倾向于逐词对应翻译。这种差异反映出人工译者更倾向于意译或功能对等的策略,而ChatGPT更接近直译或形式对等的策略。奈达(1964)将翻译的对等分为形式对等和动态对等(功能对等),前者强调译文在形式和内容上紧贴源语,尽可能逐字逐句对应;后者则强调译文在表达上的“完全自然”,使译文读者获得与原文读者相近的效果。纽马克(1981)类似地将翻译方法区分为语义翻译和交际翻译:语义翻译追求忠实原文,交际翻译注重目标读者的理解体验。因此,人工译者显然在很多情况下采取了交际翻译或动态对等的策略。人工译文中某些句子为了符合英文习惯被适当改写或重组,使其更通顺易懂,这与纽马克所说交际翻译使译文“更顺畅、简洁、清晰、直接”相符。相反,ChatGPT译文常严格依照源语句子结构逐一翻译,缺少必要的重构与润色,以致个别句子的英语读起来略显生硬或晦涩。例如,原文第一段开篇一句“今天晚上,很好的月光”中,“月光很好”是汉语中常见的表述。ChatGPT译为“Tonight, the moonlight is very good”,基本逐字对应,但英语中这种说法略显生硬。而杨宪益、戴乃迭译本将其意译为“Tonight the moonlight is beautiful”,以英语习惯表达出月色之美,行文更自然流畅。这体现了意译在习语表达上的调整,使译文更贴近英文读者的语言习惯。再如,原文描述村民“交头接耳的议论我”,这是汉语成语,直译是“碰着头接着耳朵低声议论”。ChatGPT采用字面直译,译作“whispering to each other about me”,清楚传达了字面意思;杨译本则意译为“discussing me in hushed tones”,用英语惯用短语再现了低声议论的情景。两种译法信息等值,但后者用词更地道,体现了译者对成语的意译处理。又例如“脸色也都铁青”一语,直译为“faces were iron-blue”,ChatGPT如此直译,英文读者难以理解比喻义;杨译者则将其意译为“their faces turned livid”,精准传达出人物因恐惧或愤怒而脸色发青的含义。由此可见,在文化负载词和比喻译法上,ChatGPT往往倾向于形似的直译,而人工译者更善于抓取言外之意,运用适当意译来传达原文精神。这种差异源于译者对文化典故的把握和对等语的择选:机器翻译缺乏文化背景知识,容易逐字搬译;人工译者则依据读者接受度,对典故进行解释性翻译或等效变换,使译文更符合目标语文化。
(二)翻译主体性影响
译者主体性是指译者在翻译过程中能动地施加个人判断和风格取向的能力(查明建,田雨,2003)。文学翻译尤其如此:人工译者会基于自身的理解和审美对原文进行创造性的诠释。因此,不同译者翻出的《狂人日记》可能风格各异,这正体现了译者主体性的作用。相比之下,ChatGPT作为统计语言模型并无自主意识和审美偏好,其翻译决策源自庞大语料库中模式的匹配,与具体语境下的人类主观能动性有本质区别。人工译文在措辞和句式上呈现出某种一贯性风格和情感倾向,这往往是译者有意为之。人工译者可能选择某些更能传达原文讽刺意味或情感色彩的词语,使译文风格与鲁迅原作的精神更贴近;这些词汇选择和句型安排体现了译者的审美判断和对原作内涵的领悟。而ChatGPT译文的用词和句式则趋向中性、直白,缺少个性化的色彩。模型虽然训练自海量人类文本,但在具体输出时并没有真正的自我风格,它不会像人类译者那样有意模拟鲁迅的语调或针对英文读者调整叙事语气。
翻译理论也强调译者主体性的价值。巴斯内特(2013)曾将翻译比作“一种重写”,译者不可避免地带入自己的理解和创造。译者的教育背景、文化素养、审美趣味都会体现在译文之中。在《狂人日记》的人译版本中,译者或许通过选词用句表现出对鲁迅笔锋的揣摩和再现,在讽刺性语言处选用更贴切英文习语,在情绪强烈处运用强调句式等,这些都是译者主体性使然。而ChatGPT没有人生经历和情感共鸣可言,其理解仅是对语言模式的计算,这决定了其译文风格相对平淡客观,缺乏人味。以原文中狂人对历史的著名描写为例:“这历史没有年代,歪歪斜斜的每页上都写着‘仁义道德’几个字……才从字缝里看出写着一行小字:都是‘吃人’两个字!”。ChatGPT译文为“There were no dates in the history book, and on every page were written the words ‘benevolence, righteousness, morality’...I read carefully half the night before I finally saw a line of small characters between the lines: they were the words ‘eat people’ repeated everywhere.”相比之下,杨宪益与戴乃迭的译文在措辞和版式上更具修辞效果:“There were no dates in this history, but scrawled this way and that across every page were the words Benevolence, Righteousness, and Morality… I read that history very carefully for half the night, and finally I began to make out what was written between the lines; the whole volume was filled with one phrase: Eat People!”。可以看出,杨与戴合译本特意将“仁义道德”以及“吃人”用大写或特殊字体强调,凸显其讽刺意味和重要性;这种版式与修辞上的处理体现了译者有意重现原文的讽喻效果和情感冲击力。而ChatGPT译文只是中性地给出词义,并未对重点词语进行任何强调处理,译文语调相对平淡。这反映出人工译者在翻译中发挥了主体能动性:通过修辞手段强化原作深层含义,将作者意图更鲜明地传达给读者。由此可见,人工译者会根据自身理解对译文进行创造性调整或补充,以传达原作言外之意和审美风格,这正是译者主体性的体现。相比之下,机器翻译缺乏这种主动的审美介入,译文往往停留在字面层面。
(三)翻译目的差异
任何翻译活动都服务于一定的翻译目的(Reiss et al.,2014),译者在翻译时会考虑译文读者是谁、译文用途为何,从而调整翻译策略。文学名著《狂人日记》的人工翻译通常以向目标语读者传达鲁迅思想精髓为目的,因而译者在处理时会高度关注受众意识:既要忠实原作精神,又要让译文为西方读者所接受和理解。这一点在人工译文中有所体现。人工译者可能考虑到英语读者对中国封建文化背景的陌生,在译文中通过措辞选择或增补隐含信息来减少文化隔阂,因此人工译文在易读性和连贯性指标上优于机器译文,表明其更符合英语读者的阅读习惯。人工译文的平均句长和复杂句比例可能经过调整,以避免英语读者理解困难;文化特有词语可能译为读者熟悉的对应概念或加以解释,从而提高可读性和清晰度。ChatGPT的译文则缺少明确的受众导向。作为AI模型,它并非为某一读者群体量身定制翻译,也无力判断目标文化的接受习惯。其翻译目标单一:在训练概率的支配下生成与源语形式对应、内容完整的译文。这样产生的文本虽然大体忠实,却可能不顾及目标读者的文化期待。
值得注意的是,翻译目的不同还会影响文本功能取向。人工译者可能意识到《狂人日记》作为中国现代文学经典,其英译本还承担着文化传播的使命,因此在翻译时会有意平衡文学性与可接受性,使译文既保留鲁迅风格又不至于令外国读者困惑。这是一种交际功能和美学功能兼顾的翻译目的。ChatGPT则不存在这样的目的性,它的使命只是输出对应文本,并未考虑译文在跨文化交流中的效果和用途。因此,人工译文呈现出高于机器译文的整体可读性和文化贴切度这充分说明人工译者在翻译过程中对受众适应所做的努力,而ChatGPT译文相对而言缺乏这层考量,尽管内容完整却在微妙之处未能满足目标读者的期待。
四、结语
本研究基于语料库对鲁迅《狂人日记》人类译本与ChatGPT机器译本展开翻译风格比较,揭示了人机文学翻译的异同与意义,研究发现ChatGPT译文整体忠实流畅,在语篇长度、词汇选用上更简洁直白,风格中性统一、译者主体性烙印弱,而人类译本在选词和句法上更具个人风格与创造性,能结合文学语境调整润色以传递文体美感和隐含意义。本研究拓展了翻译风格研究视野,将大语言模型翻译纳入文学翻译风格对比范畴,丰富了人工智能语境下翻译主体性理论内涵,为评估人工智能翻译质量和风格提供新视角;同时,本研究为人工智能翻译实践应用提供现实启示,指出ChatGPT在文学翻译中潜力显著,能快速产出接近人译水平、上下文理解和连贯性较好的译文,但存在缺乏文化敏感与审美判断、细节易误解或风格缺失的局限,当前难以完全取代人类译者,人机协作可成为未来文学翻译实践发展方向之一。未来可通过扩大语料范围、引入更多译本对比、结合质性研究方法、应用更丰富语料库分析工具和指标展开深入探索。
参考文献:
- [1] Baker M. Towards a Methodology for Investigating the Style of a Literary Translator [J]. Target. International Journal of Translation Studies,2000,12(02):241-266.
- [2] Newmark P. Approaches to translation (Language Teaching methodology senes)[J]. Studies in Second Language Acquisition,1981,7(01):114.
- [3] Nida E A. Toward a science of translating: with special reference to principles and procedures involved in Bible translating[M]. Leiden: Brill Archive,1964.
- [4] Reiss K, Vermeer J H. Towards a General Theory of Translational Action[M].Oxford: Taylor and Francis,2014.
- [5] 查明建,田雨.论译者主体性——从译者文化地位的边缘化谈起[J].中国翻译,2003(01):21-26.
- [6] 葛颂,王宁.人工智能时代的文学翻译:挑战与机遇[J].外语与外语教学,2024(01):94-101+149-150.
- [7] 胡开宝,田绪军.基于多语语料库的翻译研究:议题与意义[J].北京第二外国语学院学报,2023,45(02):3-17+101.
- [8] 黄立波,石欣玉.《到灯塔去》两个汉译本基于语料库的翻译风格比较[J].解放军外国语学院学报,2018,41(02):11-19+160.
- [9] 孔德璐.基于机器学习的政经语篇人机翻译风格研究——以《国富论》中译本为例[J].外语导刊,2025,48(01):120-130+160-161.
- [10] 乐明,余潇慧.语言计量指标在翻译风格研究中的应用:以意识流小说《到灯塔去》为例[J].解放军外国语学院学报,2022,45(03):136-143+161.
- [11] 吕俊.文学翻译:一种特殊的交往形式——交往行为理论的文学翻译观[J].解放军外国语学院学报,2002(01):63-66.
- [12] 唐述宗.语体、语域与翻译——英汉翻译风格纵横谈[J].外语与外语教学,2002(06):34-39.
- [13] 王克非.语料库翻译学探索[M].上海:上海交通大学出版社,2011.
- [14] 王梦瑶.基于历时语料库的英诗汉译词汇特征研究[J]..外语导刊,2024,47(02):49-57+159.
- [15] 王宁.面对ChatGPT的挑战:呼唤文学翻译中的伦理转向(英文)[J].外国文学研究,2024,46(03):18-27.
- [16] 张文煜,赵璧.生成式人工智能开创机器翻译的新纪元了吗?——一项质量对比研究及对翻译教育的思考[J].北京第二外国语学院学报,2024,46(01):83-98.
- [17] 仲伟合,周静.译者的极限与底线——试论译者主体性与译者的天职[J].外语与外语教学,2006(07):42-46.
- [18] 朱珊.《狂人日记》译者风格:一项基于语料库的研究[J].外国语文,2021,37(05):119-128.
