HCI 认知升级:从三范式到后 WIMP,再到大语言模型
三篇旧文合一:HCI 三范式、后 WIMP 界面框架、LLM 时代关注交互而非界面。
谷培培
从 2022 年到 2023 年,我陆续写了三篇关于人机交互的文章:先梳理 HCI 三范式,再读 Jacob 2008 年提出的后 WIMP 界面框架,最后在大语言模型出现时回到 Dourish 的提醒——关注交互而非界面。三篇按时间顺序合在这里。
一、认知升级:重新认识人机交互领域(2022-09)
写在前面
在过去十年的职业生涯中,不断打磨专业能力,一直都是我的理想。
曾经作为一名职场新人,对当时的我来说,十年是如此地遥远。岁月匆匆,十年犹如白驹过隙。在那十年职业发展之路里,有成长的喜悦,也有无数的迷茫和困惑。一路走来,不再为了找一份满意的工作而焦虑,不再将成为某个大厂的成员作为奋斗目标。
在学术领域,学者们不断研究新问题发展分支学科,而不是拘泥于传统的知识体系。作为普通人,这个时代生存下去,也不应该拘泥于已有的知识体系,而是要不断升级个人的知识系统。
如何重新认识自己所在的专业领域?看过一个领域的几本书籍,就算是了解这个领域了吗?答案是否定的。
如何重新认识自己所在的专业领域
如何梳理自己所在领域的专业知识,首先从该领域的发展史入手。
很多人都会有疑问,类似这样的知识值得花费时间和精力吗?甚至有些人会极其主观认为这些知识看似毫无价值和意义,人们往往会忽视学科的发展脉络,更关注眼前具体的看似“实用”的知识。
人机交互目前还没有形成一个独立的学科,在研究型大学的课程中,主要是划分在计算机科学领域。人机交互领域的研究人员包括人因工程学、信息系统、认知科学、信息科学、组织心理学、工业与组织心理学和计算机工程学等多元学科。
人机交互是什么?
为什么设计师很难说出什么是交互设计?首先这个领域的扩展速度是如此之快,在学术领域都很难达成大一统的定义。
美国计算机协会(ACM )对人机交互的定义为“对交互式计算系统的设计、实现、使用和评估的研究与实践”,很显然交互设计领域的不断发展,这个定义现在看来已经有些过时了。
在《交互设计:超越人机交互》中,作者提出了交互设计比人机交互这个术语更有包容性,能够涵盖更加广泛的交互范畴,支持人们在日常生活中的沟通和交互方式。
人机交互(human-computer interaction,HCI)被普遍接受,HCI和CHI是同义词,在美国习惯称人机交互领域HCI,人机交互是从计算机科学、信息系统、认知、工业与组织心理学、人的因素等几个学科的支持基础上发展起来的。
随着时代的发展,与计算机系统进行交互的方式有更多的可能,“界面”也不再局限于 GUI,而是无形的、自然的、无处不在。
人机交互发展的关键里程碑
1959年,布莱恩·沙克尔(Brian Shackel)发表了人机交互领域的第一篇论文。美国计算机协会于1982 年创立计算机系统中的人为因素会议(Conference on Human Factors in Computing Systems,CHI),至今不过经历了40年之久。
2007年S.Harrison和Phoebe Sengers在《人机交互的三范式》一文中,提出了人机交互的三种范式,分别是人因范式、认知范式和现象学范式,这些范式中代表了不同的世界观,都对人机交互产生了很大的作用。理解这些不同的范式,有易于我们对人机交互理论有更加系统的思考。
在这篇文章中,基于三种范式梳理了人机交互领域的发展阶段,感兴趣的可以通过本文底部的参考文献检索原文阅读。
(图:HCI 三范式示意,待补)
范式一:人因范式取向
人机交互领域的”古典“阶段,受到工程学与人类因素的影响,其重点是优化人机配合。在评估“可用性”时,人因范式采用了工程学中的方差减少的思想。
范式二:认知取向
人机交互领域的”现代“阶段,认知科学背后的隐喻,人类的大脑就像信息处理器,经典认知主义又被称为信息加工。基于认知理论的交互设计,例如基于用户的认知能力,提出任务分析和可用性方法。
认知心理学家唐诺德·诺曼被很多人所熟知,他的研究在国内以《设计心理学》的出版而被追捧。作为以认知心理学家主导的研究成果对人机交互的贡献是巨大的,将这个领域引向可用性实证的方向。
范式三:现象学
人机交互领域的”当代“阶段,基于现象学认识问题的能力上,采用多种理论进行非排他性的考虑。人机交互的第三范式,不把交互看成信息的处理过程,而是把交互当做一种意义形成的形式。第三范式将意义和意义建构作为核心,强调人与情景的相互作用。
随着时代的发展,与计算机系统进行交互的方式有更多的可能,“界面”也不再局限于 GUI,而是无形的、自然的、无处不在。
如何培养生成知识系统的能力
作为从事人机交互设计相关工作多年的设计师,还是很难对自己所在领域建立全局的认识。
从更高维思考问题,需要摆脱思维定式。发展自己的洞见,是不再按照已有的框架去理解事物,而是培养独自生成知识体系的能力。作为从事人机交互设计相关工作多年的设计师,还是很难说清楚自己所在的领域是做什么的。
交互设计是一个跨学科的领域,需要不断提升在多个维度的思考和决策能力。认知会伴随年龄和知识学习不断发生变化,心智的成长又会影响我们当下的行为方式。
注重知识的迁移
什么是知识迁移?
知识迁移指的是将一门学科(如认知心理学、社会学)的研究成果(如理论、实证结果、描述性说明、认知模型)转化为可应用于另一门学科(如人机交互、CSCW)的实际问题。
范式、理论、模型、框架和方法的关系
范式:最高层次是一种范式,是指研究人员和设计者群体在共同假设、概念、价值观和实践方面为开展工作而采用的一种通用方法。
理论:在下一个层次是一种理论方法或观点,更广泛地指对正在研究或设计的现象的假设、分析它所用的透镜和所问的问题,这些都基于理论传统,例如社会心理学、设计或工程学中的理论传统。理论是对一个现象的某些方面的充分证实的解释,例如,信息处理理论解释了大脑或它的某些方面是如何工作的。
模型:模型是HCI某些方面的简化,旨在使设计者更容易预测和评估备选设计。
框架:框架是一组相互关联的概念或一组特定的问题,旨在为特定领域提供信息,例如协作学习、分析方法、人种学研究。HCI中引入了许多框架,以帮助设计者约束和扩大他们正在设计的用户体验。它们可以以各种形式出现,包括步骤、问题、概念、挑战、原则、策略和维度。例如,有一些框架帮助设计师思考如何将学习、工作、社交、乐趣、情感等概念化,还有一些框架关注如何设计特定类型的技术来唤起某些反应,例如有说服力的技术和令人愉快的产品。
不同知识的迁移可以给人机交互领域带来很多的灵感。
交互设计已经发展为一个跨学科的领域,这个领域的发展历程经历了哪些变化?是时候升级对人机交互的认知了,从多重交互范式和多个视角认识交互设计,重新认识自己所在的专业领域。
写在最后
曾经也因蹉跎岁月而茫然不已,人生最幸运的事就是勇敢做自己,用内在动机做自己喜欢的事。
坚持初心,坚定地深耕自己所在领域的专业知识。
三范式讲的是人机交互研究的世界观怎么变;半年后我读到的这篇 2008 年论文,讲的是界面本身怎么变。
二、从命令行到后 WIMP:基于现实的交互框架(2023-03)
(图:题图,待补)
你知道当前人机交互处于什么阶段吗?
我们正处于一种新兴的人机交互技术爆炸之中,技术的发展将重新定义我们对人机交互的理解。
写在前面
近期阅读了一篇2008年发表于CHI上的论文《Reality-Based interaction: A framework for post-WIMP interfaces》,介绍了一种用于当前「后WIMP界面」的分析框架,作者在文中提出了一种基于现实的交互方式的概念。
Rob Jacob是一位计算机科学家和交互设计师,他在计算机科学和心理学交叉领域的研究中有着广泛的贡献。他的研究重点是探索如何设计和改进人机交互的方式,以提高用户的效率、可靠性和满意度。他最新的研究方向是新型领域的内隐式脑机界面。
(图:Rob Jacob 相关配图,待补)
人机交互方式的演变
人机交互方式的发展趋势:从命令行界面到后WINMP界面。人机交互方式的演变趋势可以大致分为三个阶段:
1960年代至1980年代:命令行界面(CLI)最早的人机交互方式,通过输入文本命令与计算机进行交互的方式。用户需要记忆特定的命令和参数,并通过键盘输入。这种界面仍然被许多专业用户使用。
1980年代至2000年代:图形用户界面(GUI)通过窗口、图标、菜单和指针(WIMP)等元素,使得用户可以通过鼠标或触摸板等输入设备,以更加直观和易于理解的方式与计算机进行交互。这是当前最常用的界面类型。
2000年代至今:后WIMP界面采用更加直观和身体化的交互方式。
(图:人机交互方式演变三阶段示意,待补)
命令行界面(CLI)
命令行界面(CLI)用户通过键盘输入命令来与计算机交互,代表性的CLI系统包括Unix和DOS等。最早的人机交互方式就是基于命令行界面,计算机科学家J.C.R. Licklider的人机交互理论,他在1960年代初提出了“人机增强(Man-Computer Symbiosis)”的概念,主张计算机应该成为人类智慧的扩展,从而更好地服务于人类。
Licklider认为,人类和计算机应该形成一种“共生关系”,通过交互式的界面进行沟通和协作,以实现更高效、更自然的计算机应用。
基于这一理念,命令行界面被设计出来,让用户可以通过输入命令来与计算机进行交互。虽然命令行界面并不如现代的图形用户界面那样直观和易用,但它为后来的界面设计提供了基础和启示,被认为是人机交互领域的重要里程碑。
图形界面(GUI)
图形用户界面(GUI):GUI通过使用窗口、图标、菜单和指针等图形元素来改进用户体验。代表性的GUI系统包括Mac OS和Windows等。
1982年由施奈德曼(Ben Shneiderman)提出直接操作(Direct Manipulation)的概念。
Direct Manipulation(直接操作)是一种用户与计算机交互的方式,它允许用户直接在屏幕上操纵可视化对象,以完成特定任务。直接操作的特点是用户通过物理手势(例如拖放、点击、滑动等)直接控制屏幕上的对象,而不是通过命令或文本输入。
这种交互方式使用户能够更快地完成任务,因为它直接反映了用户的意图,同时也提高了用户的满意度和可信度。
Direct Manipulation是一种常见的交互模式,被广泛应用于图形用户界面(GUI)和许多其他应用程序。
后WIMP界面(post-WIMP interfaces)
2000年代至今,历经二十多年的发展。
什么是后WIMP界面(post-WIMP interfaces)?
后WIMP界面(post-WIMP interfaces)是指不再基于窗口、图标、菜单和指针(WIMP)的交互方式,而是探索新的人机交互方式。
新的交互设计范式
后WIMP界面,随着计算机技术的发展和人们对更加自然、直观的交互方式的需求,出现了一些新的交互方式。代表性的后WIMP界面包括多点触控屏幕、手势识别、语音识别、虚拟现实和增强现实等。
以下是几个代表性的后WIMP界面及其发展时间:
多点触控屏幕:2007年苹果公司发布了第一款采用多点触控屏幕的iPhone手机,这种交互方式得到了广泛的应用。
手势识别:2007年微软发布了Kinect游戏设备,该设备可以通过摄像头和红外线传感器实现人体动作的识别。
语音识别:2011年苹果公司发布了Siri语音助手,用户可以通过语音指令控制iPhone等设备。
虚拟现实:2016年谷歌发布了Daydream虚拟现实平台,用户可以通过VR眼镜进入虚拟现实环境。
增强现实:2016年苹果公司发布了ARKit增强现实平台,用户可以在现实世界中通过手机或平板电脑看到虚拟图像。
作者提出了一种新的交互范式框架,了解基于现实的交互方式的视角,有利于我们对新技术的理解和洞察。
设计师不是天马行空的筑梦师,设计师必须在界面的能力和现实程度之间取得平衡,而基于现实的交互框架,有利于让日常实践中的设计决策权衡变得更加显性化。通过了解这个框架的原则,设计师可以更好地决定如何平衡界面的需求和现实世界的实际情况。
什么是基于现实的交互方式?
我们进一步认为,越来越多地基于现实世界知识和技能的交互趋势是积极的。将交互建立在现有的真实世界知识和技能之上,可能会减少操作系统所需的心理劳动,因为用户已经具备所需的技能。
基于现实的交互方式,使用现实世界中人们已经习惯了的交互方式,使用户更容易理解和使用界面。这种方法通常包括利用物理世界中的直观操作和手势,如滑动、抓取、旋转等,来操作虚拟对象或数字界面。
作者将基于现实的交互范畴与边界定义为四个主题,分别是直觉物理学、身体感知与技能、环境感知与技能以及社会感知与技能。
1)直觉物理学(Naïve Physics)。即人类对物理世界的常识性认识。
2)身体感知与技能(Body Awareness & Skills)。即人们独立于环境所具有的对自己身体的熟悉和理解。
3)环境感知与技能(Environment Awareness & Skills)。即人们在空间环境中具有物理存在感。
4)社交意识与技能(Social Awareness & Skills)。即个人对社交环境的敏感性和理解力。
(图:基于现实的交互四主题示意,待补)
挖掘来自现实世界的自然行为,基于现实的交互方式应该成为未来设计人机交互的新起点。
2020年之后,随着技术的不断发展,当下的我们正迈入人机交互设计的新时代。基于大语言模型的人工智能技术,开启新一轮的技术革命,人机交互的演变还远未结束。
论文基本信息
原文标题:Reality-Based interaction: A framework for post-WIMP interfaces.
中文标题:《基于现实的交互:后WIMP界面框架》
关键词:基于现实的交互(Reality-Based Interaction)、交互方式(interaction styles)、虚拟现实(virtual reality)、泛在计算(ubiquitous computing)、有形界面(tangible interfaces)、多模式(multimodal)、上下文感知(context-aware)、后WIMP界面(post-WIMP interfaces)
完整引文信息见文末参考文献。
上一篇末尾提到的大语言模型,三周后就成了这一篇的起点。
三、关注交互而非界面:当人机交互遇到大语言模型(2023-04)
当人机交互遇到大语言模型,人机交互方式也正在悄然之中开启一个新的时代。
最近爆火的一篇文章《Generative Agents: Interactive Simulacra of Human Behavior》,研究借助于大语言模型,通过生成式智能体模拟真实人类行为,从而生成具有可信度的角色。这些角色可以在虚拟世界中与其他智能体或真实物理世界中的人类进行交互,并且能够表现出类似于真实人类的思考、情感和行为。
这篇文章提出了生成式智能体架构,通过生成模型来模拟人类的行为,创建可以与用户进行交互的虚拟智能体 (virtual agents)。这些智能体可以被用于多种应用场景,例如虚拟现实、游戏、人机交互等领域。
(图:Generative Agents 论文配图一,待补)
在这个框架中,智能体可以通过感知环境,并将所有感知记录在智能体经历的记录中,称为记忆流。基于感知,检索相关的记忆,然后使用这些检索到的动作来确定一个动作。这些检索到的记忆还用于形成长期计划,并创建更高级别的反思,这些都输入到记忆流中以供将来使用。
该借助于大语言模型,使用自然语言存储智能体的记忆,这些记忆信息包括其经验、知识和行为模式等,当智能体需要做出决策时,可以动态使用检索技术,从这些存储的信息中获取相关知识和经验,并综合起来进行反思和推理,以提供决策依据并影响其下一步行为。
(图:Generative Agents 论文配图二,待补)
作者通过25个智能体组成的小镇,这些角色不是在设定好的“剧本”中,而是可以在情境感知中的自我学习。这些研究工作,对理解新的交互有重要的意义。
未来的社会网络可能会涉及到各种类型的智能体,包括物理世界中的智人以及存在于虚拟世界的有“生命力”的智能体,这些智能体之间会相互交互并产生复杂的社会网络。
从玩转ChatGPT的技术兴奋中逃离,回归到对专业著作的学习与阅读之中。对很多基础概念的不理解,注定无法发挥所谓的“创造”。
你知道在人工智能领域,ChatGPT只是自然语言处理的一个模型,而自然语言处理只是人工智能领域的一个研究方向吗?了解模型背后的原理、概念,一定会让你受益匪浅。
Paul Dourish 曾在《Where the Action Is》一书中强调关注基础研究的重要性:
在科学教育领域中,强调交互和计算的重要性,而不是仅仅关注特定的界面和计算机技术。作者强调,我们需要关注交互系统在日常生活中的应用和影响,以及计算的本质和表现力,而不是纠结于特定的技术规格和功能。
基础研究是我们掌握科学研究本质的基础。但是,现在的人们只关注特定的技术和功能,而忽略了基础概念和原理。虽然作为普通人而非专业学者,但是如果我们只关注技术规格和功能,我们将无法真正理解和应用科学研究知识,更别提创造力了。
作为人机交互领域的从业者,在这个瞬息万变的时代,我们关注什么?答案依然是应该关注交互而非界面;关注计算而非计算机。
交互涉及用户与系统或工具之间的来回交流,更大的灵活性和适应性。交互可以涉及与智能代理之间的合作和交流,从而产生更多样化的观点和见解。而计算则可以帮助我们更好地理解和控制计算机系统的行为。通过交互和计算,我们可以实现更加智能、适应性更强的计算。
在交互方面,1997年,Peter Wegner 提出了交互比算法更强大和有效的观点,因为它可以提供更动态和灵活的解决问题的方式。而算法仅仅是一组按特定顺序执行的指令,以达到特定的结果。
在计算方面,交互式计算是一种用户中心的计算模式,它强调用户的参与和反馈,可以帮助用户更好地理解和控制计算机系统的行为。通过交互式计算,用户可以更灵活地使用系统,实现更高效、更智能的计算过程。交互式计算可以用于开发更智能和更易于使用的用户界面,使用户能够更轻松地与计算机系统进行交互和沟通。
尽管算法可以达到特定的目标,但它们往往是僵硬和不灵活的,难以适应不断变化的情境。相比之下,交互涉及用户与系统或工具之间的交流。如今,基于大语言模型,不仅用户与系统的交互,还可以实现多个智能体之间的合作和交互。
除了交互和计算,情境感知计算也是非常重要的概念。情境感知计算可以看作是交互和算法的优势的必然结合,这种结合可以实现更加智能、适应性更强的计算。
计算机科学家 ANIND K. DEY 于2001年在《Understanding and Using Context》一文中,提出了上下文(context)与情境感知计算(Context-Aware Computing)的可操作性定义:
情境感知计算(Context-Aware Computing)
A system is context-aware if it uses context to provide relevant information and/or services to the user, where relevancy depends on the user’s task.
如果一个系统利用上下文为用户提供相关的信息和或服务,其中相关性取决于用户的任务,则该系统是情境感知的。
在计算环境中,上下文作为信息源,能够帮助用户和机器更好地理解彼此之间的交互。例如,在语音助手中,上下文信息可以包括用户当前的请求、语音和语调,以便应用程序可以更好地理解用户的意图和需求。
上下文(context)
Context is any information that can be used to characterize the situation of an entity. An entity is a person, place, or object that is considered relevant to the interaction between a user and an application, including the user and applications themselves.
上下文是指任何可以用来描述一个实体状态的信息。
即凡是可以提供有关实体的信息都是上下文。实体可以是人、地点或物体,被认为与用户与应用程序之间的互动相关,包括用户和应用程序本身。
理解计算机科学中的上下文与情境感知计算的概念,利用计算机技术感知和理解用户的上下文环境,可以帮助我们设计出更加智能、适应性更强的数字“生命体”。
未来二十年,也许我们将一起见证人工智能与人类思维碰撞的浪潮。
参考文献
- S. Harrison & Phoebe Sengers. (2007). The Three Paradigms of HCI.
- Rogers, Y. (2012). HCI Theory: Classical, Modern, and Contemporary. HCI Theory.
- Jacob, R. J. K., Girouard, A., Hirshfield, L. M., Horn, M. S., Solovey, E. T., & Zigelbaum, J. (2008). Reality-Based interaction: A framework for post-WIMP interfaces. Conference on Human Factors in Computing Systems - Proceedings, 201–210.
- Generative Agents: Interactive Simulacra of Human Behavior.(2023;作者与出处待核)
- Paul Dourish. Where the Action Is.(出版信息待核)
- Peter Wegner. (1997).(篇名待核;原文表述为「交互比算法更强大和有效」)
- Anind K. Dey. (2001). Understanding and Using Context.