GPT-4比你更会问问题：让大模型自主复述，打破与人类对话的壁垒

时间：2023-11-13 11:44:30 来源：机器之心作者：

图片来源：由无界 AI生成

在最新的人工智能领域动态中，人工生成的提示（prompt）质量对大语言模型（LLM）的响应精度有着决定性影响。OpenAI 提出的建议指出，精确、详细且具体的问题对于这些大语言模型的表现至关重要。然而，普通用户是否能够确保他们的问题对于 LLM 来说足够清晰明了？

值得注意的是，人类在某些情境下的自然理解能力与机器的解读存在明显差异。例如，“偶数月” 这一概念，在人类看来很明显指的是二月，四月等月份，而 GPT-4 却可能将其误解为天数为偶数的月份。这不仅揭示了人工智能在理解日常语境上的局限性，也促使我们反思如何更有效地与这些大语言模型进行交流。随着人工智能技术的不断进步，如何桥接人类与机器在语言理解上的鸿沟，是一个未来研究的重要课题。

对此，加利福尼亚大学洛杉矶分校（UCLA）顾全全教授领导的通用人工智能实验室发布了一份研究报告，针对大语言模型（如 GPT-4）在问题理解上的歧义问题提出了一种创新的解决方案。这项研究由博士生邓依荷，张蔚桐，陈子翔完成。

该方案的核心在于让大语言模型对提出的问题进行复述与扩写，以提高其回答的准确性。研究发现，经 GPT-4 重新表述的问题变得更加详细，问题格式也更为清晰了。这种复述与扩写的方法显著提高了模型的回答准确率。实验表明，一个良好的复述之后的问题，使回答的准确率从原本的 50% 提高到了接近 100%。这一性能提升不仅展示了大语言模型自我改进的潜力，也为人工智能如何更有效地处理和理解人类语言提供了新的视角。

方法

基于以上的发现，研究者提出了一个简单但效果显著的提示词 (prompt)：“Rephrase and expand the question, and respond”（简称为 RaR）。这一提示词直接提高了 LLM 回答问题的质量，展示了在问题处理上的一个重要提升。

GPT-4比你更会问问题：让大模型自主复述，打破与人类对话的壁垒

研究团队还提出了 RaR 的一种变体，称为 “Two-step RaR”，以充分利用像 GPT-4 这样的大模型复述问题的能力。这种方法遵循两个步骤：首先，针对给定的问题，使用一个专门的 Rephrasing LLM 生成一个复述问题；其次，将原始问题和复述后的问题结合起来，用于提示一个 Responding LLM 进行回答。

结果

GPT-4比你更会问问题：让大模型自主复述，打破与人类对话的壁垒

研究人员在不同任务上的实验显示，无论是 (One-step) RaR 还是 Two-step RaR，都在提高 GPT4 的回答准确率方面显示出了一致的有效性。值得注意的是，在原本对于 GPT-4 极具挑战性的任务上，RaR 展现出了显著的改进效果，甚至在某些情况下准确率接近 100%。基于此，研究团队总结了以下两点关键的结论：

1. 复述并扩写（RaR）提供了一种即插即用的黑箱式提示方法，能够有效地提高 LLM 在各种任务上的性能。

2. 在评估 LLM 在问答（QA）任务上的表现时，检查问题的质量至关重要。

GPT-4比你更会问问题：让大模型自主复述，打破与人类对话的壁垒

进一步的，研究人员采用了 Two-step RaR 来探究 GPT-4、GPT-3.5 和 Vicuna-13b-v.15 等不同模型的表现。实验结果显示，对于那些具备更复杂架构和更强大处理能力的模型，如 GPT-4，RaR 方法能够显著提升其处理问题的准确性和效率。而对于较为简单的模型，例如 Vicuna，尽管改进幅度较小，但依然证明了 RaR 策略的有效性。基于此，研究人员进一步检查了不同模型复述后的问题质量。对于较小模型的复述问题，有时可能对问题的意图产生扰动。而如 GPT-4 这样的高级模型提供的复述问题与人类的意图往往更加吻合，并能增强其他模型的回答效果。

GPT-4比你更会问问题：让大模型自主复述，打破与人类对话的壁垒

这一发现揭示了一个重要的现象：不同等级的语言模型复述的问题在质量和效果上存在差异。特别是像 GPT-4 这样的高级模型，它复述的问题不仅能够为自身提供更清晰的问题理解，还能够作为一种有效的输入，提高其他较小模型的性能。

与思维链（CoT）的区别

为了理解 RaR 与思维链（CoT）之间的区别，研究人员提出了它们的数学表述，并阐明了 RaR 在数学上与 CoT 的不同之处，以及它们如何可以轻松结合。

GPT-4比你更会问问题：让大模型自主复述，打破与人类对话的壁垒

这项研究同时表明，在深入探讨如何增强模型推理能力之前，应该提高问题的质量以确保模型的推理能力可以被正确评估。比如 “硬币翻转” 问题，人们发现与人类的意图不同的是，GPT-4 将 “翻转（flip）” 这一词语理解为随机抛掷的动作。当引导模型使用 “Let’s think step by step” 来进行推理时，这种误解仍然存在于推理过程中。只有在澄清了问题之后，大语言模型才会回应预期的问题。

GPT-4比你更会问问题：让大模型自主复述，打破与人类对话的壁垒

进一步的，研究人员注意到，除了问题文本之外，用于 few-shot CoT 的问答示例也是由人类编写的。这就引发了一个问题：当这些人工构造的示例存在缺陷时，大语言模型（LLM）会作出怎样的反应？该研究提供了一个很有意思的例子，并发现不良的 few-shot CoT 示例可能会对 LLM 产生负面影响。以 “末尾字母连接” 任务为例，先前使用的问题示例在提高模型性能方面显示出了积极效果。然而，当提示逻辑发生变化，比如从找到末尾字母变成找到首位字母，GPT-4 却给出了错误的答案。这一现象突显了模型对人工示例的敏感性。

GPT-4比你更会问问题：让大模型自主复述，打破与人类对话的壁垒

研究人员发现，通过使用 RaR，GPT-4 能够纠正给定示例中的逻辑缺陷，从而提高 few-shot CoT 的质量和稳健性。

结论

人类和大语言模型（LLM）之间交流可能存在误解：看似对人类清晰的问题可能仍会被大语言模型理解成其他的问题。UCLA 的研究团队基于这个问题提出 RaR 这一新颖方法，促使 LLM 先复述并澄清问题，然后再回答。

RaR 在一系列基准数据集上进行的实验评估证实了其方法的有效性。进一步分析显示，通过复述得到的问题质量提升是可以跨模型转移的。

展望未来，RaR 这类的方法预计将持续完善，以及它们与 CoT 等其他方法的整合，将为人类与大语言模型之间更准确、更有效的互动铺平道路，最终拓展 AI 解释和推理能力的边界

Tags：GPT-4 点击:() 评论:()

声明：本站部分内容及图片来自互联网,转载是出于传递更多信息之目的,内容观点仅代表作者本人,不构成投资建议。投资者据此操作，风险自担。如有任何标注错误或版权侵犯请与我们联系，我们将及时更正、删除。

▌相关推荐

报告称 OpenAI 采集了超一百万小时的 YouTube 视频来训练 GPT-4

IT之家 4 月 7 日消息，本周早些时候，《华尔街日报》报道称 AI 公司在收集高质量训练数据方面遇到了困难。今天，《纽约时报》详细介绍了 AI 公司处理此问题的一些方法，其中涉及到...【详细内容】

2024-04-07　　Search: GPT-4 点击:(4)　　评论:(0)　　加入收藏

微软AI程序员登场，10倍AI工程师真来了？996自主生成代码，性能超GPT-4 30%

新智元报道编辑：桃子润【新智元导读】全球首个AI程序员Devin诞生之后，让码农纷纷恐慌。没想到，微软同时也整出了一个AI程序员——AutoDev，能够自主生成、执行代码等...【详细内容】

2024-03-18　　Search: GPT-4 点击:(15)　　评论:(0)　　加入收藏

前端不存在了？盲测64%的人更喜欢GPT-4V的设计，杨笛一等团队新作

3 月 9 日央视的一档节目上，百度创始人、董事长兼 CEO 李彦宏指出，以后不会存在「程序员」这种职业了，因为只要会说话，人人都会具备程序员的能力。「未来的编程语言只会剩下两种...【详细内容】

2024-03-11　　Search: GPT-4 点击:(9)　　评论:(0)　　加入收藏

多模态大模型，阿里通义千问能和GPT-4V掰手腕了

通义千问的图像推理能力，最近有了大幅提升。2024 年，大模型领域要卷什么？如果没有思路的话，不妨看看各家大厂都在押注什么方向。最近一段时间，先是 OpenAI 推出 GPT-4V，让大模型...【详细内容】

2024-01-29　　Search: GPT-4 点击:(69)　　评论:(0)　　加入收藏

微软Copilot Pro来了：个人用户也能在Word里用GPT-4，20美元/月

面向个人用户的微软Copilot会员版来了。一个月多交20刀（约合人民币142元），Microsoft 365个人版/家庭版用户就能在Word、Excel、PPT等Office全家桶中用上GPT-4。就像这样，不用在C...【详细内容】

2024-01-16　　Search: GPT-4 点击:(89)　　评论:(0)　　加入收藏

“GPT-4变傻”不只是OpenAI的苦恼，所有大模型与人类交往越久就会越蠢？

　许多大模型在处理早期数据时展现出的优异表现，实际上是受到了‘任务污染’的影响，回答问题全靠记，而非纯粹基于学习理解能力。　　ChatGPT发布一年多，已经在全世界...【详细内容】

2024-01-05　　Search: GPT-4 点击:(48)　　评论:(0)　　加入收藏

GPT-4V开源平替！清华浙大领衔，LLaVA等开源视觉模型大爆发

新智元报道编辑：Aeneas【新智元导读】GPT-4V的开源替代方案来了！极低成本，性能却类似，清华、浙大等中国顶尖学府，为我们提供了性能优异的GPT-4V开源平替。如今，GPT-4 Vision在语言...【详细内容】

2024-01-03　　Search: GPT-4 点击:(53)　　评论:(0)　　加入收藏

谷歌Gemini扳回一局！多模态能力和GPT-4V不分伯仲｜港中文128页全面测评报告

量子位 | 公众号 QbitAI谷歌扳回一局！在Gemini开放API不到一周的时间，港中文等机构就完成评测，联合发布了多达128页的报告，结果显示：在37个视觉理解任务上，Gemini-Pro表现出了和GP...【详细内容】

2023-12-22　　Search: GPT-4 点击:(117)　　评论:(0)　　加入收藏

GPT-4V 都搞不明白的未来推理有解法了！来自华科大 & 上科大

多模态大语言模型展现了强大的图像理解和推理能力。但要让它们基于当前观测来对未来事件进行预测推理仍然非常困难。即便是当前最强大的 GPT-4V（如下图所示），也无法很好地解决...【详细内容】

2023-12-18　　Search: GPT-4 点击:(58)　　评论:(0)　　加入收藏

OpenAI 宣布修复GPT-4变懒问题，将在离线评估及AB测试后更新模型

IT之家 12 月 11 日消息，OpenAI 在上周遭到部分用户投诉，许多用户声称，他们在使用 ChatGPT 或 GPT-4 API 时，会遇到回应速度慢、敷衍回答、拒绝回答、中断会话等一系列问题，OpenA...【详细内容】

2023-12-12　　Search: GPT-4 点击:(50)　　评论:(0)　　加入收藏

▌简易百科推荐

多方热议人工智能产业新机遇

编者按&emsp;&emsp;从前沿科技展会到高层对话平台，从上海、重庆到博鳌，从线上到线下……一场场高规格、大规模的盛会中，人工智能正在成为各界热议的高频词。赋能千...【详细内容】

2024-04-08　　　　中国家电网　　Tags:人工智能　点击:(4)　　评论:(0)　　加入收藏

人形机器人时代来了吗

日前，由中国人形机器人(11.080, -0.05, -0.45%)百人会主办的人形机器人大赛在北京经济技术开发区开赛。工作人员向参观者展示一款人形机器人。参观者与一款陪护型人形机器人...【详细内容】

2024-04-08　　　　中国青年报　　Tags:人形机器人　点击:(4)　　评论:(0)　　加入收藏

AI重塑社交：腾讯与字节跳动的新赛场

文|新火种一号编辑|美美最近，腾讯和字节跳动这两大互联网巨头几乎同步推出了各自的AI社交产品，尽管腾讯和字节跳动在前段时间刚刚“破冰”，但这一举措不仅意味着这两大巨头之...【详细内容】

2024-04-07　　　　蓝鲸财经　　Tags:AI 　点击:(7)　　评论:(0)　　加入收藏

第一批用 Kimi 做内容的网红已经杀疯了

作者：王东东文章来自：斗战圣佛小组技术信仰派 VS 市场信仰派朱啸虎和月之暗面老板杨植麟在前几天有一场不算 battle 的 battle。battle 的争论点是：大模型有没有戏。技术派...【详细内容】

2024-04-04　　　　斗战圣佛小组　　Tags:Kimi 　点击:(4)　　评论:(0)　　加入收藏

昆仑万维发布面向人工智能时代的六条人才宣言

过去的一年多，是人工智能取得非凡进步的一年。在这充满突破性技术飞跃和备受争议的一年里，我们见证了人工智能的快速发展和广泛的影响，人工智能已经迅速地融入了我们的生活，深刻...【详细内容】

2024-04-03　　　　砍柴网　　Tags:昆仑万维　点击:(7)　　评论:(0)　　加入收藏

AI干掉声优？音频大模型追逐“图灵时刻”

七十年前，“人工智能之父”图灵提出，如果人无法判断屏幕的另一侧究竟是人还是机器，就证明机器具备了人一样的智能。这一经典的图灵测试如同北斗星一般，指引着AI行业的工作者们不...【详细内容】

2024-04-03　　　　第一财经网　　Tags:AI 　点击:(5)　　评论:(0)　　加入收藏

生成式人工智能有哪些新趋势？

相较于去年，当下我们所能体验的人工智能技术的范围已经大幅提升。从搜索引擎、电商平台再到社媒平台，只要是以搜索结果为导向的内容，都会出现它的身影。但其实，人工智能的应用场...【详细内容】

2024-04-03　　品谈教师帮　　　　Tags:人工智能　点击:(6)　　评论:(0)　　加入收藏

AI世界的新难题：互联网的信息不够用了！

高质量数据的紧缺正成为AI发展的重要障碍。4月1日，据媒体报道，随着OpenAI、Google等企业不断深入发展AI技术，科技巨头们遇到了一个新问题：现有的互联网信息量可能不足以支撑他们...【详细内容】

2024-04-02　　硬AI　　　　Tags:AI 　点击:(6)　　评论:(0)　　加入收藏

今天起，ChatGPT无需注册就能用了！

　来源：量子位　　　　金磊克雷西发自凹非寺　　就在刚刚，OpenAI狠狠地open了一把：从今天起，ChatGPT打开即用，无需再注册帐号和登录了！　　像这样，直接登录网站，然后就可以开启对...【详细内容】

2024-04-02　　　　量子位　　　Tags:ChatGPT 　点击:(7)　　评论:(0)　　加入收藏

AI时代，面对死亡有了第二种选择？

今年春节期间，罗佩玺瞒着妈妈用AI技术“复活”了外婆，她将妈妈现在的模样和外婆留下的老照片合成在一起。时隔60多年，妈妈和外婆终于又“见面”了，这是她送给妈妈的生日礼物。收...【详细内容】

2024-04-02　　　　中国青年报　　Tags:AI时代　点击:(7)　　评论:(0)　　加入收藏

推荐资讯

访问网站显示不安全是	掌握独立站SEO策略，提
快手蓝色小钥匙跳转微	微信朋友圈如何置顶
Facebook新用户扩展怎	详解微信里面的分期可
微信表情包更新：原创设	微信朋友圈功能大改版