每日关注!OpenAI震撼研究:用GPT-4解释30万神经元,原来AI的黑盒要AI自己去打开
没想到,打开AI黑盒这件事,可能还要靠AI自己来实现了。
(资料图片仅供参考)
OpenAI的最新研究来了一波大胆尝试:
让GPT-4去解释GPT-2的行为模式。
结果显示,超过1000个神经元的解释得分在0.8以上——也就是说GPT-4能理解这些神经元。
要知道,“AI黑箱难题”长期以来是一个热议话题,尤其是大语言模型领域,人类对其内部工作原理的理解还非常有限,这种“不透明化”也进一步引发了人类对AI的诸多担忧。
目前推进AI可解释性研究的一个简单办法,就是逐个分析大模型中的神经元,手动检查以确定它们各自所代表的数据特征。
但对于规模已经达到百亿、千亿级别的大规模神经网络来说,工作量和工作难度就都涨了亿点点吧。
由此,OpenAI的研究人员想到,干嘛不让AI去自动化搞定这个大工程?
在这项最新的研究中,他们将GPT-4打造成了一个理解AI行为模式的工具,把GPT-2超过30万个神经单元都解释了一遍,并和实际情况比对进行评分。
最终生成的解释数据集和工具代码,已对外开源。
研究人员表示:未来,这种AI工具可能在改善LLM性能上发挥巨大作用,比如减少AI偏见和有害输出。
解释接近人类水平
具体来看,整个研究的步骤可以分为三步。
第一步,先给GPT-4一段文本,并展示GPT-2在理解这段文本时激活的神经元情况。
然后让GPT-4来解释,这段文本中神经元的激活情况。
比如示例中给出了一段漫威复联的文本,GPT-4分析的激活神经元为:
电影、角色和娱乐
第二步,让GPT-4开始模拟,这些被解释的神经元接下来会做什么。
GPT-4给出了一段内容。
第三步,让GPT-2真实的神经元激活来生成结果,然后和GPT-4模拟的结果进行比对,研究人员会对此打分。
在博客给出的示例中,GPT-4的得分为0.34.
使用这个办法,研究人员让GPT-4解释了GPT-2一共307200个神经元。
OpenAI表示,使用这一基准,AI解释的分数能接近人类水平。
从总体结果来看,GPT-4在少数情况下的解释得分很高,在0.8分以上。
他们还发现,不同层神经元被激活的情况,更高层的会更抽象。
此外,团队还总结了如下几点结论:
如果让GPT-4重复解释,它的得分能更高
如果使用更强大的模型来解释,得分也会上升
用不同的激活函数训练模型,能提高解释分数
总结来看就是,虽然GPT-4目前的表现一般,但是这个方法和思路的提升空间还有很大。
团队也强调,现在在GPT-2上的表现都不太好,如果换成更大、更复杂的模型,表现也会比较堪忧。
同时这种模式也能适用于联网的LLM,研究人员认为可以通过简单调整,来弄清楚神经元如何决策搜索内容和访问的网站。
此外他们还表示,在创建这个解释系统时并没有考虑商业化问题,理论上除了GPT-4,其他LLM也能实现类似效果。
接下来,他们打算解决研究中的这几个问题:
AI神经元行为十分复杂,但GPT-4给的解释非常简单,所以有些复杂行为还无法解释;
希望最终自动找到并解释复杂的整个神经回路,神经元和注意力头一起工作;
目前只解释了神经元的行为,但没解释行为背后的机制;
整个过程算力消耗巨大。
网友:快进到AI创造AI
意料之中,这项研究马上在网络上引发热议。
大家的脑洞画风be like:“AI教人类理解AI。”
“AI教人类关掉AI中存在风险的神经元。”
还有人开始畅想,AI理解AI会快速发展为AI训练AI(已经开始了),然后再过不久就是AI创造新的AI了。
当然这也引发了不少担忧,毕竟GPT-4本身不还是个黑盒嘛。
人类拿着自己不理解的东西,让它解释另一个自己不理解的东西,这个风险emm……
这项研究由OpenAI负责对齐的团队提出。
他们表示,这部分工作是他们对齐研究的第三大支柱的一部分:
我们想要实现自动化对齐。这种想法一个值得思考的方面是,它可能随着AI的发展而扩展更多。随着未来AI模型变得越来越智能,我们也能找到对AI更好的解释。
编辑/lambor
关键词:
-
每日关注!OpenAI震撼研究:用GPT-4解释30万神经元,原来AI的黑盒要AI自己去打开
2023-05-10 -
广发南方电网联名信用卡发卡量突破10万张
2023-05-10 -
滴滴自动驾驶与广汽埃安将成立合资公司 2025年推出首款量产L4无人驾驶新能源车-世界今亮点
2023-05-10 -
顺丰到付怎么下单寄件_顺丰到付怎么下单|世界热点
2023-05-10 -
【时快讯】如何制作系统镜像 制作ISO镜像文件步骤如下
2023-05-10 -
分析师称今年全球芯片市场将下滑20% 快资讯
2023-05-10 -
户口不在村里的城镇户口,可以在宅基地上翻建房屋吗? 全球速看料
2023-05-10 -
2023未来医疗100强榜单发布 苏州多家企业上榜
2023-05-10 -
周口市自然资源和规划局:组织召开不动产登记重点工作推进会 头条
2023-05-10 -
世界快讯:聚焦全省“三个年”活动 铜川:全力建设现代产业新城
2023-05-10 -
赣锋锂业世荣兆业成立上饶世锋热能有限公司,注册资本5000万
2023-05-10 -
中国星辰|杨利伟首飞已有20年 揭秘航天员“出差”体验 全球播报
2023-05-10 -
护送病人就医后悄然离去家属找到暖心交警致谢意 环球时快讯
2023-05-10 -
猛涨期的孩子怎么安抚_猛涨期
2023-05-10 -
5月10日国内氟化铝行情汇总
2023-05-10 -
Lucid一季度亏损扩大,但现金可维持到2024年_环球关注
2023-05-10 -
铜峰电子(600237):股价成功突破年线压力位-后市看多(涨)(05-10)_微速讯
2023-05-10 -
美国得州壳牌炼油厂三天内两度起火,炼油厂处于最高紧急状态
2023-05-10 -
世界观察:女人夏天穿裙子气质会更好,试试下面这几款单品,清凉大方又优雅
2023-05-10 -
广西14市一季度GDP出炉!这地成增速“黑马”
2023-05-10 -
美棉出口有可能调增 后期上涨空间不大
2023-05-10 -
贵金属递延套利_贵金属递延
2023-05-10 -
本社与黔台酒厂有限公司达成战略合作|环球观速讯
2023-05-10 -
阿联酋航空推出了全球首个登机机器人助手Sara-焦点要闻
2023-05-10 -
世界今亮点!神农架到神农溪多少公里(神农架到神农溪怎么坐车)
2023-05-10 -
欧冠:AC米兰vs国际米兰、上海海港vs青岛海牛 世界聚看点
2023-05-10 -
魏公村站_关于魏公村站简述|实时
2023-05-10 -
速讯:暑期学习心得初升高800字以上_暑期学习心得
2023-05-10 -
世界观察:维文软件_ulinixcom维文网页
2023-05-10 -
机械化移栽率达100%!新疆玛纳斯番茄移栽全面开始
2023-05-09
-
守住网络直播的伦理底线
2021-12-16 -
石窟寺文化需要基于保护的“新开发”
2021-12-16 -
电影工作者不能远离生活
2021-12-16 -
提升隧道安全管控能力 智慧高速让司乘安心
2021-12-16 -
人民财评:提升消费体验,服务同样重要
2021-12-16 -
卫冕?突破?旗手?——武大靖留给北京冬奥会三大悬念
2021-12-16 -
新能源车险专属条款出台“三电”系统、起火燃烧等都可保
2021-12-16 -
美术作品中的党史 | 第97集《窗外》
2021-12-16 -
基金销售业务违规!浦发银行厦门分行等被厦门证监局责令改正
2021-12-16 -
保持稳定发展有支撑——从11月“成绩单”看中国经济走势
2021-12-16