主题:
字号:
16
行距:
2.0

第348章 饥不择食的META[2 / 8]

re-trainedTransformersforFasterQuestionAnswering》针对的就是Transformer-basedQA模型的痛点-全层输入宽自注意力导致计算慢和内存高予以解决,我提出DeFormer,一个分解的Transformer变体。

在较低层,DeFormer用问题宽和段落宽自注意力替换全自注意力,避免问题和段落序列的交叉计算。

这允许独立处理输入文本,实现段落表示的预计算,从而大幅减少运行时计算。

DeFormer结构与Transformer相似,可直接用预训练权重初始化,并在QA数据集上微调。

我们的实验显示,DeFormer版本的BERT和XLNet在QA任务上加速4.3倍以上,仅通过简单蒸馏损失损失1%准确率。”

尼兰詹说的是他2020年在ACL会议上发表的论文,是当时LLM优化领域的经典工作,当时LLM流行的模型叫BERT,这篇论文直接构建在预训练Transformer上,LLM的瓶颈,也就是计算成本,在下游任务中凸显,这篇则一定程度上提出了解决思路。

“包括我在2020年的另外一篇工作,其实和LLM的核心,也就是多层注意力有着类似的核心逻辑”

尼兰詹自然不是水货,他在人工智能领域确实浸淫多年,有不错的成果,手上有好几篇顶会文章,都和LLM有关。

那还是2020年,当时大模型还名不见经传呢,在人工智能领域属于边缘化的方向。

扎克伯格是花了很多冤枉钱,把脸书改名META错误估计了元宇宙的到来时间,但不代表他没脑子,单纯因为尼兰詹是林燃的教授,就找他来。

尼兰詹自己真有几把刷子,也是很重要的原因。

大模型里的关键工作,包括自注意力机制、多头注意力、位置编码这些,尼兰詹都有深入的研究,毕竟他研究的重要方向之一就是NLP。

扎克伯格欣喜过望,觉得自己找对人了。

“巴拉苏布拉马尼安教授,在训练LLM中,你是如何处理过拟合或者欠拟合问题呢?”

“大规模训练,预训练涉及在海量无标签数据上学习通用

本章未完,请点击下一页继续阅读!

崇祯重振大明
凤凰北斗
御兽:我的灵宠拥有游戏面板
小河向西流
神话版三国陈曦陈兰
坟土荒草
前桌女生竟是我的头号黑粉
给您添蘑菇啦
掉落漫威世界当超级英雄
离群戏
爷,夫人罪不至死
招蜂引蝶
重生之幸福日常
雪凤凰
蜀汉
雨落未敢愁
满级传球,请叫我三狮军团话事人
若清峰
诸天影视流浪
随缘笔名
阵问长生
观虚
那年花开1981
风随流云
玄鉴仙族
季越人
重生文娱:光辉岁月
水水泛泛
我一个特技演员疯狂整活很合理吧
冥夜冷月
长生,从选择海克斯强化开始
公元2024年
风起北美1625
一贱下天山
残魂重生修仙界
季越人
操控祖宗,从东汉开始创不朽世家
鱼羽渔钰
斩妖武圣从炼虫开始
石瓦坡胖子
太平记
克里斯韦伯
从战国开始掌控山川
雪山藏狐
火影里的丧尸仙人
大魔灵
我在俄国当文豪
卡拉马佐夫
异世纪福音圣男
羽海野月
漫威:冒牌发明家
酉时二把刀
鸣龙
关关公子
凡人作弊修仙
方尤
长生炼器师
冻豆腐渣
仙子,请听我解释
弥天大厦
斗罗:青鸾长鸣,风啸破空
美人眠
母星瞒着我们偷偷化形了
秦不让
朕的大明朕做主
凉月凉了
全民星海时代
山高地迥
我在现代留过学
要离刺荆轲
让你做游戏,口袋妖怪什么鬼?
阿罐不想码字了
钢铁蒸汽与火焰
树岚
武装魔女
咸鱼成仙
我以力服仙
断桥残雪
我的谍战岁月
猪头七
重回1982小渔村
一杯冰柠檬水
战地摄影师手札
痞徒
求求了,快回家练琴吧
莫扎特别
妖尾:我才不要当会长
想吃冰棒
噬恶演武,诸天除魔
温茶米酒
半岛小行星
鸡兔同笼
开局金风细雨楼主,一刀惊天下
升斗烟民
新概念诡道升仙
残酷厕纸天使
文明之万象王座
飞翔de懒猫
影视世界从小舍得开始
山俪