Entries tagged :: 自然语言处理
最近语言模型的创新
最新语言模型的创新 2018年被称为”NLP的ImageNet时刻“:进展惊人,越来越大的LSTM和基于Transformer的架构在庞大的数据集上得到了训练 - Matthew Peters撰写的ELMo论文介绍了从语言模型来的嵌入(Embeddings from Language Model,ELMo):…Read more ⟶注意力机制
注意力机制 这是Dzmitry Bahdanai等人在2014年的突破性论文中的核心思想。他们介绍了一种技术,该技术允许编码器在每个时间步长中专注于适当的单词(由编码器编码)。例如,在编码器需要输出单词'lait'的时间步长上,它会把注意力集中在单词'milk'上。这意味着从输入单词到其翻译的路径变短了,因此…Read more ⟶重用预训练的嵌入
重用预训练的嵌入 TensorFlow Hub项目可以轻松地在自己的模型中重用经过预训练的模型组件。这些模型组件称为模块。只需要浏览TF Hub储存库,就能找到需要的,然后将代码示例复制到下项目中,该模块将连同其预先训练的权重一起自动下载并包含在模型中: hub.KerasLayer层会从给定的URL下载模块…Read more ⟶掩码屏蔽
掩码屏蔽 模型需要学习应该忽略掉填充令牌。可以设置告诉模型去忽略掉填充令牌,以便它可以专注于实际很重要的数据。实际上这很容易:在创建嵌入(Embedding)层时只需添加mask zero=True。这意味着所有下游层都将忽略填充令牌(其ID为0) 这种工作方式是Embedding层创建一个等于K.not e…Read more ⟶情感分析
情感分析 如果MNIST是计算机视觉的“hello world”,那么IMDB评论数据集就是自然语言处理的“hello world”:它提取了来自著名的互联网电影数据库的50000条英文电影评论(其中25000条用于训练,25000条用于测试),每条评论的简单二元目标值表明了该评论是负面(0)还是正面(1)。…Read more ⟶使用字符RNN生成莎士比亚文本
创建训练数据集 首先,使用Keras的get file 函数来下载莎士比亚的所有作品,并从Andrej Karpathy的Char-RNN项目中下载数据: 接下来,必须将每个字符编码为整数。一种选择是创建自定义的预处理层。在这种情况下,使用Keras的Tokenizer类会更简单。首先,为文本添加一个分词器:…Read more ⟶jieba 分词(西游记)
jieba 分词(西游记)Read more ⟶电影评论分类:二分类问题
IMDB数据集 它包含来自互联网电影数据库(IMDB)的50000条严重两极分化的评论 数据集被分为用于训练的25000条评论与用于测试的25000条评论 训练集和测试集都包含50%的正面评论和50%的负面评论 加载IMDB数据集 1, 14, 22, 16, 43, 530, 973, 1622, 1385…Read more ⟶