集智数据集

【名著】《红楼梦》人物对话内容数据集

浏览 1274下载 79数据大小: 0.73文件格式: XLSX2024/10/11

数据集简介

数据集介绍:《红楼梦》对话数据集

《红楼梦》是中国文学史上的一部经典作品,作者曹雪芹通过细腻的笔触描绘了众多人物的情感与生活。本数据集专注于提取和整理书中的对话内容,旨在为自然语言处理(NLP)和人工智能(AI)研究提供丰富的语料支持。

数据集特点:
  • 内容丰富:涵盖了主要人物之间的对话,反映了复杂的情感和人际关系。
  • 格式规范:对话内容经过清晰整理,易于导入和使用。
  • 应用广泛:可用于对话生成、情感分析、文本理解等多个NLP任务。
数据集用途:
  • 对话系统训练:为构建更自然的对话生成模型提供真实的对话示例。
  • 情感分析研究:帮助研究人员分析古典文学中的情感表达方式。
  • 文本理解与分析:支持学术研究和文学分析,促进对古典文学的理解。

本数据集希望为相关领域的研究者和开发者提供便利

数据预览

Dialogue
今风尘碌碌,一事无成,忽念及当日所有之女子,一一细考较去,觉其行止见识,皆出于我之上。何我堂堂须眉,诚不若彼裙钗哉?实愧则有余,悔又无益之大无可如何之日也!当此,则自欲将已往所赖天恩祖德,锦衣纨袴之时,饫甘餍肥之日,背父兄教育之恩,负师友规谈之德,以至今日一技无成,半生潦倒之罪,编述一集,以告天下人:我之罪固不免,然闺阁中本自历历有人,万不可因我之不肖,自护己短,一并使其泯灭也。虽今日之茅椽蓬牖,瓦灶绳床,其晨夕风露,阶柳庭花,亦未有妨我之襟怀笔墨者。虽我未学,下笔无文,又何妨用假语村言,敷演出一段故事来,亦可使闺阁昭传,复可悦世之目,破人愁闷,不亦宜乎?故曰“贾雨村
大师,弟子蠢物,不能见礼了。适闻二位谈那人世间荣耀繁华,心切慕之。弟子质虽粗蠢,性却稍通,况见二师仙形道体,定非凡品,必有补天济世之材,利物济人之德。如蒙发一点慈心,携带弟子得入红尘,在那富贵场中,温柔乡里受享几年,自当永佩洪恩,万劫不忘也。
善哉,善哉!那红尘中有却有些乐事,但不能永远依恃;况又有‘美中不足,好事多魔’八个字紧相连属,瞬息间则又乐极悲生,人非物换,究竟是到头一梦,万境归空,倒不如不去的好。
此亦静极思动,无中生有之数也。既如此,我们便携你去受享受享,只是到不得意时,切莫后悔。
自然,自然。
若说你性灵,却又如此质蠢,并更无奇贵之处。如此也只好踮脚而已。也罢,我如今大施佛法助你助,待劫终之日,复还本质,以了此案。你道好否?
形体倒也是个宝物了!还只没有实在的好处,须得再镌上数字,使人一见便知是奇物方妙。然后携你到那昌明隆盛之邦,诗礼簪缨之族,花柳繁华地,温柔富贵乡去安身乐业。
不知赐了弟子那几件奇处,又不知携了弟子到何地方?望乞明示,使弟子不惑。
你且莫问,日后自然明白的。
石兄,你这一段故事,据你自己说有些趣味,故编写在此,意欲问世传奇。据我看来,第一件,无朝代年纪可考;第二件,并无大贤大忠理朝廷治风俗的善政,其中只不过几个异样女子,或情或痴,或小才微善,亦无班姑、蔡女之德能。我纵抄去,恐世人不爱看呢。
我师何太痴耶!若云无朝代可考,今我师竟假借汉唐等年纪添缀,又有何难?但我想,历来野史,皆蹈一辙,莫如我这不借此套者,反倒新奇别致,不过只取其事体情理罢了,又何必拘拘于朝代年纪哉!再者,市井俗人喜看理治之书者甚少,爱适趣闲文者特多。历来野史,或讪谤君相,或贬人妻女,奸淫凶恶,不可胜数。更有一种风月笔墨,其淫秽污臭,屠毒笔墨,坏人子弟,又不可胜数。至若佳人才子等书,则又千部共出一套,且其中终不能不涉于淫滥,以致满纸潘安、子建、西子、文君,不过作者要写出自己的那两首情诗艳赋来,故假拟出男女二人名姓,又必旁出一小人其间拨乱,亦如剧中之小丑然。且鬟婢开口即者也之乎,非文即理。故逐一看去,悉皆自相矛盾,大不近情理之话,竟不如我半世亲睹亲闻的这几个女子,虽不敢说强似前代书中所有之人,但事迹原委,亦可以消愁破闷;也有几首歪诗熟话,可以喷饭供酒。至若离合悲欢,兴衰际遇,则又追踪蹑迹,不敢稍加穿凿,徒为供人之目而反失其真传者。今之人,贫者日为衣食所累,富者又怀不足之心,纵然一时稍闲,又有贪淫恋色,好货寻愁之事,那里去有工夫看那理治之书?所以我这一段故事,也不愿世人称奇道妙,也不定要世人喜悦检读,只愿他们当那醉淫饱卧之时,或避世去愁之际,把此一玩,岂不省了些寿命筋力?就比那谋虚逐妄,却也省了口舌是非之害,腿脚奔忙之苦。再者,亦令世人换新眼目,不比那些胡牵乱扯,忽离忽遇,满纸才人淑女、子建文君红娘小玉等通共熟套之旧稿。我师意为何如?
你携了这蠢物,意欲何往?
你放心,如今现有一段风流公案正该了结,这一干风流冤家,尚未投胎入世。趁此机会,就将此蠢物夹带于中,使他去经历经历。那道人道:“原来近日风流冤孽又将造劫历世去不成?但不知落于何方何处?
此事说来好笑,竟是千古未闻的罕事。只因西方灵河岸上三生石畔,有绛珠草一株,时有赤瑕宫神瑛侍者,日以甘露灌溉,这绛珠草始得久延岁月。后来既受天地精华,复得雨露滋养,遂得脱却草胎木质,得换人形,仅修成个女体,终日游于离恨天外,饥则食蜜青果为膳,渴则饮灌愁海水为汤。只因尚未酬报灌溉之德,故其五内便郁结着一段缠绵不尽之意。恰近日这神瑛侍者凡心偶炽,乘此昌明太平朝世,意欲下凡造历幻缘,已在警幻仙子案前挂了号。警幻亦曾问及,灌溉之情未偿,趁此倒可了结的。那绛珠仙子道:‘他是甘露之惠,我并无此水可还。他既下世为人,我也去下世为人,但把我一生所有的眼泪还他,也偿还得过他了。’因此一事,就勾出多少风流冤家来,陪他们去了结此案。“那道人道:“果是罕闻。实未闻有还泪之说。想来这一段故事,比历来风月事故更加琐碎细腻了。
历来几个风流人物,不过传其大概以及诗词篇章而已,至家庭闺阁中一饮一食,总未述记。再者,大半风月故事,不过偷香窃玉,暗约私奔而已,并不曾将儿女之真情发泄一二。想这一干人入世,其情痴色鬼,贤愚不肖者,悉与前人传述不同矣。
趁此何不你我也去下世度脱几个,岂不是一场功德?
正合吾意,你且同我到警幻仙子宫中,将蠢物交割清楚,待这一干风流孽鬼下世已完,你我再去。如今虽已有一半落尘,然犹未全集。
既如此,便随你去来。
二仙师请了。
适闻仙师所谈因果,实人世罕闻者。但弟子愚浊,不能洞悉明白,若蒙大开痴顽,备细一闻,弟子则洗耳谛听,稍能警省,亦可免沉论之苦。
此乃玄机不可预泄者。到那时不要忘我二人,便可跳出火坑矣。
玄机不可预泄,但适云‘蠢物..’,不知为何,或可一见否?
若问此物,倒有一面之缘。
施主,你把这有命无运、累及爹娘之物,抱在怀内作甚?
舍我罢,舍我罢!
你我不必同行,就此分手,各干营生去罢。三劫后,我在北邙山等你,会齐了同往太虚幻境销号。
最妙,最妙!
老先生倚门伫望,敢是街市上有甚新闻否?
非也。适因小女啼哭,引他出来作耍,正是无聊之甚,兄来得正妙,请入小斋一谈,彼此皆可消此永昼。
严老爷来拜。
恕诳驾之罪,略坐,弟即来陪。
老先生请便。晚生乃常造之客,稍候何妨。
这人生的这样雄壮,却又这样褴褛,想他定是我家主人常说的什么贾雨村了,每有意帮助周济,只是没甚机会。我家并无这样贫窘亲友,想定是此人无疑了。怪道又说他必非久困之人。
雨村兄真抱负不浅也!
不过偶吟前人之句,何敢狂诞至此。
老先生何兴至此?
今夜中秋,俗谓‘团圆之节’,想尊兄旅寄僧房,不无寂寥之感,故特具小酌,邀兄到敝斋一饮,不知可纳芹意否?
既蒙厚爱,何敢拂此盛情。
妙哉!吾每谓兄必非久居人下者,今所吟之句,飞腾之兆已见,不日可接履于云霓之上矣。可贺,可贺!
非晚生酒后狂言,若论时尚之学,晚生也或可去充数沽名,只是目今行囊路费一概无措,神京路远,非赖卖字撰文即能到者。
兄何不早言。愚每有此心,但每遇兄时,兄并未谈及,愚故未敢唐突。今既及此,愚虽不才,‘义利’二字却还识得。且喜明岁正当大比,兄宜作速入都,春闱一战,方不负兄之所学也。其盘费余事,弟自代为处置,亦不枉兄之谬识矣!
十九日乃黄道之期,兄可即买舟西上,待雄飞高举,明冬再晤,岂非大快之事耶!
和尚说,贾爷今日五鼓已进京去了,也曾留下话与和尚转达老爷,说‘读书人不在黄道黑道,总以事理为要,不及面辞了。’
你满口说些什么?只听见些‘好..’‘了..’‘好’‘了..’。那道人笑道:“你若果听见‘好’‘了’二字,还算你明白。可知世上万般,好便是了,了便是好。若不了,便不好,若要好,须是了。我这歌儿,便名《好了歌》
且住!待我将你这《好了歌》解注出来何如?
你解,你解。
解得切,解得切!
本府太爷差人来传人问话。
快请出甄爷来!

示例代码(Python 加载)

下面是一个使用BERT模型来创建一个模仿对话的神经网络的示例代码。这个代码使用了transformers库中的BERT模型来进行对话生成。我们将使用Hugging Facetransformers库以及PyTorchTensorFlow来实现这一目标。

环境准备

首先,请确保你已经安装了以下库:

pip install torch transformers datasets
示例代码

下面的示例代码演示了如何使用BERT进行对话生成的基础结构。我们将通过预训练的BERT模型进行微调,以便在给定上下文的情况下生成对话。

import torch
from transformers import BertTokenizer, BertForSequenceClassification, Trainer, TrainingArguments
from datasets import load_dataset

# 加载BERT的tokenizer和模型
tokenizer = BertTokenizer.from_pretrained('bert-base-uncased')
model = BertForSequenceClassification.from_pretrained('bert-base-uncased', num_labels=2)

# 加载数据集(假设数据集已经准备好了,包含上下文和对话)
# 数据集格式:{'context': ['上下文1', '上下文2'], 'response': ['对话1', '对话2']}
dataset = load_dataset('csv', data_files='path_to_your_dataset.csv')  # 替换为你的数据集路径

# 数据预处理
def preprocess_function(examples):
    return tokenizer(examples['context'], examples['response'], truncation=True, padding='max_length', max_length=128)

tokenized_datasets = dataset.map(preprocess_function, batched=True)

# 设置训练参数
training_args = TrainingArguments(
    output_dir='./results',
    evaluation_strategy='epoch',
    learning_rate=2e-5,
    per_device_train_batch_size=16,
    per_device_eval_batch_size=16,
    num_train_epochs=3,
    weight_decay=0.01,
)

# 初始化Trainer
trainer = Trainer(
    model=model,
    args=training_args,
    train_dataset=tokenized_datasets['train'],
    eval_dataset=tokenized_datasets['test']
)

# 训练模型
trainer.train()

# 模拟对话生成
def generate_response(context):
    inputs = tokenizer(context, return_tensors='pt')
    outputs = model(**inputs)
    predicted_class = torch.argmax(outputs.logits, dim=1).item()
    return predicted_class  # 返回生成的响应

# 示例上下文
context = "你好,今天的天气怎么样?"
response = generate_response(context)
print(f"生成的响应: {response}")
代码说明
  1. 加载模型和tokenizer:使用BertTokenizer和BertForSequenceClassification加载预训练的BERT模型。
  2. 加载数据集:假设你已经有一个CSV格式的数据集,其中包含上下文和对话。
  3. 数据预处理:使用tokenizer对上下文和对话进行编码,生成模型所需的输入。
  4. 设置训练参数:使用TrainingArguments设置训练的超参数。
  5. 初始化Trainer:使用Trainer类来管理模型的训练。
  6. 训练模型:调用trainer.train()方法开始训练。
  7. 对话生成:在生成响应时,输入上下文,并返回生成的响应。
注意事项
  • 数据集:确保你有合适格式的数据集,包含上下文和对应的对话。
  • 模型微调:BERT通常用于分类任务,如果要实现更复杂的对话生成,可能需要使用更适合生成任务的模型,如GPT-2T5
  • 计算资源:训练BERT模型可能需要较高的计算资源,确保你的环境中有合适的GPU支持。

这个示例是一个基础的框架,你可以根据自己的需求进行扩展和优化。