æ¬èšäºã®èè
ã¯Research Engineerã®å€§éã§ããæè¿ã¯ã ãããŠãã€ã ãšããã²ãŒã ããã£ãŠããŸããããããå°ãã§ã¯ãªã¢ãšãããšããã§æµãåãã諊ããŸããã ã¯ããã« RevCommã¯é»è©±å¶æ¥ã顧客å¿å¯Ÿã®éè©±ãæ¯æŽããAIæèŒåã®IPé»è©±ãMiiTelããæäŸããŠããŸãã ãã®è£œåã¯ãéè©±ã®æåèµ·ãããä¿åããæ©èœãåããŠãããRevCommã¯æ°åæéã®å¯Ÿè©±ããŒã¿ã«æ¥ããŠããŸãã ãã®å¯Ÿè©±ããŒã¿ã«å¯Ÿããæ¯æŽã®1ã€ãšããŠå¯Ÿè©±èŠçŽãèããããŸãã察話èŠçŽãšã¯ãå
¥åããã察話ããããã®äž»èŠãªæŠå¿µãå«ãããçãææžïŒèŠçŽïŒãèªåçã«äœæããããšã§ãã ãŠãŒã¶ã¯ãèŠçŽãäœæããæéãçãããããããã¯èŠçŽãèªãããšã§å¯Ÿè©±ã®æŠèŠãããæ©ãçè§£ã§ãããªã©ã®å©ç¹ããããŸãã ããããåç·šãšåŸç·šã®2åã«åããŠã察話èŠçŽã«é¢ããèšäºãæžããŸããä»åã®èšäºã§ã¯ãã¯ããã«ããã€ãã®å¯Ÿè©±èŠçŽã®ããŒã¿ã»ãããã玹ä»ããŸãã 察話èŠçŽã¯ãã¡ãŒã«ã»ãã£ããã»ãšãŒãžã§ã³ããšé¡§å®¢éã®å¯Ÿè©±ãªã©ãè€æ°ã®ãã¡ã€ã³ã§äœ¿çšãããŸãããããŠããã¡ã€ã³ã«ãã£ãŠèª²é¡ããŽãŒã«ãç°ãªããŸããããã§ããŒã¿ã»ãããããã€ãã玹ä»ããããšã§ãåãã¡ã€ã³ã®æ±ãã課é¡ããŽãŒã«ãæŠèгããŠãããŸãã ãŸããæ¬èšäºã§ã¯èŠçŽã·ã¹ãã ã®è©äŸ¡ææšã«ã€ããŠãã玹ä»ããŸããé·ããåèªã®ãªãŒããŒã©ããã«åºã¥ãææšã䜿çšãããŠããŸããããä»ã®å
容ã«åºã¥ãè©äŸ¡ææšãæè¿ã«ãªã£ãŠææ¡ãããŠããŸãã è©äŸ¡ææšãæŠèгããããšã¯ãèŠçŽã·ã¹ãã ãæ§ç¯ããéã®èª²é¡ãèããè¯ãææã«ãªããšèããŠããŸãã ã¯ããã« ããŒã¿ã»ãã ãªãŒãã³ãã¡ã€ã³å¯Ÿè©±èŠçŽ ãã£ãã æ¥åžžäŒè©± TVçªçµã»ã€ã³ã¿ãã¥ãŒ ã¿ã¹ã¯æåã®å¯Ÿè©±èŠçŽ äŒè° ã¡ãŒã« å»ç ã«ã¹ã¿ããŒãµãŒãã¹ è©äŸ¡ææ³ ROUGE BLEU chrF BERTScore FEQA FactSumm ãŸãšã åèæç® ããŒã¿ã»ãã [Jia 22] ã¯å¯Ÿè©±èŠçŽã2ã€ã«åé¡ããŸããã1ã€ã¯ãªãŒãã³ãã¡ã€ã³å¯Ÿè©±èŠçŽã§ããã1ã€ã¯ã¿ã¹ã¯æå察話èŠçŽã§ããäžèšã«[Jia 22]ã®å³ãåŒçšããŸãã ãªãŒãã³ãã¡ã€ã³å¯Ÿè©±èŠçŽã¯ãæ¥åžžç掻ããã©ãã«ããã察話ããããã¯ãªã³ã©ã€ã³ãã©ãŒã©ã ã察象ã«ããèŠçŽã§ããç©èªã®å€§çãç²åŸããããäžããããããŒãã«å¯ŸããæèŠããŸãšããããšã«çŠç¹ãåœãŠãŸãããã®èšäºã§ã¯ããªãŒãã³ãã¡ã€ã³å¯Ÿè©±èŠçŽã®ããŒã¿ã»ãããšããŠãããã£ããããæ¥åžžäŒè©±ããTVçªçµã»ã€ã³ã¿ãã¥ãŒãã®3ã€ã®ã«ããŽãªãåãäžããŸãã ã¿ã¹ã¯æåã®å¯Ÿè©±èŠçŽã¯ãäž»ã«é¡§å®¢ãšãµãŒãã¹ãããã€ãã«æå±ãããšãŒãžã§ã³ããšã®éã®äŒè©±ã察象ã«ããŸãã顧客ã¯ç¹å®ã®èª²é¡ãæã£ãŠããããããè§£æ¶ããããã«ãšãŒãžã§ã³ããšå¯Ÿè©±ãããŸãããã®èšäºã§ã¯ãã¿ã¹ã¯æåã®å¯Ÿè©±èŠçŽã®ããŒã¿ã»ãããšããŠããäŒè°ããã¡ãŒã«ããå»çããã«ã¹ã¿ããŒãµãŒãã¹ãã®4ã€ã®ã«ããŽãªãåãäžããŸãã ãªãŒãã³ãã¡ã€ã³å¯Ÿè©±èŠçŽ ãã£ãã [Gliwa 19]ã¯å¯Ÿè©±èŠçŽã®ããã®ããŒã¿ã»ããã§ãã SAMSum ïŒSamsung Abstractive Messenger SummarizationïŒãäœæããŸãããããŒã¿ã»ããã®ååã瀺ãããã«ãèè
ã¯Samsungã«æå±ããŠããŸãã ããŒã¿ã»ããã¯ãªã³ã©ã€ã³ãã£ãããšèŠçŽã®ãã¢ãçŽ1äž6000ä»¶å«ãã§ããŸãã[Zhao 21]ã«ãããšãã¿ãŒã³æ°ã¯å¹³åããŠ9.9åã§ãããªã³ã©ã€ã³ãã£ããã®æ§è³ªäžãããŒã¿ã»ãããçµµæåã»é¡æåãããã¯ç¥èªãå«ãã§ããŸããäžèšã«[Chen 21]ã®å³ãåŒçšããŠããã®ããŒã¿ã»ããã«å«ãŸãã察話ã®äŸã瀺ããŸãã æ¥åžžäŒè©± [Chen 21]ã¯å¯Ÿè©±èŠçŽã®ããã®ããŒã¿ã»ããDialogSumãäœæããŸããããã®ããŒã¿ã»ããã¯ãåŠæ ¡ã»ããžãã¹ã»ã¬ãžã£ãŒãªã©ã®ãæ¥åžžç掻ã«ãããæ§ã
ãªãããã¯ã«é¢é£ãã察話ãçŽ1äž3000ä»¶å«ã¿ãŸãã DialogSumã¯äž»ã«äžèšã®3ã€ã®ããŒã¿ã»ããããäœæãããŸããããããã¯å¯Ÿè©±èŠçŽã®ããã®ããŒã¿ã»ããã§ã¯ãããŸãããäŸãã°ã[Sun 19]ã®DREAMã¯dialogue understandingãšããã¿ã¹ã¯ã®ããŒã¿ã»ããã§ãã [Li 17]ã®Dailydialog [Sun 19]ã®DREAM [Cui 20]ã®MuTual äžèšã«[Chen 21]ã®å³ãåŒçšããŠãDialogSumã«å«ãŸãã察話ã®äŸã瀺ããŸããããã¯ããžãã¹äžã®å¯Ÿè©±ã§ãã [Mehnaz 21]ã¯ãè±èªãšãã³ãã£ãŒèªæ··ããã®å¯Ÿè©±èŠçŽã®ããŒã¿ã»ããã§ããã GupShup ãäœæããŸããããã®ããŒã¿ã»ããã¯ã[Gliwa 19]ã«ãã£ãŠäœæãããSAMSumãããšã«äœæãããŸããã ãã®ããŒã¿ã»ããã¯ã³ãŒãã¹ã€ããã³ã°ãšåŒã°ãããäŒè©±äžã«è©±ãæãç°ãªãèšèªãåãæ¿ããŠè©±ãçŸè±¡ã«çç®ããŠããŸããè«æã«ã¯ããäŒè©±ãšãŒãžã§ã³ãããã£ãããã©ãããã©ãŒã ã®æ®åã«äŒŽããäžçäžã®å€ãã®å€èšèªã³ãã¥ããã£ã«ãããŠãã³ãŒãã¹ã€ããã³ã°ã¯æåã«ããäŒè©±ã«äžå¯æ¬ ãªãã®ãšãªã£ãŠããŸãããšæžãããŠããŸãã äžèšã«[Mehnaz 21]ã®å³ãåŒçšããŸããéãéšåãè±èªã§ã玫ã®éšåããã³ãã£ãŒèªã§ãããã®äŸã§ã¯è±èªã§ã®èŠçŽã ãã瀺ãããŠããŸãããããŒã¿ã»ããã¯è±èªãšãã³ãã£ãŒèªæ··ããã®èŠçŽãå«ã¿ãŸãã TVçªçµã»ã€ã³ã¿ãã¥ãŒ [Chen 22]ã¯TVçªçµã®å¯Ÿè©±èŠçŽããŒã¿ã»ããã§ãã SummScreen ãäœæããŸããããã®ããŒã¿ã»ããã¯ã次ã®2ã€ã®ã¹ãããã«ããäœæãããŸããããŸãã TVMegaSite ãš ForeverDreaming ãããTVçªçµã®ãã©ã³ã¹ã¯ãªãããç²åŸããŸããæ¬¡ã«ããã®ãã©ã³ã¹ã¯ãªããã®èŠçŽãšããŠã Wikipedia ãš TVmaze ããçªçµæŠèŠãç²åŸããŸããã äžèšã«[Chen 22]ã®å³ãåŒçšããSummScreenã«å«ãŸãã察話ã®äŸã瀺ããŸããéãæ ã«ããSheldonãšLeonardã®äŒè©±ã¯ãç©èªã®å€§çã«é¢é£ãèãããèŠçŽæã«ã¯åºãŠããŸããã [Zhu 21]ã¯ç±³åœå
Œ
±ã©ãžãªæŸéïŒNational Public Radio; NPRïŒãšCNNã§è¡ãããã€ã³ã¿ãã¥ãŒããã MediaSum ãäœæããŸãããããã§ã¯ãäžè¬ã«å
¬éãããŠããã€ã³ã¿ãã¥ãŒã®åçš¿ã察話æãšããNPRãšCNNã«æ²èŒãããã€ã³ã¿ãã¥ãŒã®èª¬æãèŠçŽæãšããŸããã ã¿ã¹ã¯æåã®å¯Ÿè©±èŠçŽ äŒè° [Carletta 05]㯠äŒè°ã®ãã«ãã¢ãŒãã«ãªããŒã¿ã»ããã§ãã AMI meeting corpus ãäœæããŸãããæ¶ç©ºã®ãã¶ã€ã³ããŒã ãããªã¢ã³ã³ã®ãã¶ã€ã³ã話ãåãããã«è¡ã£ãããŒãã£ã³ã°ãããã® ããŒã¿ã»ãã ã«å«ãŸããŸãããŸããèŠç·ã®æ¹åããã¯ã€ãããŒãã®æ
å ±ãªã©ã®å¯Ÿè©±ä»¥å€ã®æ
å ±ãå«ãŸããŠããŸãããã®ããŒã¿ã»ãããæ¥æ¬èªã«ç¿»èš³ãã ããŒã¿ã»ãã ãååšããŸãã [Zhong 21]㯠QMSum ãææ¡ããŸãããããã¯ãã¯ãšãªã«åºã¥ãèŠçŽã¿ã¹ã¯ã®ããã®ããŒã¿ã»ããã§ããã232ä»¶ã®äŒè°ã«é¢é£ãã1808ä»¶ã®ã¯ãšãªãšèŠçŽã®çµããæ§æãããŠããŸãã[Janin 03]ã«ãã ICSI Meeting Corpus ãš[Carletta 05]ã«ããAMI meeting corpusãšè°äŒã®ããŒãã£ã³ã°ããäœæãããŸããã ã¯ãšãªãšã¯ãã·ã¹ãã ãåºåããèŠçŽã«å¯Ÿããå¶éã§ããã¯ãšãªã®äŸãšããŠãSummarize the discussion about remote control style and use cases.ãããSummarize Project Manager's opinion towards remote control style and use cases.ããæããããŸãã ãªã³ã©ã€ã³ãã£ãããªã©ã®ãããŸã§ã玹ä»ããããŒã¿ã»ãããšæ¯èŒããŠãäŒè°ã¯ãã®æéãå€ãããŸã倿§ãªãããã¯ãå«ã¿ãŸãããã®ãããäŒè°ããçãèŠçŽãäœæããããšã¯é£ããããšãšãåå è
ã«ãã£ãŠç¥ãããå
容ãç°ãªãããšã«[Zhong 21]ã¯çç®ããŸããããã®çµæãäžããããã¯ãšãªã«å¿ããŠèŠçŽãäœæãã察話èŠçŽã·ã¹ãã ã®ããã®ããŒã¿ã»ãããäœæããŸããã äžèšã«[Zhong 21]ã®å³ãåŒçšããã¯ãšãªã«åºã¥ãèŠçŽã®äŸã瀺ããŸãã3ã€ã®ã¯ãšãªãå
¥åãããåã
ã«å¯ŸããŠå¯Ÿè©±èŠçŽã·ã¹ãã ãèŠçŽãäœæããŸãã ã¡ãŒã« [Zhang 21a] ã¯ã2549ä»¶ã®é»åã¡ãŒã«ã¹ã¬ãããããªãããŒã¿ã»ããã§ãã EmailSum ãäœæããŸãããåã
ã®ã¹ã¬ããã¯3ä»¶ãã10ä»¶ã®ã¡ãŒã«ãå«ã¿ãŸãããŸãã30åèªä»¥äžã®çãèŠçŽãš100åèªä»¥äžã®é·ãèŠçŽããåã¹ã¬ããã«ä»äžãããŠããŸãã ãã®ããŒã¿ã»ããã¯äžèšã®3ã€ã®ã¡ãŒã«ã®ããŒã¿ã»ããããäœæãããŸããããããã«ã¯ã¹ã¬ããæ§æãæŽçãããŠããŸããã§ããããã®ãããã¹ã¬ããæ§æãæŽçããŠãèŠçŽãäœæããããšã[Zhang 21a]ã®è²¢ç®ãšèšããŸãã [Klimt 04]ãäœæããEnron [Craswell 06]ãäœæããW3C Avocado Research Email Collection äžèšã«[Zhang 21a]ã®å³ãåŒçšããçãèŠçŽãšé·ãèŠçŽã®äŸã瀺ããŸãã å»ç [Song 20]ã¯å
¬éãã©ãŒã©ã ã§å»è
ãšå¯Ÿè©±ã§ãããã©ãããã©ãŒã ã§ãã Chunyu-Doctor ãã察話èŠçŽã®ããã® ããŒã¿ã»ãã ãäœæããŸããããã©ãŒã©ã äžã®å¯Ÿè©±ã«å¯Ÿè©±èŠçŽãé©çšããç®çããå»åž«ã®æéãåæžãããããšããŠããŸãã [Song 20]ã®å³ãåŒçšãã察話ã®äŸã瀺ããŸããããã§ã¯ãæ£è
ã®çºèšã®ãã¡ç¹å®ã®ãããã¯ã«é¢é£ãããã®ãæç²ããŠããŸãã ã«ã¹ã¿ããŒãµãŒãã¹ ã«ã¹ã¿ããŒãµãŒãã¹ã¯ãäŒæ¥ã«æå±ãããšãŒãžã§ã³ãã顧客ã«å¯ŸããŠäœããã®ãµãŒãã¹ãè¡ãããšã§ãã察話èŠçŽãé©çšããçç±ã®1ã€ã«ã¯ããšãŒãžã§ã³ãã®è² æ
軜æžããããŸãã[Liu 19]ã¯ã滎滎åºè¡ïŒDiDiïŒã§åã30äžã®ãšãŒãžã§ã³ããšé¡§å®¢ã®å¯Ÿè©±ã«å¯ŸããŠã察話èŠçŽãé©çšããè«æã§ãããã®è«æã®ã¢ãããŒã·ã§ã³ã®é
ã§ã¯ãèŠçŽã®äœæã«ã¯ãšãŒãžã§ã³ãã®æéã®çŽ25%ãè²»ããããŠããŸããDiDiã«ã¯æ°å人ã®ãšãŒãžã§ã³ããããŸãããã®ãããèŠçŽã®èªåçæã¯èšå€§ãªäººçè³æºãç¯çŽããããšãã§ããŸããããšæžãããŠããŸãã [Lin 21]ã¯äžåœèªã§æžããã察話èŠçŽã®ããŒã¿ã»ããã§ãã CSDS ïŒCustomer Service domain Dialogue SummarizationïŒãäœæããŸãããããã¯[Chen 20]ãäœæãã察話ããŒã¿ã»ããJDDCã«èŠçŽãä»ãå ããããšã§äœæãããŠããŸããJDDCã¯ãäžåœã®e-ã³ããŒã¹æå€§æã§ãã京æ±ååïŒJDïŒã®ã¹ã¿ãããšé¡§å®¢éã®ããªã»ãŒã«ã¹ãšã¢ãã¿ãŒã»ãŒã«ã¹ã®å¯Ÿè©±ããæ§æãããŠããŸãã äžèšã«[Lin 21]ã®å³ãåŒçšããŸããæ³šæããååã®é
éã«é¢ããŠãã¹ã¿ãããšé¡§å®¢ã話ãåã£ãŠãããããã«å¯ŸããŠ3çš®é¡ã®èŠçŽãä»äžãããŠããŸãã [Zhao 21]ã¯ã5ã€ã®ãã¡ã€ã³(ã¬ã¹ãã©ã³ãããã«ãã¢ãã©ã¯ã·ã§ã³ãã¿ã¯ã·ãŒãé»è»)ã«ããããçŽ1äžã®å¯Ÿè©±ãšãã®èŠçŽãå«ãã ããŒã¿ã»ããTODSumãäœæããŸããããã®è«æã®èè
ã®æå±ã¯3ã€ã«å¥ããŠãããå京éµé»å€§åŠãšçŸå£ïŒMeituanïŒãšäžåœç§»åïŒChina MobileïŒã§ããçŸå£ã¯e-ã³ããŒã¹ãã©ãããã©ãŒã ã§ããçŸå£ãšãå£ã³ããµã€ãã§ãã倧è¡ç¹è©ãéå¶ããŠããŸããäžåœç§»åã¯äžçæå€§ã®æºåž¯é»è©±äºæ¥è
ã§ãã äžèšã«[Zhao 21]ã®å³ãåŒçšããTODSumã«å«ãŸãã察話ã®äŸã瀺ããŸãã é¿éå·Žå·ŽïŒAlibabaïŒã«æå±ãã[Zou 21a]ã¯æ·å¯¶ïŒTaobaoïŒã§è¡ããã顧客ãšãšãŒãžã§ã³ãã®ãã£ãããã°109äžä»¶ã䜿çšããŠã察話èŠçŽã«åãçµã¿ãŸããããã®ç ç©¶ã§äœ¿çšããã å®è£
ãšããŒã¿ã»ãã ãå
¬éãããŠããŸãããã®è«æã®èè
ã¯ã[Zou 21b]ã«ãããŠãé¿éå·Žå·Žã®ã³ãŒã«ã»ã³ã¿ãŒã§è¡ããã顧客ãšãšãŒãžã§ã³ãã®å¯Ÿè©±ã«å¯ŸããŠã察話èŠçŽãé©çšããããšãå ±åããŠããŸãããã ãããã¡ãã¯ããŒã¿ã»ãããå
¬éãããŠããŸããã è©äŸ¡ææ³ èŠçŽã®ææ³ãè©äŸ¡ããããã®è©äŸ¡ææšãããã€ã玹ä»ããŸãããããŸã§ã¯ãæ£è§£ãšå®çŸ©ãããèŠçŽæãšã·ã¹ãã ãåºåããèŠçŽæã®é¡äŒŒåºŠãèšç®ãããã®é¡äŒŒåºŠãé«ããã°è¯ãèŠçŽæãšå€æããŠããŸãããè¿å¹Žã«ãªã£ãŠã質åå¿çã·ã¹ãã ã䜿çšãããªã©ã®ãããã€ãã®è©äŸ¡ææšãææ¡ãããŠããŸããããã§ã¯æ°åŒãªãã§èª¬æããããšè©Šã¿ãŠãããããã€ãã®è©äŸ¡ææšã«ã¯æ°åŒã瀺ããŠããŸããã ROUGE ROUGEã¯æãåºã䜿ãããè©äŸ¡ææšã®1ã€ã§ããã®ææšãææ¡ãã[Liu 04]ã®åŒçšä»¶æ°ã¯9000ä»¶ãè¶
ããŠããŸãã ROUGEã¯2ã€ã®ææžã«å
±éããåèªæ°ã«çç®ããŠã2ã€ã®ææžã®é¡äŒŒåºŠãèšç®ããŸããããã€ãã®æŽŸçããããROUGE-1ã¯uni-gramïŒåèªïŒã䜿çšããROUGE-2ã¯bi-gramïŒé£ç¶ãã2åèªïŒã䜿çšããŸããHuggingface瀟ã®ã©ã€ãã©ãªã§ããevaluateã« å®è£
ããããŸãã BLEU [Papineni 02]ã«ããBLEUã¯å
±éããåèªn-gramã®æ°ã«çç®ããé¡äŒŒåºŠãèšç®ããŸããnã¯ãã©ã¡ã¿ã§ããã1ãã4ããã䜿çšãããŸããèšãæããã°ãåèªã ãã§ãªããé£ç¶ãã2åèªã»3åèªã»4åèªã«çç®ããŸãããŸããã·ã¹ãã ãåºåããèŠçŽæããæ£è§£ãšå®çŸ©ãããèŠçŽæãããçãæã«ããã«ãã£ãäžããããã«å·¥å€«ãããŠããŸããHuggingface瀟ã®ã©ã€ãã©ãªã§ããevaluateã« å®è£
ããããŸãã äžèšã«èšç®åŒã瀺ããŸããããã§ã¯ãã·ã¹ãã ãåºåããèŠçŽæã®æ°ãšãæ£è§£ãšå®çŸ©ãããèŠçŽæã®æ°ãå
±ã«1ã§ããæã®èšç®åŒã瀺ããŠããŸããBPã¯ã·ã¹ãã ãåºåããèŠçŽæãæ£è§£ãšå®çŸ©ãããèŠçŽæãããçãæã®ããã«ãã£ã§ãããŸã ã¯äžããããæã®åèªn-gramãè¿ã颿°ã§ããpnã¯2ã€ã®æã«ååšããåèªn-gramã®ãã¡ãå
±éããåèªn-gramã®å²åã衚ããŸããN=4ããã䜿çšããã1-gramãã4-gramã«åºã¥ãBLEUãèšç®ãããŸãã chrF [Popovi Ìc 15]ã«ããchrFã¯ãäžèšã®ROUGEã»Bleuãšç°ãªããåèªã§ã¯ãªãæån-gramã«çç®ããŸããã¯ããã«æån-gramã®éåããæ£è§£ãšå®çŸ©ãããèŠçŽæãšãã·ã¹ãã ãåºåããèŠçŽæã®ããããããç²åŸããŸããæ¬¡ã«ãããã® é©åçãšåçŸçãæ±ããæåŸã«Få€ãèšç®ããŸãã Huggingface瀟ã®ã©ã€ãã©ãªã§ããevaluateã«å®è£
ããããŸããn=6ãè«æã§äœ¿çšãããŠããããŸã å®è£
ã§ãããã©ã«ãå€ã¯n=6ãšãªã£ãŠããŸãã BERTScore ãããŸã§ã«ã玹ä»ããææšã§ã¯ã2ã€ã®åèªãæ¯èŒããéã«å®å
šäžèŽãããã確èªããŠãããå矩èªãé¡çŸ©èªãæ±ããŸããã§ããã[Zhang* 20a]ã«ããBERTScoreã¯èšèªã¢ãã«ã䜿çšããŠãã®åé¡ã«åãçµã¿ãŸãã ã¯ããã«èšèªã¢ãã«ãçšããŠãæ£è§£ãšå®çŸ©ãããèŠçŽæã®åããŒã¯ã³ããã¯ãã«ã«å€æãããã®ãxãšããŸããæ¬¡ã«ãã·ã¹ãã ãåºåããèŠçŽæã®åããŒã¯ã³ããã¯ãã«ã«å€æãããã®ãyãšããŸãïŒè«æäžã§ã¯x^ã§ããããä»åèšäºãæžããæã«èªã¿ã«ãããšæããã®ã§yã«å€æŽããŠããŸãïŒã äžèšã«èšç®åŒã瀺ããŸãã åçŸçãšé©åçãèšç®ããåŸã«ããã®èª¿åå¹³åãæ±ããŸãã æ°åŒãããå³ã䜿ã£ã説æã®æ¹ãçŽæçã§åããããããããããŸãããäžèšã«[Zhang* 20a]ã®å³ãåŒçšããBERTScoreã®æŠèŠã瀺ããŸããContextual Embeddingã®éšåã«çœ®ããããã£ã©ã¯ã¿ã¯ã»ãµãã¹ããªãŒãã«ç»å Žãã Bert ã§ããImportance Weightingã®éšåã¯äžã®æé ã§ã¯èª¬æãçç¥ããéšåã§ããåºæ¬çã«ã¯BERTScoreã¯åããŒã¯ã³ã«éã¿ãä»ããããšã¯ããŸããããidfãªã©ã䜿çšããŠéã¿ä»ãããããšãã§ããŸãã ãŸãã[Zhao 19]ã®å³ã瀺ããŸãããã¡ãã®æ¹ãBERTScoreã®æŠèŠãçè§£ãããããããããŸãããéè²ã®ãSystemããã·ã¹ãã ãåºåããèŠçŽæã§ããããªã¬ã³ãžè²ã®ãRefããæ£è§£ãšå®çŸ©ãããèŠçŽæã§ããBERTScoreã§ã¯ãguyãšmanãããã¯boatãšcanoeãªã©ã®é¡äŒŒããèªãæ±ãããšãã§ããåçŽã«å
±éãªåèªæ°ãæ°ãããããããæ£ç¢ºãªè©äŸ¡ãæåŸ
ã§ããŸãã FEQA [Durmus 20]ã®FEQAã¯è³ªåå¿çã·ã¹ãã ãå©çšããææšã§ãããfactual consistencyãšãã芳ç¹ã§èŠçŽãè©äŸ¡ããŸããèšãæããã°ãã·ã¹ãã ãçæããèŠçŽæã®å
容ããèŠçŽåã®ææžã®å
容ã«ã©ããããè¿ãããè©äŸ¡ããŠããŸããäžèšã«ã[Durmus 20]ã®å³ãåŒçšããfactual consistencyãæ¬ ããèŠçŽã®äŸã瀺ããŸããããã§ã¯ãèŠçŽåã®ææžã«ãbornããšæžãããŠããŸãããèŠçŽæã¯ãdiedããšæžããŸããããã®åèªã®éãã¯å
容ã«å€§ãã圱é¿ãäžããŸãã FEQAã¯3ã€ã®ã¹ãããããæ§æãããŠããŸããã¯ããã«ã·ã¹ãã ãåºåããèŠçŽæã®ãããã¬ãŒãºã[MASK]ã«çœ®æããŸããæ¬¡ã«[MASK]ãçãã«ãªããããªè³ªåãçæããŸããæåŸã«è³ªåãšèŠçŽåã®ææžã質åå¿çã·ã¹ãã ã«å
¥åãã眮æåã®ãã¬ãŒãºãçããšããŠåºåãããã確èªããŸãã [Durmus 20]ã®å³ãäžèšã«åŒçšãããã®ææšã®èšç®äŸã瀺ããŸãããThe home was built for inspection.ããšããæãã·ã¹ãã ãçæããèŠçŽæã§ããããããããQ1: What was the home built for?ããQ2: What was built for inspection?ããšãã 2ã€ã®è³ªåãäœæãããŸããããããã®è³ªåã«å¯Ÿãã質åå¿çã·ã¹ãã ã®åºåã¯ãA1â: former australian prime minister malcolm fraser and his wifeããA2â: the homeãã§ãããçæ¹ã¯æåŸ
ããããã®ãšç°ãªããŸãã åã¹ãããã®å®è£
ã«ã€ããŠãç°¡åã«ç޹ä»ããŸããã¯ããã®ã¹ãããã§ã¯åºæè¡šçŸæœåºã奿§é è§£æåšïŒconstituency parserïŒã䜿çšããŠ[MASK]ã«çœ®æããç®æãæ¢ããŸããæ¬¡ã®ã¹ãããã§ã¯ã QA2DããŒã¿ã»ãã ã§èšç·Žããseq2seqã¢ãã«ã䜿çšãããŸããæåŸã®ã¹ãããã§ã¯ã SQuAD (Stanford Question Answering Dataset)ã§ãã¡ã€ã³ãã¥ãŒãã³ã°ããBERTã䜿çšããŸãã å®è£
ã¯å
¬éãããŠããŸãã FactSumm FactSummã¯ããªãã«æœåºãå©çšããææšã§ãããfactual consistencyãè©äŸ¡ããŸããããªãã«ãšã¯ã2ã€ã®ãªããžã§ã¯ããšãããã®é¢ä¿ã®3ã€ããæ§æãããããŒã¿ã®è¡šçŸæ¹æ³ã®äžçš®ã§ããFactSummã¯ãèŠçŽæãšèŠçŽåã®ææžã®åã
ã«ããªãã«æœåºãé©çšããŠããã®çµæãæ¯èŒããããšã§è©äŸ¡ãè¡ããŸããFactSummã¯è«æãšããŠå
¬éãããŠãããã GitHub ã§ææžãšå®è£
ãå
¬éãããŠããŸãã äžèšã«FactSummã®GitHubã¬ããžããªããå³ãåŒçšãããã®åŠçã®æŠèŠã瀺ããŸããèŠçŽåã®ææžããã¯ãïŒInception, is, science fiction filmïŒãšããããªãã«ãæœåºãããèŠçŽæããã¯ïŒInception, is, action filmïŒãšããããªãã«ãæœåºãããŸããããã®2ã€ã¯ç°ãªãã®ã§ãèŠçŽæã¯factual consistencyãæ¬ ããŠãããšèšããŸãã ãŸãšã ãã®èšäºã§ã¯äžèšã®ããšãè¡ããŸãããåŸç·šã§ã¯ãæè¿ã®å¯Ÿè©±èŠçŽææ³ã«ã€ããŠæžãäºå®ã§ãã ãªãŒãã³ãã¡ã€ã³å¯Ÿè©±èŠçŽã®ããŒã¿ã»ãããšããŠãããã£ããããæ¥åžžäŒè©±ããTVçªçµã»ã€ã³ã¿ãã¥ãŒãã®3ã€ã®ã«ããŽãªãåãäžããŸããã ã¿ã¹ã¯æåã®å¯Ÿè©±èŠçŽã®ããŒã¿ã»ãããšããŠããäŒè°ããã¡ãŒã«ããå»çããã«ã¹ã¿ããŒãµãŒãã¹ãã®4ã€ã®ã«ããŽãªãåãäžããŸããã ROUGEã»Bleuã»chrFã»BERTScoreã»FEQAã»FactSummãåãäžããŸãããFEQAã»FactSummã¯ãfactual consistencyãè©äŸ¡ããææšã§ããããããŸã§çšããããŠããåèªã®ãªãŒããŒã©ããã«åºã¥ãææšãšã¯å€§ããç°ãªããŸãã åèæç® [Carletta 05] Carletta, J., Ashby, S., Bourban, S., Flynn, M., Guillemot, M., Hain, T., Kadlec, J., Karaiskos, V., Kraaij, W., Kronenthal, M., Lathoud, G., Lincoln, M., Lisowska, A., McCowan, I., Post, W., Reidsma, D., and Wellner, P.: The AMI Meeting Corpus: A PreAnnouncement, in Proceedings of the Second International Conference on Machine Learning for Multimodal Interaction, MLMIâ05, pp. 28â39, Berlin, Heidelberg (2005), Springer-Verlag [Chen 20] Chen, M., Liu, R., Shen, L., Yuan, S., Zhou, J., Wu, Y., He, X., and Zhou, B.: The JDDC Corpus: A LargeScale Multi-Turn Chinese Dialogue Dataset for E-commerce Customer Service, in Proceedings of the Twelfth Language Resources and Evaluation Conference, pp. 459â466, Marseille, France (2020), European Language Resources Association [Chen 21] Chen, Y., Liu, Y., and Zhang, Y.: DialogSum Challenge: Summarizing Real-Life Scenario Dialogues, in Proceedings of the 14th International Conference on Natural Language Generation, pp. 308â313, Aberdeen, Scotland, UK (2021), Association for Computational Linguistics [Chen 22] Chen, M., Chu, Z., Wiseman, S., and Gimpel, K.: SummScreen: A Dataset for Abstractive Screenplay Summarization, in Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 8602â8615, Dublin, Ireland (2022), Association for Computational Linguistics [Craswell06] Craswell, N., Vries, A., and Soboroff, I.: Overview of the TREC-2005 Enterprise Track, Text Retrieval Conference (TREC), , USA (2006) [Cui 20] Cui, L., Wu, Y., Liu, S., Zhang, Y., and Zhou, M.: MuTual: A Dataset for Multi-Turn Dialogue Reasoning, in Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, pp. 1406â1416, Online (2020), Association for Computational Linguistics [Durmus 20] Durmus, E., He, H., and Diab, M.: FEQA: A Question Answering Evaluation Framework for Faithfulness Assessment in Abstractive Summarization, in Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, pp. 5055â5070, Online (2020), Association for Computational Linguistics [Feigenblat 21] Feigenblat, G., Gunasekara, C., Sznajder, B., Joshi, S., Konopnicki, D., and Aharonov, R.: TWEETSUMM A Dialog Summarization Dataset for Customer Service, in Findings of the Association for Computational Linguistics: EMNLP 2021, pp. 245â260, Punta Cana, Dominican Republic (2021), Association for Computational Linguistics [Gliwa 19] Gliwa, B., Mochol, I., Biesek, M., and Wawer, A.: SAMSum Corpus: A Human-annotated Dialogue Dataset for Abstractive Summarization, in Proceedings of the 2nd Workshop on New Frontiers in Summarization, pp. 70â79, Hong Kong, China (2019), Association for Computational Linguistics [Janin 03] Janin, A., Baron, D., Edwards, J., Ellis, D., Gelbart, D., Morgan, N., Peskin, B., Pfau, T., Shriberg, E., Stolcke, A., and Wooters, C.: The ICSI Meeting Corpus, in 2003 IEEE International Conference on Acoustics, Speech, and Signal Processing, 2003. Proceedings. (ICASSP â03)., Vol. 1, pp. IâI (2003) [Jia 22] Jia, Q., Ren, S., Liu, Y., and Zhu, K. Q.: Taxonomy of Abstractive Dialogue Summarization: Scenarios, Approaches and Future Directions (2022) [Klimt 04] Klimt, B. and Yang, Y.: The Enron Corpus: A New Dataset for Email Classification Research, in Proceedings of the 15th European Conference on Machine Learning, ECMLâ04, pp. 217â226, Berlin, Heidelberg (2004), SpringerVerlag [Li 17] Li, Y., Su, H., Shen, X., Li, W., Cao, Z., and Niu, S.: DailyDialog: A Manually Labelled Multi-turn Dialogue Dataset, in Proceedings of the Eighth International Joint Conference on Natural Language Processing (Volume 1: Long Papers), pp. 986â995, Taipei, Taiwan (2017), Asian Federation of Natural Language Processing [Lin 04] Lin, C.-Y.: ROUGE: A Package for Automatic Evaluation of Summaries, in Text Summarization Branches Out, pp. 74â81, Barcelona, Spain (2004), Association for Computational Linguistics [Lin 21] Lin, H., Ma, L., Zhu, J., Xiang, L., Zhou, Y., Zhang, J., and Zong, C.: CSDS: A Fine-Grained Chinese Dataset for Customer Service Dialogue Summarization, in Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing, pp. 4436â4451, Online and Punta Cana, Dominican Republic (2021), Association for Computational Linguistics [Liu 19] Liu, C., Wang, P., Xu, J., Li, Z., and Ye, J.: Automatic dialogue summary generation for customer service, in Proceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining, pp. 1957â 1965 (2019) [Mehnaz 21] Mehnaz, L., Mahata, D., Gosangi, R., Gunturi, U. S., Jain, R., Gupta, G., Kumar, A., Lee, I. G., Acharya, A., and Shah, R. R.: GupShup: Summarizing Open-Domain Code-Switched Conversations, in Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing, pp. 6177â6192, Online and Punta Cana, Dominican Republic (2021), Association for Computational Linguistics [Papineni 02] Papineni, K., Roukos, S., Ward, T., and Zhu, W.-J.: Bleu: a Method for Automatic Evaluation of Machine Translation, in Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, pp. 311â318, Philadelphia, Pennsylvania, USA (2002), Association for Computational Linguistics [Popovi Ìc 15] Popovi Ìc, M.: chrF: character n-gram F-score for automatic MT evaluation, in Proceedings of the Tenth Workshop on Statistical Machine Translation, pp. 392â395, Lisbon, Portugal (2015), Association for Computational Linguistics [Song 20] Song, Y., Tian, Y., Wang, N., and Xia, F.: Summarizing Medical Conversations via Identifying Important Utterances, in Proceedings of the 28th International Conference on Computational Linguistics, pp. 717â729, Barcelona, Spain (Online) (2020), International Committee on Computational Linguistics [Sun 19] Sun, K., Yu, D., Chen, J., Yu, D., Choi, Y., and Cardie, C.: DREAM: A Challenge Data Set and Models for Dialogue-Based Reading Comprehension, Transactions of the Association for Computational Linguistics, Vol. 7, pp. 217â231 (2019) [Zhang 20a] Zhang , T., Kishore , V., Wu , F., Weinberger, K. Q., and Artzi, Y.: BERTScore: Evaluating Text Generation with BERT, in International Conference on Learning Representations (2020) [Zhang 20b] Zhang, Y., Jiang, Z., Zhang, T., Liu, S., Cao, J., Liu, K., Liu, S., and Zhao, J.: MIE: A Medical Information Extractor towards Medical Dialogues, in Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, pp. 6460â6469, Online (2020), Association for Computational Linguistics [Zhang 20c] Zhang, Y., Sun, S., Galley, M., Chen, Y.-C., Brockett, C., Gao, X., Gao, J., Liu, J., and Dolan, B.: DialoGPT: Large-Scale Generative Pre-training for Conversational Response Generation, in ACL, system demonstration (2020) [Zhang 21a] Zhang, S., Celikyilmaz, A., Gao, J., and Bansal, M.: EmailSum: Abstractive Email Thread Summarization, in Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers), pp. 6895â6909, Online (2021), Association for Computational Linguistics [Zhang 21b] Zhang, Y., Ni, A., Yu, T., Zhang, R., Zhu, C., Deb, B., Celikyilmaz, A., Awadallah, A. H., and Radev, D.: An Exploratory Study on Long Dialogue Summarization: What Works and Whatâs Next, in Empirical Methods in Natural Language Processing (EMNLP) 2021 (2021) [Zhao 19] Zhao, W., Peyrard, M., Liu, F., Gao, Y., Meyer, C. M., and Eger, S.: MoverScore: Text Generation Evaluating with Contextualized Embeddings and Earth Mover Distance, in Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP), pp. 563â578, Hong Kong, China (2019), Association for Computational Linguistics [Zhao 21] Zhao, L., Zheng, F., He, K., Zeng, W., Lei, Y., Jiang, H., Wu, W., Xu, W., Guo, J., and Meng, F.: TODSum: Task-Oriented Dialogue Summarization with State Tracking (2021) [Zhong 21] Zhong, M., Yin, D., Yu, T., Zaidi, A., Mutuma, M., Jha, R., Awadallah, A. H., Celikyilmaz, A., Liu, Y., Qiu, X., and Radev, D.: QMSum: A New Benchmark for Query-based Multi-domain Meeting Summarization, in Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, pp. 5905â5921, Online (2021), Association for Computational Linguistics [Zhu 21] Zhu, C., Liu, Y., Mei, J., and Zeng, M.: MediaSum: A Large-scale Media Interview Dataset for Dialogue Summarization, in Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, pp. 5927â5934, Online (2021), Association for Computational Linguistics [Zou 21a] Zou, Y., Lin, J., Zhao, L., Kang, Y., Jiang, Z., Sun, C., Zhang, Q., Huang, X., and Liu, X.: Unsupervised summarization for chat logs with topic-oriented ranking and context-aware auto-encoders, in Proceedings of the AAAI Conference on Artificial Intelligence, Vol. 35, pp. 14674â 14682 (2021) [Zou 21b] Zou, Y., Zhao, L., Kang, Y., Lin, J., Peng, M., Jiang, Z., Sun, C., Zhang, Q., Huang, X., and Liu, X.: Topic-oriented spoken dialogue summarization for customer service with saliency-aware topic modeling, in Proceedings of the AAAI Conference on Artificial Intelligence, Vol. 35, pp. 14665â14673 (2021)