{"data":{"id":"10.6084/m9.figshare.6477782.v3","type":"dois","attributes":{"doi":"10.6084/m9.figshare.6477782.v3","prefix":"10.6084","suffix":"m9.figshare.6477782.v3","identifiers":[],"alternateIdentifiers":[],"creators":[{"name":"Rajat Singh","affiliation":[],"nameIdentifiers":[]},{"name":"Nurendra Choudhary","affiliation":[],"nameIdentifiers":[]}],"titles":[{"title":"Twitter corpus of Resource-Scarce Languages for Sentiment Analysis and Multilingual Emoji Prediction"}],"publisher":"figshare","container":{},"publicationYear":2018,"subjects":[{"subject":"200315 Indian Languages","subjectScheme":"FOR"},{"subject":"FOS: Languages and literature","schemeUri":"http://www.oecd.org/science/inno/38235147.pdf","subjectScheme":"Fields of Science and Technology (FOS)"},{"subject":"FOS: Languages and literature","subjectScheme":"Fields of Science and Technology (FOS)"},{"subject":"80107 Natural Language Processing","subjectScheme":"FOR"},{"subject":"FOS: Computer and information sciences","schemeUri":"http://www.oecd.org/science/inno/38235147.pdf","subjectScheme":"Fields of Science and Technology (FOS)"},{"subject":"FOS: Computer and information sciences","subjectScheme":"Fields of Science and Technology (FOS)"}],"contributors":[],"dates":[{"date":"2018-06-11","dateType":"Created"},{"date":"2018-06-11","dateType":"Updated"},{"date":"2018","dateType":"Issued"}],"language":null,"types":{"ris":"DATA","bibtex":"misc","citeproc":"dataset","schemaOrg":"Dataset","resourceType":"Dataset","resourceTypeGeneral":"Dataset"},"relatedIdentifiers":[{"relationType":"IsPreviousVersionOf","relatedIdentifier":"10.6084/m9.figshare.6477782","relatedIdentifierType":"DOI"}],"relatedItems":[],"sizes":["88712586 Bytes"],"formats":[],"version":null,"rightsList":[{"rights":"Creative Commons Attribution 4.0 International","rightsUri":"https://creativecommons.org/licenses/by/4.0/legalcode","schemeUri":"https://spdx.org/licenses/","rightsIdentifier":"cc-by-4.0","rightsIdentifierScheme":"SPDX"}],"descriptions":[{"description":"This dataset is created by leveraging the social media platforms such as twitter for developing corpus across multiple languages. The corpus creation methodology is applicable for resource-scarce languages provided the speakers of that particular language are active users on social media platforms. We present an approach to extract social media microblogs such as tweets (Twitter). We created corpus for multilingual sentiment analysis and emoji prediction in Hindi, Bengali and Telugu. Further, we perform and analyze multiple NLP tasks utilizing the corpus to get interesting observations.","descriptionType":"Abstract"}],"geoLocations":[],"fundingReferences":[],"xml":"PD94bWwgdmVyc2lvbj0iMS4wIiBlbmNvZGluZz0iVVRGLTgiPz4KPHJlc291cmNlIHhtbG5zPSJodHRwOi8vZGF0YWNpdGUub3JnL3NjaGVtYS9rZXJuZWwtNCIgeG1sbnM6eHNpPSJodHRwOi8vd3d3LnczLm9yZy8yMDAxL1hNTFNjaGVtYS1pbnN0YW5jZSIgeHNpOnNjaGVtYUxvY2F0aW9uPSJodHRwOi8vZGF0YWNpdGUub3JnL3NjaGVtYS9rZXJuZWwtNCBodHRwOi8vc2NoZW1hLmRhdGFjaXRlLm9yZy9tZXRhL2tlcm5lbC00LjEvbWV0YWRhdGEueHNkIj4KICA8aWRlbnRpZmllciBpZGVudGlmaWVyVHlwZT0iRE9JIj4xMC42MDg0L005LkZJR1NIQVJFLjY0Nzc3ODIuVjM8L2lkZW50aWZpZXI+CiAgPGNyZWF0b3JzPgogICAgPGNyZWF0b3I+CiAgICAgIDxjcmVhdG9yTmFtZT5SYWphdCBTaW5naDwvY3JlYXRvck5hbWU+CiAgICA8L2NyZWF0b3I+CiAgICA8Y3JlYXRvcj4KICAgICAgPGNyZWF0b3JOYW1lPk51cmVuZHJhIENob3VkaGFyeTwvY3JlYXRvck5hbWU+CiAgICA8L2NyZWF0b3I+CiAgPC9jcmVhdG9ycz4KICA8dGl0bGVzPgogICAgPHRpdGxlPlR3aXR0ZXIgY29ycHVzIG9mIFJlc291cmNlLVNjYXJjZSBMYW5ndWFnZXMgZm9yIFNlbnRpbWVudCBBbmFseXNpcyBhbmQgTXVsdGlsaW5ndWFsIEVtb2ppIFByZWRpY3Rpb248L3RpdGxlPgogIDwvdGl0bGVzPgogIDxkZXNjcmlwdGlvbnM+CiAgICA8ZGVzY3JpcHRpb24gZGVzY3JpcHRpb25UeXBlPSJBYnN0cmFjdCI+VGhpcyBkYXRhc2V0IGlzIGNyZWF0ZWQgYnkgbGV2ZXJhZ2luZyB0aGUgc29jaWFsIG1lZGlhIHBsYXRmb3JtcyBzdWNoIGFzIHR3aXR0ZXIgZm9yIGRldmVsb3BpbmcgY29ycHVzIGFjcm9zcyBtdWx0aXBsZSBsYW5ndWFnZXMuIFRoZSBjb3JwdXMgY3JlYXRpb24gbWV0aG9kb2xvZ3kgaXMgYXBwbGljYWJsZSBmb3IgcmVzb3VyY2Utc2NhcmNlIGxhbmd1YWdlcyBwcm92aWRlZCB0aGUgc3BlYWtlcnMgb2YgdGhhdCBwYXJ0aWN1bGFyIGxhbmd1YWdlIGFyZSBhY3RpdmUgdXNlcnMgb24gc29jaWFsIG1lZGlhIHBsYXRmb3Jtcy4gV2UgcHJlc2VudCBhbiBhcHByb2FjaCB0byBleHRyYWN0IHNvY2lhbCBtZWRpYSBtaWNyb2Jsb2dzIHN1Y2ggYXMgdHdlZXRzIChUd2l0dGVyKS4gV2UgY3JlYXRlZCBjb3JwdXMgZm9yIG11bHRpbGluZ3VhbCBzZW50aW1lbnQgYW5hbHlzaXMgYW5kIGVtb2ppIHByZWRpY3Rpb24gaW4gSGluZGksIEJlbmdhbGkgYW5kIFRlbHVndS4gRnVydGhlciwgd2UgcGVyZm9ybSBhbmQgYW5hbHl6ZSBtdWx0aXBsZSBOTFAgdGFza3MgdXRpbGl6aW5nIHRoZSBjb3JwdXMgdG8gZ2V0IGludGVyZXN0aW5nIG9ic2VydmF0aW9ucy48L2Rlc2NyaXB0aW9uPgogIDwvZGVzY3JpcHRpb25zPgogIDxzdWJqZWN0cz4KICAgIDxzdWJqZWN0IHNjaGVtZVVSST0iaHR0cDovL3d3dy5hYnMuZ292LmF1L2F1c3N0YXRzL2Fic0AubnNmLzAvNkJCNDI3QUI5Njk2QzIyNUNBMjU3NDE4MDAwNDQ2M0UiIHN1YmplY3RTY2hlbWU9IkZPUiI+MjAwMzE1IEluZGlhbiBMYW5ndWFnZXM8L3N1YmplY3Q+CiAgICA8c3ViamVjdCBzY2hlbWVVUkk9Imh0dHA6Ly93d3cuYWJzLmdvdi5hdS9hdXNzdGF0cy9hYnNALm5zZi8wLzZCQjQyN0FCOTY5NkMyMjVDQTI1NzQxODAwMDQ0NjNFIiBzdWJqZWN0U2NoZW1lPSJGT1IiPjgwMTA3IE5hdHVyYWwgTGFuZ3VhZ2UgUHJvY2Vzc2luZzwvc3ViamVjdD4KICA8L3N1YmplY3RzPgogIDxwdWJsaXNoZXI+Zmlnc2hhcmU8L3B1Ymxpc2hlcj4KICA8cHVibGljYXRpb25ZZWFyPjIwMTg8L3B1YmxpY2F0aW9uWWVhcj4KICA8ZGF0ZXM+CiAgICA8ZGF0ZSBkYXRlVHlwZT0iQ3JlYXRlZCI+MjAxOC0wNi0xMTwvZGF0ZT4KICAgIDxkYXRlIGRhdGVUeXBlPSJVcGRhdGVkIj4yMDE4LTA2LTExPC9kYXRlPgogIDwvZGF0ZXM+CiAgPHJlc291cmNlVHlwZSByZXNvdXJjZVR5cGVHZW5lcmFsPSJEYXRhc2V0Ij5EYXRhc2V0PC9yZXNvdXJjZVR5cGU+CiAgPHNpemVzPgogICAgPHNpemU+ODg3MTI1ODYgQnl0ZXM8L3NpemU+CiAgPC9zaXplcz4KICA8cmVsYXRlZElkZW50aWZpZXJzPgogICAgPHJlbGF0ZWRJZGVudGlmaWVyIHJlbGF0ZWRJZGVudGlmaWVyVHlwZT0iRE9JIiByZWxhdGlvblR5cGU9IklzUHJldmlvdXNWZXJzaW9uT2YiPjEwLjYwODQvbTkuZmlnc2hhcmUuNjQ3Nzc4MjwvcmVsYXRlZElkZW50aWZpZXI+CiAgPC9yZWxhdGVkSWRlbnRpZmllcnM+CiAgPHJpZ2h0c0xpc3Q+CiAgICA8cmlnaHRzIHJpZ2h0c1VSST0iaHR0cHM6Ly9jcmVhdGl2ZWNvbW1vbnMub3JnL2xpY2Vuc2VzL2J5LzQuMC8iPkNDIEJZIDQuMDwvcmlnaHRzPgogIDwvcmlnaHRzTGlzdD4KPC9yZXNvdXJjZT4=","url":"https://figshare.com/articles/Twitter_corpus_of_Resource-Scarce_Languages_for_Sentiment_Analysis_and_Multilingual_Emoji_Prediction/6477782/3","contentUrl":null,"metadataVersion":5,"schemaVersion":"http://datacite.org/schema/kernel-4","source":"mds","isActive":true,"state":"findable","reason":null,"viewCount":0,"viewsOverTime":[],"downloadCount":0,"downloadsOverTime":[],"referenceCount":0,"citationCount":0,"citationsOverTime":[],"partCount":0,"partOfCount":0,"versionCount":0,"versionOfCount":0,"created":"2018-06-11T11:35:38.000Z","registered":"2018-06-11T11:35:38.000Z","published":"2018","updated":"2020-08-29T10:00:34.000Z"},"relationships":{"client":{"data":{"id":"figshare.ars","type":"clients"}},"provider":{"data":{"id":"otjm","type":"providers"}},"media":{"data":{"id":"10.6084/m9.figshare.6477782.v3","type":"media"}},"references":{"data":[]},"citations":{"data":[]},"parts":{"data":[]},"partOf":{"data":[]},"versions":{"data":[]},"versionOf":{"data":[]}}}}